Sommerhitze — alles schmilzt, sogar unsere Preise.−25%−25 % auf jeden Jahresplan, bis 31. Aug.Pläne ansehen
EQVPS
Loslegen

VPS für Ollama und lokale LLMs

Hoste kleine Sprachmodelle auf einem CPU-Server selbst — privat, ungemessen, in Krypto bezahlt. Ehrlich darüber, was CPU-Inferenz kann und was nicht. Ab 12 $/Mon.

Bringen wir den enttäuschenden Teil aus dem Weg, denn das Internet ist voller Seiten, die das nicht tun.

Unsere Server sind nur CPU. Wir bieten keine GPUs an. Das bedeutet, lokale LLM-Arbeit hat hier eine harte Obergrenze, und etwas anderes vorzugeben würde nur dein Geld verschwenden.

Was tatsächlich auf CPU funktioniert

Mit bis zu 6 vCPU und 6 GB RAM (unser Medium-Plan — 12 $/Mon.) bist du im Bereich kleiner quantisierter Modelle:

Wenn du einen schnellen, interaktiven 70B-Chat brauchst, brauchst du einen GPU-Host — das ist ein anderes Produkt von einem anderen Anbieter, und wir sagen es dir lieber, als deine 12 $ zu nehmen.

Wo eine CPU-Maschine wirklich gewinnt

Privatsphäre. Deine Dokumente, deine Prompts, deine Embeddings — verlassen nie eine Maschine, die du kontrollierst, werden nie jemandes Trainingsdaten. Für viele ist das der ganze Punkt, und ein paar Tokens pro Sekunde sind ein akzeptabler Tausch.

Kostenvorhersehbarkeit. Keine Pro-Token-Rechnung. Eine Pipeline, die fünfzigtausend Datensätze klassifiziert, kostet dasselbe wie eine, die fünfzig klassifiziert: 12 $.

Asynchrone Arbeit. Die meiste nützliche LLM-Arbeit ist kein Chat-Fenster. Es ist eine Warteschlange: fasse diese zusammen, tagge jene, embette diesen Korpus. Eine CPU-Maschine, die über Nacht einen Rückstand durchmahlt, ist darin perfekt gut.

Einrichtung

# Ubuntu 24.04 — Medium-Plan empfohlen
curl -fsSL https://ollama.com/install.sh | sh

# Beginne mit etwas Kleinem und sieh selbst
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — der Sweetspot für CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama bedient eine HTTP-API auf localhost:11434. Halte sie dort. Wenn du sie von anderswo erreichen musst, stell sie hinter einen Reverse-Proxy mit Authentifizierung auf einem Plan mit dedizierter IP — lege nie einen unauthentifizierten Modell-Endpunkt ins offene Internet.

Kombiniere sie mit einer Vektordatenbank (Qdrant oder pgvector in Docker) und du hast einen kompletten privaten RAG-Stack auf einer 12-$-Maschine. Diese Kombination — kleine lokale Embeddings, lokaler Vektorspeicher, externe API nur für den schweren Generierungsschritt — ist das Setup, das auf Hardware wie dieser tatsächlich Sinn ergibt.

Einen Plan wählen

NutzungPlanPreis
Embeddings, 1–3B-Modelle, RAG-PipelineMedium12 $/Mon.
Dasselbe, plus ein öffentlicher Endpunkt hinter AuthMedium-IP20 $/Mon.
Nur kleine Modelle testenSmall8 $/Mon.

Nur CPU, bis zu 6 vCPU und 6 GB RAM. NVMe-Speicher, ungemessener Traffic, Deutschland oder Finnland. Krypto-Zahlung, kein KYC. Jährliche Abrechnung ist ein Transfer statt zwölf.

Verwandte Lektüre


Bereit? Stelle einen Server bereit → — live in etwa einer Minute, in Krypto bezahlt, kein Ausweis nötig.

Bereit zum Bereitstellen? Zahle in Krypto, ohne KYC — online in etwa einer Minute.

Bereitstellen →

FAQ

Kann ich Llama 70B darauf betreiben?

Nein. Unsere Pläne sind nur CPU mit bis zu 6 GB RAM — das ist der Bereich kleiner quantisierter Modelle (grob 1B–8B bei 4-Bit). Ein 70B-Modell braucht eine GPU und weit mehr Speicher. Wir bieten keine GPUs an, und wir sagen das lieber, als dir eine Enttäuschung zu verkaufen.

Wie schnell ist CPU-Inferenz wirklich?

Erwarte ein paar Tokens pro Sekunde bei einem 7–8B-Modell mit 4-Bit-Quantisierung, und merklich besser bei 1–3B-Modellen. Das ist gut für Hintergrund-Jobs, Embeddings, Klassifizierung und asynchrone Pipelines. Es ist nicht gut für einen flotten interaktiven Chat.

Wofür ist das also tatsächlich gut?

Private Embeddings, Klassifizierung, Zusammenfassungs-Warteschlangen, RAG-Pipelines, bei denen Latenz keine Rolle spielt, und Daten von Drittanbieter-APIs fernhalten. Außerdem: Lernen, Testen und Prototyping, bevor du irgendwo eine GPU mietest.

Fragt ihr nach einem Ausweis?

Nein. E-Mail zum Registrieren, USDC oder USDT zum Bezahlen. Was oft der Grund ist, warum Leute überhaupt ein privates Modell wollen.

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.