Sommerhitze — alles schmilzt, sogar unsere Preise.−25%−25 % auf jeden Jahresplan, bis 31. Aug.Pläne ansehen
EQVPS
Loslegen

Einen lokalen LLM auf einem VPS mit Ollama selbst hosten — was wirklich funktioniert

14. Juni 2026 · 3 Min. Lesezeit · EQVPS Team

Jeden Prompt an die API eines anderen zu senden ist in Ordnung — bis es das nicht ist. Vielleicht sind die Daten sensibel und du würdest bevorzugen, dass sie nie deinen Server verlassen. Vielleicht bist du müde von Rate-Limits oder davon, dass eine Modell-Version sich unter deinen Füßen ändert, oder von einem Pro-Token-Zähler, der tickt, während du experimentierst. Irgendwann hört „was, wenn ich einfach meinen eigenen betreibe?“ auf, ein Gedankenexperiment zu sein.

Ollama macht das wirklich einfach. Die schwierigere Frage ist, was auf einen VPS passt — und hier zählt die ehrliche Antwort mehr als der Hype.

Was du tatsächlich auf CPU betreiben kannst

Keine GPU? Dann machst du CPU-Inferenz, und die Modellgröße ist alles. Quantisierung (die Gewichte auf 4-Bit herunterzuquetschen) ist, was das praktisch macht — du verlierst einen Splitter Qualität und sparst einen Haufen Speicher.

Grobe Zahlen, die, die zählen:

Geschwindigkeit, ehrlich: auf ein paar vCPUs siehst du eine Handvoll Tokens pro Sekunde. Perfekt in Ordnung für einen Chatbot oder einen Coding-Assistenten, bei dem du liest, während er tippt. Nicht in Ordnung für die Batch-Verarbeitung einer Million Dokumente — das ist ein GPU-Job, und wir tun nicht so, als wäre es anders. Wir bieten keine GPU-Instanzen an. Wenn dein Plan ein 70B-Modell oder schweren Durchsatz braucht, ist ein CPU-VPS — unserer oder der von irgendjemandem — das falsche Werkzeug, und das solltest du wissen, bevor du einen Cent ausgibst.

Aber ein privates 7B, das deine Fragen beantwortet und nie nach Hause telefoniert? Das läuft bequem auf einer 6-GB-Maschine.

Die Installation — drei Befehle

Fahr den Server hoch, logg dich per SSH ein und:

curl -fsSL https://ollama.com/install.sh | sh   # installiert Ollama
ollama run llama3.2:3b                            # zieht + betreibt ein 3B-Modell

Das war's — du chattest im Terminal. Um es aus deinem eigenen Code zu nutzen, bedient Ollama bereits eine HTTP-API auf Port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Ein Fallstrick, den man vorab kennen sollte: standardmäßig bindet diese API an localhost. Halte es so und tunnle über SSH, oder es ist ins Internet offengelegt. Wenn du es erreichbar willst, stell es hinter Auth — lass keinen offenen Modell-Endpunkt auf einer öffentlichen IP.

Die Maschine wählen

Passe den Plan an das Modell an, nicht umgekehrt:

Was du betreiben willstRAM, das du brauchstSinnvoller Plan
3B-Modell, leichte Nutzung~3 GBSmall (4 GB)
7B-Modell, bequem~5–6 GBMedium (6 GB)
Größer / hoher DurchsatzGPU-Terrainkein CPU-VPS

Für die meisten Selbst-Hoster ist Medium (6 GB) die ehrliche Empfehlung — genug Spielraum für ein 7B-Modell plus deine App und das OS. Small (4 GB) funktioniert, wenn du bei 3B bleibst. Alles darunter ist zu eng, sobald das OS und der Kontext hineinfressen.

Warum es hier tun

Wenn du einen LLM selbst hostest, ist Privatsphäre meist die halbe Motivation — also wäre es seltsam, deinen Ausweis herzugeben, um die Maschine zu mieten. Musst du nicht: du kannst in USDC oder USDT zahlen (oder mit Karte über die Auffahrt), kein KYC, und der Server ist in etwa einer Minute deiner. Krypto-nativ, agent-freundlich, und die Daten bleiben auf einer Maschine, die du kontrollierst.

Der Kompromiss ist der, über den wir ehrlich waren: nur CPU, eine 6-GB-Obergrenze, kleine Modelle. Innerhalb dessen ist Selbst-Hosten großartig. Außerhalb dessen lass dir von niemandem eine CPU-Maschine für einen Job verkaufen, der eine GPU braucht.

Bereit zu versuchen? Wähle einen Plan, zahle, und du hast root in etwa 60 Sekunden — dann sind es drei Befehle zu deinem eigenen privaten Modell.

FAQ

Kann ich einen LLM ohne GPU betreiben?

Ja, für kleine Modelle. Ein 3B- oder 7B-Modell in 4-Bit-Quantisierung läuft auf CPU und antwortet in lesbarem Tempo — gut für einen Chatbot, einen Coding-Helfer oder Hintergrundaufgaben, bei denen du nicht den Cursor beobachtest. Was du auf CPU nicht tun kannst, ist ein großes Modell (13B und aufwärts) zu bedienen oder hohen Durchsatz zu drücken; da hört eine GPU auf, optional zu sein.

Wie viel RAM brauche ich für Llama 7B?

Rund 5 GB für ein 4-Bit-7B-Modell, sobald du das Kontextfenster und das OS dazurechnest — also ist eine 6-GB-Maschine der bequeme Boden. Ein 3B-Modell passt in etwa 3 GB. Kleinere Quantisierung (Q4) tauscht ein wenig Qualität gegen viel weniger Speicher, was auf einem VPS der richtige Tausch ist.

Ist das Selbst-Hosten eines LLM günstiger als eine API?

Es hängt vom Volumen ab. Eine gehostete API berechnet pro Token und kostet nichts im Leerlauf; ein VPS ist eine flache monatliche Rechnung, ob du ihn nutzt oder nicht. Wenn du einen stetigen Strom von Anfragen betreibst oder es dir hauptsächlich um Privatsphäre und keine Rate-Limits geht, gewinnt Selbst-Hosten. Für gelegentliche Einmal-Prompts ist eine gemessene API günstiger.

Warum selbst hosten statt eine Cloud-API zu nutzen?

Drei Gründe, aus denen Leute es tatsächlich tun: die Daten verlassen nie deinen Server (real für juristisch, medizinisch oder einfach private Notizen), es gibt keine Rate-Limits oder Pro-Token-Zähler, und das Modell wird sich nicht ändern oder unter dir veraltet werden. Der Preis ist, dass du die Maschine verwaltest und innerhalb ihrer Hardware lebst.

Was ist das größte Modell, das ich realistisch auf einem CPU-VPS betreiben kann?

Ein 7B-Modell in 4-Bit ist der Sweetspot auf einer 6-GB-Maschine. Du kannst technisch ein 13B mit genug RAM laden, aber auf CPU wird es langsam genug, dass du es spürst. Darüber hinaus willst du eine GPU, was eine andere Art Host ist.

← Zurück zum BlogPläne & Preise ansehen →

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.