Jeden Prompt an die API eines anderen zu senden ist in Ordnung — bis es das nicht ist. Vielleicht sind die Daten sensibel und du würdest bevorzugen, dass sie nie deinen Server verlassen. Vielleicht bist du müde von Rate-Limits oder davon, dass eine Modell-Version sich unter deinen Füßen ändert, oder von einem Pro-Token-Zähler, der tickt, während du experimentierst. Irgendwann hört „was, wenn ich einfach meinen eigenen betreibe?“ auf, ein Gedankenexperiment zu sein.
Ollama macht das wirklich einfach. Die schwierigere Frage ist, was auf einen VPS passt — und hier zählt die ehrliche Antwort mehr als der Hype.
Was du tatsächlich auf CPU betreiben kannst
Keine GPU? Dann machst du CPU-Inferenz, und die Modellgröße ist alles. Quantisierung (die Gewichte auf 4-Bit herunterzuquetschen) ist, was das praktisch macht — du verlierst einen Splitter Qualität und sparst einen Haufen Speicher.
Grobe Zahlen, die, die zählen:
- 3B-Modell, 4-Bit — ~3 GB RAM. Flott genug für Chat und einfache Aufgaben.
- 7B-Modell, 4-Bit — ~5 GB RAM. Der Sweetspot: merklich klüger, läuft immer noch in lesbarem Tempo.
- 13B und aufwärts — 8–10 GB+ und langsam auf CPU. Technisch möglich, praktisch ärgerlich.
Geschwindigkeit, ehrlich: auf ein paar vCPUs siehst du eine Handvoll Tokens pro Sekunde. Perfekt in Ordnung für einen Chatbot oder einen Coding-Assistenten, bei dem du liest, während er tippt. Nicht in Ordnung für die Batch-Verarbeitung einer Million Dokumente — das ist ein GPU-Job, und wir tun nicht so, als wäre es anders. Wir bieten keine GPU-Instanzen an. Wenn dein Plan ein 70B-Modell oder schweren Durchsatz braucht, ist ein CPU-VPS — unserer oder der von irgendjemandem — das falsche Werkzeug, und das solltest du wissen, bevor du einen Cent ausgibst.
Aber ein privates 7B, das deine Fragen beantwortet und nie nach Hause telefoniert? Das läuft bequem auf einer 6-GB-Maschine.
Die Installation — drei Befehle
Fahr den Server hoch, logg dich per SSH ein und:
curl -fsSL https://ollama.com/install.sh | sh # installiert Ollama
ollama run llama3.2:3b # zieht + betreibt ein 3B-Modell
Das war's — du chattest im Terminal. Um es aus deinem eigenen Code zu nutzen, bedient Ollama bereits eine HTTP-API auf Port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Ein Fallstrick, den man vorab kennen sollte: standardmäßig bindet diese API an localhost. Halte es so und tunnle über SSH, oder es ist ins Internet offengelegt. Wenn du es erreichbar willst, stell es hinter Auth — lass keinen offenen Modell-Endpunkt auf einer öffentlichen IP.
Die Maschine wählen
Passe den Plan an das Modell an, nicht umgekehrt:
| Was du betreiben willst | RAM, das du brauchst | Sinnvoller Plan |
|---|---|---|
| 3B-Modell, leichte Nutzung | ~3 GB | Small (4 GB) |
| 7B-Modell, bequem | ~5–6 GB | Medium (6 GB) |
| Größer / hoher Durchsatz | GPU-Terrain | kein CPU-VPS |
Für die meisten Selbst-Hoster ist Medium (6 GB) die ehrliche Empfehlung — genug Spielraum für ein 7B-Modell plus deine App und das OS. Small (4 GB) funktioniert, wenn du bei 3B bleibst. Alles darunter ist zu eng, sobald das OS und der Kontext hineinfressen.
Warum es hier tun
Wenn du einen LLM selbst hostest, ist Privatsphäre meist die halbe Motivation — also wäre es seltsam, deinen Ausweis herzugeben, um die Maschine zu mieten. Musst du nicht: du kannst in USDC oder USDT zahlen (oder mit Karte über die Auffahrt), kein KYC, und der Server ist in etwa einer Minute deiner. Krypto-nativ, agent-freundlich, und die Daten bleiben auf einer Maschine, die du kontrollierst.
Der Kompromiss ist der, über den wir ehrlich waren: nur CPU, eine 6-GB-Obergrenze, kleine Modelle. Innerhalb dessen ist Selbst-Hosten großartig. Außerhalb dessen lass dir von niemandem eine CPU-Maschine für einen Job verkaufen, der eine GPU braucht.
Bereit zu versuchen? Wähle einen Plan, zahle, und du hast root in etwa 60 Sekunden — dann sind es drei Befehle zu deinem eigenen privaten Modell.
Kommentare
Noch keine Kommentare. Sei der Erste.