Sommerhitze — alles schmilzt, sogar unsere Preise.−25%−25 % auf jeden Jahresplan, bis 31. Aug.Pläne ansehen
EQVPS
Loslegen

Lokale LLM-Inferenz privat hosten: was ein CPU-VPS kann und was nicht

9. Aug. 2026 · 3 Min. Lesezeit · EQVPS Team

Seien wir gleich ehrlich: wenn du schnelle, günstige, hochwertige Generierung willst, rufe eine API auf. Ein CPU-VPS wird ein Rechenzentrum voller GPUs nicht schlagen, und jeder, der dir etwas anderes erzählt, verkauft etwas.

Warum also überhaupt Inferenz selbst hosten? Ein Grund, und es ist ein guter: das Modell auf deinem Server sendet deine Prompts nie irgendwohin.

Wie CPU-Inferenz tatsächlich aussieht

Du kannst echte Modelle auf CPU mit genug RAM betreiben. Ein 7–8B-Modell, auf 4-Bit quantisiert, funktioniert. Ein 13B funktioniert. Du kannst sogar ein Modell der 30B-Klasse ansteuern, wenn du den Speicher hast. Was du nicht tun kannst, ist, es schnell zu machen — die Ausgabe kommt mit ein paar Tokens pro Sekunde, nicht im sofortigen Strom, den eine API gibt.

Das ist der ehrliche Kompromiss. Für interaktiven Chat ist es frustrierend. Für Hintergrundarbeit — Dokumente über Nacht zusammenfassen, eine Warteschlange klassifizieren, Daten nach Zeitplan anreichern — sind ein paar Tokens pro Sekunde völlig in Ordnung, und niemand schaut auf die Uhr.

Die RAM-Rechnung

Das Modell muss im Speicher sitzen, quantisiert oder nicht, plus Overhead für Kontext und die Laufzeit:

Deshalb wird „ein lokales Modell betreiben“ still zu einer High-Memory-Frage. Das Modell ist der Speicher-Fußabdruck. Füge einen RAG-Index oder Agenten auf derselben Maschine hinzu und die Zahlen stapeln sich.

Ollama vs vLLM, kurz

Ollama ist die einfache Tür hinein — installieren, ollama run, fertig. Es ist das richtige Werkzeug für ein privates Einzelnutzer-Setup, bei dem du das Modell einfach verfügbar haben willst. vLLM ist für Serving-Durchsatz gebaut: mehr Einrichtung, besser unter gleichzeitiger Last, lohnt sich, wenn du tatsächlich Volumen handhabst. Beginne mit Ollama; greif zu vLLM, wenn du echten Traffic bedienst.

Wo Privacy-First wirklich gewinnt

Der Fall für selbst gehostete Inferenz ist nicht Geschwindigkeit oder Kosten — es ist, dass manche Daten nicht weg dürfen. Juristische Dokumente. Medizinische Aufzeichnungen. Proprietärer Code. Alles, wo das Senden des Prompts an eine Drittanbieter-API aus Policy- oder Vertrauensgründen vom Tisch ist. Ein langsameres Modell, das vollständig auf deiner Maschine läuft, schlägt ein schnelles, das alles loggt, was du ihm sendest.

Und wenn die Daten so sensibel sind, sollte die Zahlung wahrscheinlich auch privat sein. Die Maschine mit Krypto und ohne KYC zu mieten hält die ganze Kette — Server, Modell, Prompts, Abrechnung — aus den Identitätsaufzeichnungen aller heraus. Das ist der eigentliche Pitch: nicht „günstigere Inferenz“, sondern „Inferenz, die niemand sonst sehen kann“.

Fazit

Für Geschwindigkeit und Qualität nutze eine API — keine Schande dabei. Hoste selbst, wenn Privatsphäre die Anforderung und langsamer akzeptabel ist. Dimensioniere für das Modell plus seinen Kontext plus alles andere, das sich die Maschine teilt, und erwarte keine GPU-Geschwindigkeit von CPU.

Wenn das Modell echten Speicher braucht, betreibt die Pro-Linie 32 bis 80 GB mit einer dedizierten IP und nächtlichen Backups — genug, um ein ernsthaftes quantisiertes Modell mit Platz für Kontext drumherum zu halten.

FAQ

Kann ich einen LLM ohne GPU betreiben?

Kleine quantisierte Modelle, ja — und langsam. Ein 7–8B-Modell, auf 4-Bit quantisiert, läuft auf CPU mit genug RAM, aber du wirst die Ausgabe in ein paar Tokens pro Sekunde messen, nicht im flotten Strom, den du von einer API bekommst. Gut für Batch-Jobs und Hintergrundaufgaben, schmerzhaft für interaktiven Chat.

Wie viel RAM für lokale Inferenz?

Das Modell muss in den Speicher passen plus Overhead. Ein 7–8B-4-Bit-Modell will ~6–8 GB; 13B rund 10–16 GB; Modelle der 30B-Klasse drücken quantisiert 24–48 GB. Rechne Platz für Kontext und alles andere auf der Maschine dazu. Deshalb landet lokale Inferenz schnell im High-Memory-Bereich.

Ollama oder vLLM?

Ollama ist die einfache Auffahrt — ein Befehl, Modell gezogen, läuft. vLLM ist für Durchsatz und Serving, mehr Einrichtung, besser unter Last. Für eine private Einzelnutzer-Maschine ist Ollama meist die richtige Wahl; vLLM, wenn du tatsächlich Anfragen im Volumen bedienst.

Warum überhaupt Inferenz selbst hosten, wenn es langsamer ist?

Privatsphäre. Deine Prompts und Ausgaben berühren nie die Server oder Logs eines Anbieters. Für sensible Daten — juristisch, medizinisch, interner Code, alles, was du nicht an Dritte senden kannst — schlägt ein langsameres privates Modell ein schnelles, das alles sieht. Kombiniere es mit Krypto-Zahlung ohne KYC und die ganze Kette bleibt deins.

← Zurück zum BlogPläne & Preise ansehen →

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.