Sommerhitze — alles schmilzt, sogar unsere Preise.−25%−25 % auf jeden Jahresplan, bis 31. Aug.Pläne ansehen
EQVPS
Loslegen

VPS für private High-Memory-LLM-Inferenz

Größere quantisierte Modelle brauchen echtes RAM, keine GPU, die du nicht hast. Wo eine High-Memory-CPU-Maschine Modelle der 30B-Klasse privat betreibt, was realistisch ist und wo nicht. Ab 70 $/Mon.

Wir haben eine separate Seite für Ollama und kleine Modelle — das ist die 12-$-CPU-Maschine, die 1B–8B und Embeddings betreibt. Diese Seite ist das andere Ende: die Modelle, die groß genug sind, dass RAM, nicht die CPU, ist, was dich stoppt.

Seien wir gleich ehrlich, wie überall: unsere Server sind nur CPU, keine GPU. Ein großes Modell läuft hier langsam. Wenn du schnellen interaktiven Chat auf einem 30B-Modell willst, brauchst du einen GPU-Host — anderes Produkt, anderer Anbieter. Was eine High-Memory-CPU-Maschine gut macht, ist, ein großes quantisiertes Modell privat für Arbeit zu betreiben, die kein Chat-Fenster ist.

Die RAM-Rechnung

Das Modell sitzt im Speicher, quantisiert oder nicht, plus Overhead für Kontext und die Laufzeit:

Deshalb ist „ein größeres lokales Modell betreiben“ wirklich eine High-Memory-Frage. Das Modell ist der Speicher-Fußabdruck. Füge einen RAG-Index auf demselben Host hinzu und die Zahlen stapeln sich.

Wo Privacy-First wirklich gewinnt

Der Fall ist nicht Geschwindigkeit und nicht Kosten — es ist, dass manche Daten nicht weg dürfen. Juristische Dokumente. Medizinische Aufzeichnungen. Proprietärer Code. Alles, wo das Senden des Prompts an eine Drittanbieter-API vom Tisch ist. Ein langsameres Modell, das vollständig auf deiner Maschine läuft, schlägt ein schnelles, das alles loggt, was du ihm sendest. Wir haben hier das ganze Bild geschrieben.

Und wenn die Daten so sensibel sind, sollte die Zahlung wahrscheinlich auch privat sein. Die Maschine mit Krypto und ohne KYC zu mieten hält die ganze Kette — Server, Modell, Prompts, Abrechnung — aus den Identitätsaufzeichnungen aller heraus. Das ist der Pitch: nicht günstigere Inferenz, sondern Inferenz, die niemand sonst sehen kann.

Was wählen

Für ein Modell der 30B-Klasse mit Platz für Kontext ist Pro-64 (64 GB) die bequeme Wahl; eine engere Quantisierung passt auf Pro-32 oder Pro-48, eine größere geht auf Pro-80. Lade das Modell zuerst, beobachte den residenten Speicher, dimensioniere nach dem, was du gemessen hast. Und setze Erwartungen: das ist private Batch-Inferenz, kein schnelles Chat-Fenster.

Bereit zum Bereitstellen? Zahle in Krypto, ohne KYC — online in etwa einer Minute.

Bereitstellen →

FAQ

Wie unterscheidet sich das von eurem Ollama-Use-Case?

Die Ollama-Seite handelt von kleinen Modellen auf einer 12-$-CPU-Maschine — 1B–8B, Embeddings, leichte Arbeit. Das ist das High-Memory-Ende: quantisierte Modelle der 13B- bis 30B-Klasse, die 24–48 GB oder mehr brauchen, um überhaupt zu laden. Dieselbe Nur-CPU-Realität, viel größerer Speicher-Fußabdruck, anderer Plan.

Wie viel RAM für ein gegebenes Modell?

Das Modell muss in den Speicher passen plus Overhead. Ein 13B-4-Bit-Modell will ~10–16 GB; 30B-Klasse quantisiert drückt 24–48 GB; geh größer oder höhere Präzision und du bist bei 64–80 GB — darüber hinaus passt keine einzelne Maschine von uns. Rechne Platz für Kontext obendrauf.

Wird es schnell sein?

Nein — sei hier ehrlich zu dir selbst. CPU-Inferenz auf einem großen Modell ist ein paar Tokens pro Sekunde, kein interaktiver Strom. Es ist gut für Batch- und Hintergrundarbeit (über Nacht zusammenfassen, eine Warteschlange klassifizieren). Für Echtzeit-Chat auf einem großen Modell brauchst du eine GPU, die wir nicht anbieten.

Warum es hier betreiben statt einer API?

Privatsphäre. Deine Prompts und Ausgaben berühren nie die Server oder Logs eines Anbieters. Für sensible Daten — juristisch, medizinisch, interner Code — schlägt ein langsameres privates Modell ein schnelles, das alles sieht. Kombiniere es mit Krypto-Zahlung ohne KYC und die ganze Kette bleibt deins.

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.