Wir haben eine separate Seite für Ollama und kleine Modelle — das ist die 12-$-CPU-Maschine, die 1B–8B und Embeddings betreibt. Diese Seite ist das andere Ende: die Modelle, die groß genug sind, dass RAM, nicht die CPU, ist, was dich stoppt.
Seien wir gleich ehrlich, wie überall: unsere Server sind nur CPU, keine GPU. Ein großes Modell läuft hier langsam. Wenn du schnellen interaktiven Chat auf einem 30B-Modell willst, brauchst du einen GPU-Host — anderes Produkt, anderer Anbieter. Was eine High-Memory-CPU-Maschine gut macht, ist, ein großes quantisiertes Modell privat für Arbeit zu betreiben, die kein Chat-Fenster ist.
Die RAM-Rechnung
Das Modell sitzt im Speicher, quantisiert oder nicht, plus Overhead für Kontext und die Laufzeit:
- 13B, 4-Bit — grob 10–16 GB. Läuft bereits auf einem mittleren Plan.
- 30B-Klasse, quantisiert — 24–48 GB je nach Quantisierung. Das ist Pro-32-bis-Pro-64-Terrain.
- Größer oder höhere Präzision — 64–80 GB, und über 80 GB passt keine einzelne Maschine von uns. Pro-80 ist hier die Obergrenze.
Deshalb ist „ein größeres lokales Modell betreiben“ wirklich eine High-Memory-Frage. Das Modell ist der Speicher-Fußabdruck. Füge einen RAG-Index auf demselben Host hinzu und die Zahlen stapeln sich.
Wo Privacy-First wirklich gewinnt
Der Fall ist nicht Geschwindigkeit und nicht Kosten — es ist, dass manche Daten nicht weg dürfen. Juristische Dokumente. Medizinische Aufzeichnungen. Proprietärer Code. Alles, wo das Senden des Prompts an eine Drittanbieter-API vom Tisch ist. Ein langsameres Modell, das vollständig auf deiner Maschine läuft, schlägt ein schnelles, das alles loggt, was du ihm sendest. Wir haben hier das ganze Bild geschrieben.
Und wenn die Daten so sensibel sind, sollte die Zahlung wahrscheinlich auch privat sein. Die Maschine mit Krypto und ohne KYC zu mieten hält die ganze Kette — Server, Modell, Prompts, Abrechnung — aus den Identitätsaufzeichnungen aller heraus. Das ist der Pitch: nicht günstigere Inferenz, sondern Inferenz, die niemand sonst sehen kann.
Was wählen
Für ein Modell der 30B-Klasse mit Platz für Kontext ist Pro-64 (64 GB) die bequeme Wahl; eine engere Quantisierung passt auf Pro-32 oder Pro-48, eine größere geht auf Pro-80. Lade das Modell zuerst, beobachte den residenten Speicher, dimensioniere nach dem, was du gemessen hast. Und setze Erwartungen: das ist private Batch-Inferenz, kein schnelles Chat-Fenster.
Kommentare
Noch keine Kommentare. Sei der Erste.