Vi har en separat sida för Ollama och små modeller — det är $12 CPU-boxen som kör 1B–8B och embeddings. Den här sidan är den andra änden: modellerna som är stora nog att RAM, inte CPU:n, är det som stoppar dig.
Låt oss vara ärliga i förväg, som överallt: våra servrar är CPU-only, ingen GPU. En stor modell körs långsamt här. Om du vill ha snabb interaktiv chatt på en 30B-modell behöver du en GPU-host — annan produkt, annan leverantör. Vad en high-memory CPU-box gör bra är att köra en stor kvantiserad modell privat för arbete som inte är ett chattfönster.
RAM-matematiken
Modellen sitter i minnet, kvantiserad eller inte, plus overhead för kontext och runtimen:
- 13B, 4-bit — ungefär 10–16 GB. Körs redan på ett mid-plan.
- 30B-klass, kvantiserad — 24–48 GB beroende på kvantisering. Detta är Pro-32 till Pro-64-territorium.
- Större eller högre precision — 64–80 GB, och bortom 80 GB får ingen enskild box av oss plats. Pro-80 är taket här.
Det är därför "kör en större lokal modell" egentligen är en high-memory-fråga. Modellen är minnesfotavtrycket. Lägg till en RAG-index på samma host och siffrorna staplas.
Var privat-först verkligen vinner
Argumentet är inte hastighet och inte kostnad — det är att viss data inte kan lämna. Juridiska dokument. Medicinska journaler. Proprietär kod. Allt där att skicka prompten till en tredjeparts-API är uteslutet. En långsammare modell som körs helt på din maskin slår en snabb som loggar allt du skickar den. Vi skrev hela bilden här.
Och om datan är så känslig borde betalningen förmodligen också vara privat. Att hyra boxen med krypto och ingen KYC håller hela kedjan — server, modell, prompter, fakturering — borta från någons identitetsregister. Det är pitchen: inte billigare inferens, utan inferens ingen annan kan se.
Vad du ska välja
För en 30B-klass-modell med utrymme för kontext är Pro-64 (64 GB) det bekväma valet; en snävare kvantisering får plats på Pro-32 eller Pro-48, en större går till Pro-80. Ladda modellen först, titta på resident memory, dimensionera från vad du mätte. Och sätt förväntningarna: detta är privat batch-inferens, inte ett snabbt chattfönster.
Kommentarer
Inga kommentarer än. Bli först.