We hebben een aparte pagina voor Ollama en kleine modellen — dat is de CPU-box van $12 die 1B–8B en embeddings draait. Deze pagina is het andere uiteinde: de modellen die groot genoeg zijn dat RAM, niet de CPU, is wat je tegenhoudt.
Laten we vooraf eerlijk zijn, zoals overal: onze servers zijn CPU-only, geen GPU. Een groot model draait hier langzaam. Als je snelle interactieve chat op een 30B-model wilt, heb je een GPU-host nodig — ander product, andere provider. Wat een high-memory CPU-box goed doet, is een groot gequantiseerd model privé draaien voor werk dat geen chatvenster is.
De RAM-rekensom
Het model zit in het geheugen, gequantiseerd of niet, plus overhead voor context en de runtime:
- 13B, 4-bit — ruwweg 10–16 GB. Draait al op een mid-plan.
- 30B-klasse, gequantiseerd — 24–48 GB afhankelijk van quantisatie. Dit is Pro-32 tot Pro-64-terrein.
- Groter of hogere precisie — 64–80 GB, en voorbij 80 GB past geen enkele box van ons. Pro-80 is hier het plafond.
Daarom is "een groter lokaal model draaien" eigenlijk een high-memory-vraag. Het model is de geheugenvoetafdruk. Voeg een RAG-index op dezelfde host toe en de cijfers stapelen.
Waar private-first echt wint
Het argument is niet snelheid en niet kosten — het is dat sommige data niet weg kan. Juridische documenten. Medische dossiers. Bedrijfseigen code. Alles waar de prompt naar een externe API sturen geen optie is. Een langzamer model dat volledig op je machine draait verslaat een snel model dat alles logt wat je stuurt. We schreven het volledige plaatje hier.
En als de data zo gevoelig is, zou de betaling waarschijnlijk ook privé moeten zijn. De box huren met crypto en geen KYC houdt de hele keten — server, model, prompts, facturering — buiten iemands identiteitsdossiers. Dat is de pitch: geen goedkopere inferentie, maar inferentie die niemand anders kan zien.
Wat te kiezen
Voor een 30B-klasse model met ruimte voor context is Pro-64 (64 GB) de comfortabele keuze; een strakkere quantisatie past op Pro-32 of Pro-48, een grotere gaat naar Pro-80. Laad eerst het model, kijk naar resident memory, dimensioneer op wat je hebt gemeten. En stel de verwachtingen: dit is private batch-inferentie, geen snel chatvenster.
Reacties
Nog geen reacties. Wees de eerste.