Laten we vooraf eerlijk zijn: als je snelle, goedkope, hoogwaardige generatie wilt, roep een API aan. Een CPU-VPS zal een datacenter vol GPU's niet verslaan, en iedereen die je iets anders vertelt verkoopt iets.
Dus waarom überhaupt inferentie self-hosten? Één reden, en het is een goede: het model op je server stuurt je prompts nooit ergens heen.
Hoe CPU-inferentie er werkelijk uitziet
Je kunt echte modellen draaien op CPU met genoeg RAM. Een 7–8B-model gekwantiseerd naar 4-bit werkt. Een 13B werkt. Je kunt zelfs een 30B-klasse model duwen als je het geheugen hebt. Wat je niet kunt is het snel maken — output komt met een paar tokens per seconde, niet de directe stream die een API geeft.
Dat is de eerlijke afweging. Voor interactieve chat is het frustrerend. Voor achtergrondwerk — documenten 's nachts samenvatten, een wachtrij classificeren, data op schema verrijken — is een paar tokens per seconde volkomen prima, en niemand let op de klok.
De RAM-rekensom
Het model moet in geheugen zitten, gekwantiseerd of niet, plus overhead voor context en de runtime:
- 7–8B, 4-bit — rond 6–8 GB. Draait op een mid-plan.
- 13B, 4-bit — ruwweg 10–16 GB.
- 30B-klasse, gekwantiseerd — 24–48 GB, afhankelijk van kwantisatie.
- Groter, of hogere precisie — je zit snel op 64–80 GB — en voorbij 80 GB past geen enkele Pro-box, nog steeds CPU-langzaam.
Dit is waarom "een lokaal model draaien" stilletjes een high-memory-vraag wordt. Het model is de geheugen-footprint. Voeg een RAG-index of agents op dezelfde box toe en de getallen stapelen.
Ollama vs vLLM, kort
Ollama is de makkelijke deur naar binnen — installeer, ollama run, klaar. Het is het juiste gereedschap voor een privé single-user setup waar je gewoon het model beschikbaar wilt. vLLM is gebouwd voor serving-throughput: meer setup, beter onder gelijktijdige belasting, de moeite waard wanneer je daadwerkelijk volume afhandelt. Begin met Ollama; grijp naar vLLM wanneer je echt verkeer serveert.
Waar privacy-eerst echt wint
Het argument voor self-hosted inferentie is geen snelheid of kosten — het is dat sommige data niet weg mag. Juridische documenten. Medische dossiers. Eigen code. Alles waar het sturen van de prompt naar een derde-partij-API van tafel is om beleids- of vertrouwensredenen. Een langzamer model dat volledig op je machine draait verslaat een snel model dat alles logt wat je stuurt.
En als de data zo gevoelig is, zou de betaling waarschijnlijk ook privé moeten zijn. De box huren met crypto en no KYC houdt de hele keten — server, model, prompts, facturatie — uit ieders identiteitsrecords. Dat is de echte pitch: niet "goedkopere inferentie," maar "inferentie die niemand anders kan zien."
Kern van de zaak
Voor snelheid en kwaliteit, gebruik een API — geen schaamte in. Self-host wanneer privacy de vereiste is en langzamer acceptabel. Dimensioneer voor het model plus zijn context plus al het andere dat de box deelt, en verwacht geen GPU-snelheid van CPU.
Wanneer het model echt geheugen nodig heeft, draait de Pro-lijn 32 tot 80 GB met een dedicated IP en nachtelijke back-ups — genoeg om een serieus gekwantiseerd model vast te houden met ruimte voor context eromheen.
Reacties
Nog geen reacties. Wees de eerste.