EQVPS

Lokale LLM-inferentie privé hosten: wat een CPU-VPS wel en niet kan

9 aug 2026 · 3 min lezen · EQVPS Team

Laten we vooraf eerlijk zijn: als je snelle, goedkope, hoogwaardige generatie wilt, roep een API aan. Een CPU-VPS zal een datacenter vol GPU's niet verslaan, en iedereen die je iets anders vertelt verkoopt iets.

Dus waarom überhaupt inferentie self-hosten? Één reden, en het is een goede: het model op je server stuurt je prompts nooit ergens heen.

Hoe CPU-inferentie er werkelijk uitziet

Je kunt echte modellen draaien op CPU met genoeg RAM. Een 7–8B-model gekwantiseerd naar 4-bit werkt. Een 13B werkt. Je kunt zelfs een 30B-klasse model duwen als je het geheugen hebt. Wat je niet kunt is het snel maken — output komt met een paar tokens per seconde, niet de directe stream die een API geeft.

Dat is de eerlijke afweging. Voor interactieve chat is het frustrerend. Voor achtergrondwerk — documenten 's nachts samenvatten, een wachtrij classificeren, data op schema verrijken — is een paar tokens per seconde volkomen prima, en niemand let op de klok.

De RAM-rekensom

Het model moet in geheugen zitten, gekwantiseerd of niet, plus overhead voor context en de runtime:

Dit is waarom "een lokaal model draaien" stilletjes een high-memory-vraag wordt. Het model is de geheugen-footprint. Voeg een RAG-index of agents op dezelfde box toe en de getallen stapelen.

Ollama vs vLLM, kort

Ollama is de makkelijke deur naar binnen — installeer, ollama run, klaar. Het is het juiste gereedschap voor een privé single-user setup waar je gewoon het model beschikbaar wilt. vLLM is gebouwd voor serving-throughput: meer setup, beter onder gelijktijdige belasting, de moeite waard wanneer je daadwerkelijk volume afhandelt. Begin met Ollama; grijp naar vLLM wanneer je echt verkeer serveert.

Waar privacy-eerst echt wint

Het argument voor self-hosted inferentie is geen snelheid of kosten — het is dat sommige data niet weg mag. Juridische documenten. Medische dossiers. Eigen code. Alles waar het sturen van de prompt naar een derde-partij-API van tafel is om beleids- of vertrouwensredenen. Een langzamer model dat volledig op je machine draait verslaat een snel model dat alles logt wat je stuurt.

En als de data zo gevoelig is, zou de betaling waarschijnlijk ook privé moeten zijn. De box huren met crypto en no KYC houdt de hele keten — server, model, prompts, facturatie — uit ieders identiteitsrecords. Dat is de echte pitch: niet "goedkopere inferentie," maar "inferentie die niemand anders kan zien."

Kern van de zaak

Voor snelheid en kwaliteit, gebruik een API — geen schaamte in. Self-host wanneer privacy de vereiste is en langzamer acceptabel. Dimensioneer voor het model plus zijn context plus al het andere dat de box deelt, en verwacht geen GPU-snelheid van CPU.

Wanneer het model echt geheugen nodig heeft, draait de Pro-lijn 32 tot 80 GB met een dedicated IP en nachtelijke back-ups — genoeg om een serieus gekwantiseerd model vast te houden met ruimte voor context eromheen.

FAQ

Kan ik een LLM draaien zonder GPU?

Kleine gekwantiseerde modellen, ja — en langzaam. Een 7–8B-model gekwantiseerd naar 4-bit draait op CPU met genoeg RAM, maar je meet output in een paar tokens per seconde, niet de vlotte stream die je van een API krijgt. Prima voor batch-taken en achtergrondwerk, pijnlijk voor interactieve chat.

Hoeveel RAM voor lokale inferentie?

Het model moet in geheugen passen plus overhead. Een 7–8B 4-bit-model wil ~6–8 GB; 13B rond 10–16 GB; 30B-klasse modellen duwen 24–48 GB gekwantiseerd. Voeg ruimte toe voor context en al het andere op de box. Dit is waarom lokale inferentie snel in high-memory-gebied belandt.

Ollama of vLLM?

Ollama is de makkelijke instap — één commando, model gepulld, draaiend. vLLM is voor throughput en serving, meer setup, beter onder belasting. Voor een privé single-user box is Ollama meestal de juiste keuze; vLLM wanneer je daadwerkelijk verzoeken op volume serveert.

Waarom überhaupt inferentie self-hosten als het langzamer is?

Privacy. Je prompts en outputs raken nooit de servers of logs van een provider. Voor gevoelige data — juridisch, medisch, interne code, alles wat je niet naar een derde partij kunt sturen — verslaat een langzamer privé-model een snel model dat alles ziet. Combineer het met no-KYC crypto-betaling en de hele keten blijft van jou.

← Terug naar blogBekijk plannen & prijzen →

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.