EQVPS

Een lokale LLM zelf-hosten op een VPS met Ollama — wat echt werkt

14 jun 2026 · 3 min lezen · EQVPS Team

Elke prompt naar iemands API sturen is prima — tot het dat niet is. Misschien is de data gevoelig en zou je hem liever nooit je server laten verlaten. Misschien ben je moe van rate limits, of van een model-versie die onder je voeten verandert, of van een per-token-meter die tikt terwijl je experimenteert. Op een gegeven moment stopt "wat als ik gewoon mijn eigen draaide?" een gedachte-experiment te zijn.

Ollama maakt dat genuine makkelijk. De moeilijkere vraag is wat past op een VPS — en hier telt het eerlijke antwoord meer dan de hype.

Wat je werkelijk kunt draaien op CPU

Geen GPU? Dan doe je CPU-inferentie, en modelgrootte is alles. Kwantisatie (de gewichten omlaag knijpen naar 4-bit) is wat dit praktisch maakt — je verliest een sliver kwaliteit en bespaart een berg geheugen.

Ruwe cijfers, degene die ertoe doen:

Snelheid, eerlijk: op een paar vCPU's zie je een handvol tokens per seconde. Perfect prima voor een chatbot of een coding-assistent waar je leest terwijl het typt. Niet prima voor het batch-processen van een miljoen documenten — dat is een GPU-job, en we doen niet alsof anders. We bieden geen GPU-instances. Als je plan een 70B-model of zware throughput nodig heeft, is een CPU-VPS — de onze of die van iemand — het verkeerde gereedschap, en dat zou je moeten weten voordat je een cent uitgeeft.

Maar een private 7B die je vragen beantwoordt en nooit naar huis belt? Die draait comfortabel op een 6 GB-box.

De installatie — drie commando's

Start de server op, SSH erin, en:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

Dat is het — je chat in de terminal. Om het vanuit je eigen code te gebruiken, serveert Ollama al een HTTP-API op poort 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Eén gotcha het waard om vooraf te weten: standaard bindt die API aan localhost. Houd het zo en tunnel over SSH, of het is blootgesteld aan het internet. Als je het bereikbaar wilt, zet het achter auth — laat geen open model-endpoint op een publiek IP.

De box kiezen

Match het plan aan het model, niet andersom:

Je wilt draaienRAM die je nodig hebtVerstandig plan
3B-model, licht gebruik~3 GBSmall (4 GB)
7B-model, comfortabel~5-6 GBMedium (6 GB)
Groter / hoge throughputGPU-gebiedgeen CPU-VPS

Voor de meeste zelf-hosters is Medium (6 GB) de eerlijke aanbeveling — genoeg ruimte voor een 7B-model plus je app en het OS. Small (4 GB) werkt als je bij 3B blijft. Alles daaronder is te krap zodra het OS en context erin eten.

Waarom het hier doen

Als je een LLM zelf-host, is privacy meestal de helft van de reden — dus het zou raar zijn je ID over te handigen om de box te huren. Dat hoef je niet: je kunt betalen in USDC of USDT (of een kaart via de on-ramp), geen KYC, en de server is van jou in ongeveer een minuut. Crypto-native, agent-vriendelijk, en de data blijft op een machine die je beheert.

De afweging is degene waar we eerlijk over zijn geweest: alleen CPU, een 6 GB-plafond, kleine modellen. Daarbinnen is zelf-hosten geweldig. Daarbuiten, laat niemand je een CPU-box verkopen voor een job die een GPU nodig heeft.

Klaar om te proberen? Kies een plan, betaal, en je hebt root in ongeveer 60 seconden — dan is het drie commando's naar je eigen private model.

FAQ

Kan ik een LLM draaien zonder GPU?

Ja, voor kleine modellen. Een 3B- of 7B-model in 4-bit kwantisatie draait op CPU en antwoordt in een leesbaar tempo — prima voor een chatbot, een coding-helper, of achtergrondtaken waar je niet naar de cursor kijkt. Wat je niet kunt op CPU is een groot model serveren (13B en hoger) of hoge throughput pushen; daar stopt een GPU optioneel te zijn.

Hoeveel RAM heb ik nodig voor Llama 7B?

Rond 5 GB voor een 4-bit 7B-model zodra je het contextvenster en het OS toevoegt — dus een 6 GB-box is de comfortabele vloer. Een 3B-model past in ongeveer 3 GB. Kleinere quant (Q4) ruilt een beetje kwaliteit voor veel minder geheugen, wat de juiste ruil is op een VPS.

Is een LLM zelf-hosten goedkoper dan een API?

Het hangt af van volume. Een hosted API rekent per token en kost niets bij inactiviteit; een VPS is een vlakke maandelijkse rekening of je hem gebruikt of niet. Als je een gestage stroom verzoeken draait, of je vooral om privacy en geen rate limits geeft, wint zelf-hosten. Voor incidentele one-off prompts is een gemeterde API goedkoper.

Waarom zelf-hosten in plaats van een cloud-API gebruiken?

Drie redenen waarom mensen het echt doen: de data verlaat nooit je server (echt voor juridisch, medisch, of gewoon private notities), er zijn geen rate limits of per-token-meter, en het model verandert niet of wordt niet verouderd onder je. De kost is dat je de box beheert en binnen zijn hardware leeft.

Wat is het grootste model dat ik realistisch op een CPU-VPS kan draaien?

Een 7B-model in 4-bit is de sweet spot op een 6 GB-box. Je kunt technisch een 13B laden met genoeg RAM, maar op CPU wordt het langzaam genoeg dat je het voelt. Daarvoorbij wil je een GPU, wat een ander soort host is.

← Terug naar blogBekijk plannen & prijzen →

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.