Laten we het teleurstellende deel maar meteen afhandelen, want het internet staat vol pagina's die dat niet doen.
Onze servers zijn CPU-only. Wij bieden geen GPU's. Dat betekent dat lokaal LLM-werk hier een hard plafond heeft, en anders doen zou gewoon je geld verspillen.
Wat er echt werkt op CPU
Met tot 6 vCPU en 6 GB RAM (ons Medium-plan — $12/mnd) zit je in het bereik van kleine gequantiseerde modellen:
- 1B–3B-modellen (Q4): echt bruikbaar. Snel genoeg voor classificatie, tagging, routing en eenvoudige gestructureerde extractie.
- 7B–8B-modellen (Q4): draaien, maar verwacht een paar tokens per seconde. Prima voor een wachtrij die 's nachts documenten doorkauwt. Pijnlijk als chatvenster.
- Embedding-modellen: uitstekende match. Ze zijn klein, snel op CPU, en dit is waarschijnlijk de enige beste reden om Ollama op een box als de onze te draaien.
- 13B en hoger: niet doen. Je zit te swappen en te wachten.
Als je een snelle, interactieve 70B-chat nodig hebt, heb je een GPU-host nodig — dat is een ander product van een andere provider, en we vertellen het je liever dan je $12 te nemen.
Waar een CPU-box echt wint
Privacy. Je documenten, je prompts, je embeddings — verlaten nooit een machine die je beheert, worden nooit iemands trainingsdata. Voor veel mensen is dat het hele punt, en een paar tokens per seconde is een acceptabele ruil.
Kostenvoorspelbaarheid. Geen rekening per token. Een pipeline die vijftigduizend records classificeert kost hetzelfde als een die er vijftig classificeert: $12.
Async werk. Het meeste nuttige LLM-werk is geen chatvenster. Het is een wachtrij: vat deze samen, tag die, embed dit corpus. Een CPU-box die 's nachts door een backlog maalt is daar prima in.
Setup
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama serveert een HTTP-API op localhost:11434. Houd het daar. Als je het van elders moet bereiken, zet het achter een reverse proxy met authenticatie op een dedicated-IP-plan — stel nooit een niet-geauthenticeerd model-endpoint bloot aan het open internet.
Combineer het met een vector-database (Qdrant of pgvector in Docker) en je hebt een complete private RAG-stack op één box van $12. Die combinatie — kleine lokale embeddings, lokale vector store, externe API alleen voor de zware generatiestap — is de setup die echt zin heeft op hardware als deze.
Een plan kiezen
| Gebruik | Plan | Prijs |
|---|---|---|
| Embeddings, 1–3B-modellen, RAG-pipeline | Medium | $12/mnd |
| Hetzelfde, plus een publiek endpoint achter auth | Medium-IP | $20/mnd |
| Alleen kleine modellen testen | Small | $8/mnd |
CPU-only, tot 6 vCPU en 6 GB RAM. NVMe-opslag, ongemeten verkeer, Duitsland of Finland. Cryptobetaling, geen KYC. Jaarlijkse facturering is één overdracht in plaats van twaalf.
Gerelateerd leesvoer
- Host een vector-DB voor AI-geheugen — de andere helft van een private RAG-stack
- VPS voor AI-agents — orkestratie op dezelfde box
Klaar? Implementeer een server → — live in ongeveer een minuut, betaald in crypto, geen ID vereist.
Reacties
Nog geen reacties. Wees de eerste.