EQVPS

VPS voor Ollama en lokale LLM's

Host kleine taalmodellen zelf op een CPU-server — privé, ongemeten, betaald in crypto. Eerlijk over wat CPU-inferentie wel en niet kan. Vanaf $12/mnd.

Laten we het teleurstellende deel maar meteen afhandelen, want het internet staat vol pagina's die dat niet doen.

Onze servers zijn CPU-only. Wij bieden geen GPU's. Dat betekent dat lokaal LLM-werk hier een hard plafond heeft, en anders doen zou gewoon je geld verspillen.

Wat er echt werkt op CPU

Met tot 6 vCPU en 6 GB RAM (ons Medium-plan — $12/mnd) zit je in het bereik van kleine gequantiseerde modellen:

Als je een snelle, interactieve 70B-chat nodig hebt, heb je een GPU-host nodig — dat is een ander product van een andere provider, en we vertellen het je liever dan je $12 te nemen.

Waar een CPU-box echt wint

Privacy. Je documenten, je prompts, je embeddings — verlaten nooit een machine die je beheert, worden nooit iemands trainingsdata. Voor veel mensen is dat het hele punt, en een paar tokens per seconde is een acceptabele ruil.

Kostenvoorspelbaarheid. Geen rekening per token. Een pipeline die vijftigduizend records classificeert kost hetzelfde als een die er vijftig classificeert: $12.

Async werk. Het meeste nuttige LLM-werk is geen chatvenster. Het is een wachtrij: vat deze samen, tag die, embed dit corpus. Een CPU-box die 's nachts door een backlog maalt is daar prima in.

Setup

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama serveert een HTTP-API op localhost:11434. Houd het daar. Als je het van elders moet bereiken, zet het achter een reverse proxy met authenticatie op een dedicated-IP-plan — stel nooit een niet-geauthenticeerd model-endpoint bloot aan het open internet.

Combineer het met een vector-database (Qdrant of pgvector in Docker) en je hebt een complete private RAG-stack op één box van $12. Die combinatie — kleine lokale embeddings, lokale vector store, externe API alleen voor de zware generatiestap — is de setup die echt zin heeft op hardware als deze.

Een plan kiezen

GebruikPlanPrijs
Embeddings, 1–3B-modellen, RAG-pipelineMedium$12/mnd
Hetzelfde, plus een publiek endpoint achter authMedium-IP$20/mnd
Alleen kleine modellen testenSmall$8/mnd

CPU-only, tot 6 vCPU en 6 GB RAM. NVMe-opslag, ongemeten verkeer, Duitsland of Finland. Cryptobetaling, geen KYC. Jaarlijkse facturering is één overdracht in plaats van twaalf.

Gerelateerd leesvoer


Klaar? Implementeer een server → — live in ongeveer een minuut, betaald in crypto, geen ID vereist.

Klaar om te implementeren? Betaal met crypto, geen KYC — live in ongeveer een minuut.

Nu implementeren →

FAQ

Kan ik Llama 70B hierop draaien?

Nee. Onze plannen zijn CPU-only met tot 6 GB RAM — dat is het bereik van kleine gequantiseerde modellen (ruwweg 1B–8B op 4-bit). Een 70B-model heeft een GPU nodig en veel meer geheugen. Wij bieden geen GPU's, en we zeggen dat liever dan je een teleurstelling te verkopen.

Hoe snel is CPU-inferentie echt?

Verwacht een paar tokens per seconde op een 7–8B-model bij 4-bit-quantisatie, en merkbaar beter op 1–3B-modellen. Dat is prima voor achtergrondtaken, embeddings, classificatie en async pipelines. Het is niet prima voor een snelle interactieve chat.

Dus waar is dit eigenlijk goed voor?

Private embeddings, classificatie, samenvattingswachtrijen, RAG-pipelines waar latency er niet toe doet, en data van externe API's weghouden. Ook: leren, testen en prototypen voordat je ergens een GPU huurt.

Vragen jullie om een ID?

Nee. E-mail om te registreren, USDC of USDT om te betalen. Wat vaak de reden is dat mensen überhaupt een privémodel willen.

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.