EQVPS

VPS voor private high-memory LLM-inferentie

Grotere gequantiseerde modellen hebben echte RAM nodig, geen GPU die je niet hebt. Waar een high-memory CPU-box 30B-klasse modellen privé draait, wat realistisch is, en waar niet. Vanaf $70/mnd.

We hebben een aparte pagina voor Ollama en kleine modellen — dat is de CPU-box van $12 die 1B–8B en embeddings draait. Deze pagina is het andere uiteinde: de modellen die groot genoeg zijn dat RAM, niet de CPU, is wat je tegenhoudt.

Laten we vooraf eerlijk zijn, zoals overal: onze servers zijn CPU-only, geen GPU. Een groot model draait hier langzaam. Als je snelle interactieve chat op een 30B-model wilt, heb je een GPU-host nodig — ander product, andere provider. Wat een high-memory CPU-box goed doet, is een groot gequantiseerd model privé draaien voor werk dat geen chatvenster is.

De RAM-rekensom

Het model zit in het geheugen, gequantiseerd of niet, plus overhead voor context en de runtime:

Daarom is "een groter lokaal model draaien" eigenlijk een high-memory-vraag. Het model is de geheugenvoetafdruk. Voeg een RAG-index op dezelfde host toe en de cijfers stapelen.

Waar private-first echt wint

Het argument is niet snelheid en niet kosten — het is dat sommige data niet weg kan. Juridische documenten. Medische dossiers. Bedrijfseigen code. Alles waar de prompt naar een externe API sturen geen optie is. Een langzamer model dat volledig op je machine draait verslaat een snel model dat alles logt wat je stuurt. We schreven het volledige plaatje hier.

En als de data zo gevoelig is, zou de betaling waarschijnlijk ook privé moeten zijn. De box huren met crypto en geen KYC houdt de hele keten — server, model, prompts, facturering — buiten iemands identiteitsdossiers. Dat is de pitch: geen goedkopere inferentie, maar inferentie die niemand anders kan zien.

Wat te kiezen

Voor een 30B-klasse model met ruimte voor context is Pro-64 (64 GB) de comfortabele keuze; een strakkere quantisatie past op Pro-32 of Pro-48, een grotere gaat naar Pro-80. Laad eerst het model, kijk naar resident memory, dimensioneer op wat je hebt gemeten. En stel de verwachtingen: dit is private batch-inferentie, geen snel chatvenster.

Klaar om te implementeren? Betaal met crypto, geen KYC — live in ongeveer een minuut.

Nu implementeren →

FAQ

Hoe verschilt dit van jullie Ollama-use-case?

De Ollama-pagina gaat over kleine modellen op een CPU-box van $12 — 1B–8B, embeddings, licht werk. Dit is het high-memory-uiteinde: 13B tot 30B-klasse gequantiseerde modellen die 24–48 GB of meer nodig hebben om überhaupt te laden. Dezelfde CPU-only realiteit, veel grotere geheugenvoetafdruk, ander plan.

Hoeveel RAM voor een bepaald model?

Het model moet in het geheugen passen plus overhead. Een 13B 4-bit-model wil ~10–16 GB; 30B-klasse gequantiseerd duwt 24–48 GB; ga groter of hogere precisie en je zit op 64–80 GB — daarvoorbij past geen enkele box van ons. Reken bovenop nog ruimte voor context.

Zal het snel zijn?

Nee — wees hier eerlijk tegen jezelf. CPU-inferentie op een groot model is een paar tokens per seconde, geen interactieve stream. Het is prima voor batch- en achtergrondwerk (samenvatten 's nachts, een wachtrij classificeren). Voor real-time chat op een groot model heb je een GPU nodig, die wij niet bieden.

Waarom het hier draaien in plaats van een API?

Privacy. Je prompts en outputs raken nooit de servers of logs van een provider. Voor gevoelige data — juridisch, medisch, interne code — verslaat een langzamer privémodel een snel model dat alles ziet. Combineer het met no-KYC cryptobetaling en de hele keten blijft van jou.

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.