EQVPS

VPS voor self-hosted RAG op schaal

Retrieval-augmented generation houdt op een laptop-demo te zijn zodra het corpus echt wordt. Een vector-index wil RAM, en je embeddings zijn je private data. Hier is de dimensioneringsrekensom en waarom high-memory, no-KYC hosting past. Vanaf $55/mnd.

Een RAG-demo op een laptop met tweehonderd documenten voelt moeiteloos. Dan richt je het op een echt corpus — de docs van een bedrijf, jaren aan tickets, een echte kennisbank — en het geheel wordt een geheugenprobleem. Geen CPU-probleem. Een geheugen-probleem.

Hier is het deel dat de meeste hosting-pagina's overslaan: snelle retrieval wil de index in RAM. Elke chunk tekst wordt een embedding — een vector een paar honderd tot een paar duizend getallen breed — en zoeken betekent je query snel vergelijken met allemaal. Op schijf werkt het, maar elke query betaalt een latency-belasting, en low-latency retrieval was de reden dat je in de eerste plaats zelf hostte.

De dimensioneringsrekensom, eerlijk

Meet je eigen corpus — dimensie en indextype laten dit sterk schommelen — maar als startgevoel:

We schreven de volledige RAM-curve hier uit als je de details wilt.

Waarom high-memory en no-KYC samen

48 GB RAM huren is makkelijk. Het huren met crypto en geen identiteitscontrole niet — de meeste hosts die serieus geheugen goedkoop verkopen doen het achter een kaart en een KYC-formulier. Je embeddings zijn geen abstracte getallen; ze coderen de tekst waar ze vandaan komen. Je docs, de content van je klanten, omgezet in vectoren. Als die data gevoelig genoeg is dat je privé betaalt, ondermijnt een managed vector-cloud het hele punt — en dat doet een host die de server aan je identiteit koppelt ook.

Die combinatie — high memory, dedicated IP, crypto, geen KYC, nachtelijke back-ups — is waar de Pro-lijn voor is. Het is niet het goedkoopste per gigabyte, en als je geen privacy nodig hebt kun je elders goedkoper RAM vinden. Maar als de index je product is en niet weg kan, is dit de vorm die past.

Waar te beginnen

Kies een plan met ruimte voor de index plus alles eromheen — de app, de model-client, ruimte om te groeien. Voor de meeste echte corpora is dat Pro-48 (48 GB); een grote gaat naar Pro-64 of Pro-80. Laad eerst een sample, kijk naar geheugen, dimensioneer op het getal dat je hebt gemeten — niet het getal dat je vreesde.

Als je retrieval deel is van een groter agent-systeem, houdt dezelfde box vaak ook de agent-vloot — zo wordt een 48 GB-plan stilletjes een 64 GB-plan.

Klaar om te implementeren? Betaal met crypto, geen KYC — live in ongeveer een minuut.

Nu implementeren →

FAQ

Hoeveel RAM heeft mijn RAG-setup echt nodig?

Het schaalt met het aantal embeddings en de vectorbreedte. Een paar honderdduizend chunks passen in 2–4 GB; lage miljoenen, met de app en het OS eromheen, landen op 16–32 GB; tientallen miljoenen duwen 48 GB en verder. Meet een sample, kijk naar resident memory, extrapoleer — gok niet hoog, je betaalt gewoon te veel.

Waarom geen managed vector-service gebruiken?

Twee redenen waarom mensen echt zelf hosten: je embeddings coderen private data (docs, notities, klantcontent), dus ze op een machine houden die je beheert doet ertoe; en de kosten zijn vast — een managed service meet per vector en query, een VPS is één maandelijks getal dat je zo hard kunt bestoken als je wilt.

pgvector of een dedicated engine?

Als je al Postgres draait, is pgvector het pad met de minste moeite — één extensie. Voor miljoenen vectoren met zware filtering verdient een purpose-built engine zoals Qdrant zijn eigen service. Begin met wat je beheert; splits het af wanneer zoeken vertraagt, niet eerder.

Heb ik een GPU nodig voor RAG?

Nee. Retrieval is CPU + RAM-werk — vectoren vergelijken, geen tekst genereren. De generatiestap roept je LLM aan (een API, of een aparte model-host). Een high-memory CPU-box is precies de juiste vorm voor de retrieval-helft.

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.