Een RAG-demo op een laptop met tweehonderd documenten voelt moeiteloos. Dan richt je het op een echt corpus — de docs van een bedrijf, jaren aan tickets, een echte kennisbank — en het geheel wordt een geheugenprobleem. Geen CPU-probleem. Een geheugen-probleem.
Hier is het deel dat de meeste hosting-pagina's overslaan: snelle retrieval wil de index in RAM. Elke chunk tekst wordt een embedding — een vector een paar honderd tot een paar duizend getallen breed — en zoeken betekent je query snel vergelijken met allemaal. Op schijf werkt het, maar elke query betaalt een latency-belasting, en low-latency retrieval was de reden dat je in de eerste plaats zelf hostte.
De dimensioneringsrekensom, eerlijk
Meet je eigen corpus — dimensie en indextype laten dit sterk schommelen — maar als startgevoel:
- Een paar honderdduizend embeddings — 2–4 GB. Een persoonlijke kennisbank. Je hebt hier geen Pro voor nodig; een kleiner plan is prima.
- Lage miljoenen — met de app, de model-client en het OS eromheen, reken op 16–32 GB. Een serieuze bedrijfskennisbank. Dit is waar Pro-32 of Pro-48 zin begint te krijgen.
- Tientallen miljoenen, of hoog-dimensionale vectoren — 48 GB en meer, en voorbij ~80 GB splits je de index over servers. Grote documentbestanden, multi-tenant retrieval, meerdere indexen tegelijk warm.
We schreven de volledige RAM-curve hier uit als je de details wilt.
Waarom high-memory en no-KYC samen
48 GB RAM huren is makkelijk. Het huren met crypto en geen identiteitscontrole niet — de meeste hosts die serieus geheugen goedkoop verkopen doen het achter een kaart en een KYC-formulier. Je embeddings zijn geen abstracte getallen; ze coderen de tekst waar ze vandaan komen. Je docs, de content van je klanten, omgezet in vectoren. Als die data gevoelig genoeg is dat je privé betaalt, ondermijnt een managed vector-cloud het hele punt — en dat doet een host die de server aan je identiteit koppelt ook.
Die combinatie — high memory, dedicated IP, crypto, geen KYC, nachtelijke back-ups — is waar de Pro-lijn voor is. Het is niet het goedkoopste per gigabyte, en als je geen privacy nodig hebt kun je elders goedkoper RAM vinden. Maar als de index je product is en niet weg kan, is dit de vorm die past.
Waar te beginnen
Kies een plan met ruimte voor de index plus alles eromheen — de app, de model-client, ruimte om te groeien. Voor de meeste echte corpora is dat Pro-48 (48 GB); een grote gaat naar Pro-64 of Pro-80. Laad eerst een sample, kijk naar geheugen, dimensioneer op het getal dat je hebt gemeten — niet het getal dat je vreesde.
Als je retrieval deel is van een groter agent-systeem, houdt dezelfde box vaak ook de agent-vloot — zo wordt een 48 GB-plan stilletjes een 64 GB-plan.
Reacties
Nog geen reacties. Wees de eerste.