En RAG-demo på en laptop med tvåhundra dokument känns ansträngningslös. Sedan riktar du den mot ett verkligt korpus — ett företags dokument, år av ärenden, en faktisk kunskapsbas — och det hela blir ett minnesproblem. Inte ett CPU-problem. Ett minnes-problem.
Här är delen de flesta hosting-sidor hoppar över: snabb retrieval vill ha indexet i RAM. Varje textchunk blir en embedding — en vektor ett par hundra till ett par tusen tal bred — och att söka innebär att jämföra din fråga mot dem alla, snabbt. På disk fungerar det, men varje fråga betalar en latensskatt, och low-latency retrieval var anledningen till att du självhostade från första början.
Dimensioneringsmatematiken, ärligt
Mät ditt eget korpus — dimension och indextyp svänger detta mycket — men som en startkänsla:
- Ett par hundratusen embeddings — 2–4 GB. En personlig kunskapsbas. Du behöver inte Pro för detta; ett mindre plan räcker.
- Låga miljoner — med appen, model-klienten och OS:et runt det, planera för 16–32 GB. En seriös företagskunskapsbas. Det är här Pro-32 eller Pro-48 börjar bli meningsfullt.
- Tiotals miljoner, eller högdimensionella vektorer — 48 GB och uppåt, och bortom ~80 GB delar du indexet över servrar. Stora dokumentbestånd, multi-tenant retrieval, flera index varma samtidigt.
Vi skrev ut hela RAM-kurvan här om du vill ha detaljerna.
Varför high-memory och no-KYC tillsammans
Att hyra 48 GB RAM är lätt. Att hyra det med krypto och ingen identitetskontroll är det inte — de flesta hostar som säljer seriöst minne billigt gör det bakom ett kort och ett KYC-formulär. Dina embeddings är inte abstrakta tal; de kodar texten de kom från. Dina dokument, dina kunders innehåll, förvandlat till vektorer. Om den datan är känslig nog att du betalar privat, undergräver ett managed vektor-moln hela poängen — och det gör en host som knyter servern till din identitet också.
Den kombinationen — high memory, dedikerad IP, krypto, ingen KYC, nattliga säkerhetskopior — är vad Pro-linjen är till för. Det är inte det billigaste per gigabyte, och om du inte behöver integritet kan du hitta RAM billigare någon annanstans. Men om indexet är din produkt och det inte kan lämna, är detta formen som passar.
Var du ska börja
Välj ett plan med marginal för indexet plus allt runt det — appen, model-klienten, utrymme att växa. För de flesta verkliga korpora är det Pro-48 (48 GB); ett stort går till Pro-64 eller Pro-80. Ladda ett stickprov först, titta på minnet, dimensionera från talet du mätte — inte det du fruktade.
Om din retrieval är del av ett större agent-system håller samma box ofta agent-flottan också — så blir ett 48 GB-plan tyst ett 64 GB-plan.
Kommentarer
Inga kommentarer än. Bli först.