Una demo RAG su un laptop con duecento documenti sembra senza sforzo. Poi la punti su un corpus reale — i documenti di un'azienda, anni di ticket, una vera knowledge base — e il tutto diventa un problema di memoria. Non un problema di CPU. Uno di memoria.
Ecco la parte che la maggior parte delle pagine di hosting salta: il recupero veloce vuole l'indice in RAM. Ogni chunk di testo diventa un embedding — un vettore largo da qualche centinaio a un paio di migliaia di numeri — e cercare significa confrontare la tua query con tutti loro, velocemente. Su disco funziona, ma ogni query paga una tassa di latenza, e il recupero a bassa latenza era il motivo per cui hai fatto self-hosting in primo luogo.
La matematica del dimensionamento, onestamente
Misura il tuo corpus — dimensione e tipo di indice fanno oscillare molto questo — ma come sensazione di partenza:
- Qualche centinaio di migliaia di embedding — 2–4 GB. Una knowledge base personale. Non ti serve Pro per questo; un piano più piccolo va bene.
- Milioni bassi — con l'app, il client del modello e l'OS attorno, prevedi 16–32 GB. Una seria knowledge base aziendale. È qui che Pro-32 o Pro-48 inizia ad avere senso.
- Decine di milioni, o vettori ad alta dimensione — 48 GB in su, e oltre i ~80 GB stai spezzando l'indice su più server. Grandi patrimoni documentali, recupero multi-tenant, diversi indici caldi in una volta.
Abbiamo scritto l'intera curva di RAM qui se vuoi i dettagli.
Perché alta memoria e no-KYC insieme
Affittare 48 GB di RAM è facile. Affittarli con crypto e senza controllo d'identità non lo è — la maggior parte degli host che vende memoria seria a poco prezzo lo fa dietro una carta e un modulo KYC. I tuoi embedding non sono numeri astratti; codificano il testo da cui vengono. I tuoi documenti, i contenuti dei tuoi clienti, trasformati in vettori. Se quel dato è abbastanza sensibile da farti pagare in privato, un cloud vettoriale gestito disfa tutto il senso — e così fa un host che lega il server alla tua identità.
Quella combinazione — alta memoria, IP dedicato, crypto, niente KYC, backup notturni — è ciò per cui è la linea Pro. Non è la più economica per gigabyte, e se non ti serve privacy puoi trovare RAM più economica altrove. Ma se l'indice è il tuo prodotto e non può uscire, è questa la forma che si adatta.
Da dove iniziare
Scegli un piano con margine per l'indice più tutto ciò che gli sta attorno — l'app, il client del modello, spazio per crescere. Per la maggior parte dei corpora reali è Pro-48 (48 GB); uno grande va a Pro-64 o Pro-80. Carica prima un campione, guarda la memoria, dimensiona dal numero che hai misurato — non da quello che hai temuto.
Se il tuo recupero è parte di un sistema di agenti più grande, la stessa macchina spesso tiene anche la flotta di agenti — è così che un piano da 48 GB diventa silenziosamente uno da 64 GB.
Commenti
Ancora nessun commento. Sii il primo.