EQVPS
Inizia

VPS per RAG self-hosted su scala

La retrieval-augmented generation smette di essere una demo da laptop una volta che il corpus è reale. Un indice vettoriale vuole RAM, e i tuoi embedding sono i tuoi dati privati. Ecco la matematica del dimensionamento e perché si adatta l'hosting ad alta memoria no-KYC. Da $55/mese.

Una demo RAG su un laptop con duecento documenti sembra senza sforzo. Poi la punti su un corpus reale — i documenti di un'azienda, anni di ticket, una vera knowledge base — e il tutto diventa un problema di memoria. Non un problema di CPU. Uno di memoria.

Ecco la parte che la maggior parte delle pagine di hosting salta: il recupero veloce vuole l'indice in RAM. Ogni chunk di testo diventa un embedding — un vettore largo da qualche centinaio a un paio di migliaia di numeri — e cercare significa confrontare la tua query con tutti loro, velocemente. Su disco funziona, ma ogni query paga una tassa di latenza, e il recupero a bassa latenza era il motivo per cui hai fatto self-hosting in primo luogo.

La matematica del dimensionamento, onestamente

Misura il tuo corpus — dimensione e tipo di indice fanno oscillare molto questo — ma come sensazione di partenza:

Abbiamo scritto l'intera curva di RAM qui se vuoi i dettagli.

Perché alta memoria e no-KYC insieme

Affittare 48 GB di RAM è facile. Affittarli con crypto e senza controllo d'identità non lo è — la maggior parte degli host che vende memoria seria a poco prezzo lo fa dietro una carta e un modulo KYC. I tuoi embedding non sono numeri astratti; codificano il testo da cui vengono. I tuoi documenti, i contenuti dei tuoi clienti, trasformati in vettori. Se quel dato è abbastanza sensibile da farti pagare in privato, un cloud vettoriale gestito disfa tutto il senso — e così fa un host che lega il server alla tua identità.

Quella combinazione — alta memoria, IP dedicato, crypto, niente KYC, backup notturni — è ciò per cui è la linea Pro. Non è la più economica per gigabyte, e se non ti serve privacy puoi trovare RAM più economica altrove. Ma se l'indice è il tuo prodotto e non può uscire, è questa la forma che si adatta.

Da dove iniziare

Scegli un piano con margine per l'indice più tutto ciò che gli sta attorno — l'app, il client del modello, spazio per crescere. Per la maggior parte dei corpora reali è Pro-48 (48 GB); uno grande va a Pro-64 o Pro-80. Carica prima un campione, guarda la memoria, dimensiona dal numero che hai misurato — non da quello che hai temuto.

Se il tuo recupero è parte di un sistema di agenti più grande, la stessa macchina spesso tiene anche la flotta di agenti — è così che un piano da 48 GB diventa silenziosamente uno da 64 GB.

Pronto a fare il deploy? Paga in crypto, niente KYC — online in circa un minuto.

Fai il deploy ora →

FAQ

Quanta RAM serve davvero al mio setup RAG?

Scala con il numero di embedding e la larghezza del vettore. Qualche centinaio di migliaia di chunk sta in 2–4 GB; milioni bassi, con l'app e l'OS attorno, atterrano a 16–32 GB; decine di milioni spingono a 48 GB e oltre. Misura un campione, guarda la memoria residente, estrapola — non tirare a indovinare alto, pagherai solo di più.

Perché non usare un servizio vettoriale gestito?

Due motivi per cui la gente fa davvero self-hosting: i tuoi embedding codificano dati privati (documenti, note, contenuti dei clienti), quindi tenerli su una macchina che controlli conta; e il costo è fisso — un servizio gestito fattura per vettori e query, un VPS è un unico numero mensile che puoi martellare quanto vuoi.

pgvector o un motore dedicato?

Se già usi Postgres, pgvector è la via di minor sforzo — un'estensione. Per milioni di vettori con filtri pesanti, un motore dedicato come Qdrant si guadagna il proprio servizio. Inizia con ciò che gestisci; separalo quando la ricerca rallenta, non prima.

Mi serve una GPU per il RAG?

No. Il recupero è lavoro di CPU + RAM — confrontare vettori, non generare testo. Il passo di generazione chiama il tuo LLM (un'API, o un host di modello separato). Una macchina CPU ad alta memoria è esattamente la forma giusta per la metà del recupero.

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.