Chaleur estivale — tout fond, même nos prix.−25%−25 % sur chaque offre annuelle, jusqu'au 31 aoûtVoir les offres
EQVPS
Commencer

VPS pour RAG auto-hébergé à grande échelle

La génération augmentée par récupération cesse d'être une démo sur portable dès que le corpus est réel. Un index vectoriel réclame de la RAM, et vos embeddings sont vos données privées. Voici le calcul de dimensionnement et pourquoi l'hébergement haute mémoire sans KYC convient. Dès 55 $/mois.

Une démo RAG sur un portable avec deux cents documents semble sans effort. Puis vous la pointez sur un corpus réel — la documentation d'une entreprise, des années de tickets, une véritable base de connaissances — et le tout devient un problème de mémoire. Pas un problème de CPU. Un problème de mémoire.

Voici la partie que la plupart des pages d'hébergement sautent : une récupération rapide veut l'index en RAM. Chaque chunk de texte devient un embedding — un vecteur de quelques centaines à quelques milliers de nombres de large — et chercher signifie comparer votre requête à tous, rapidement. Sur disque ça fonctionne, mais chaque requête paie une taxe de latence, et la récupération à faible latence était la raison pour laquelle vous avez auto-hébergé au départ.

Le calcul de dimensionnement, honnêtement

Mesurez votre propre corpus — la dimension et le type d'index font beaucoup varier cela — mais comme point de départ :

Nous avons détaillé toute la courbe de RAM ici si vous voulez les détails.

Pourquoi haute mémoire et sans KYC ensemble

Louer 48 Go de RAM est facile. La louer en crypto et sans vérification d'identité ne l'est pas — la plupart des hébergeurs qui vendent de la mémoire sérieuse à bas prix le font derrière une carte et un formulaire KYC. Vos embeddings ne sont pas des nombres abstraits ; ils encodent le texte dont ils proviennent. Vos docs, le contenu de vos clients, transformés en vecteurs. Si ces données sont assez sensibles pour que vous payiez de façon privée, un cloud vectoriel managé annule tout l'intérêt — tout comme un hébergeur qui lie le serveur à votre identité.

Cette combinaison — haute mémoire, IP dédiée, crypto, sans KYC, sauvegardes nocturnes — est ce à quoi sert la gamme Pro. Ce n'est pas le moins cher au gigaoctet, et si vous n'avez pas besoin de confidentialité vous pouvez trouver de la RAM moins chère ailleurs. Mais si l'index est votre produit et qu'il ne peut pas partir, c'est la forme qui convient.

Par où commencer

Choisissez une offre avec de la marge pour l'index plus tout ce qui l'entoure — l'application, le client de modèle, de la place pour grandir. Pour la plupart des corpus réels, c'est Pro-48 (48 Go) ; un grand va vers Pro-64 ou Pro-80. Chargez un échantillon d'abord, surveillez la mémoire, dimensionnez à partir du chiffre que vous avez mesuré — pas de celui que vous craigniez.

Si votre récupération fait partie d'un système d'agents plus vaste, la même machine héberge souvent aussi la flotte d'agents — c'est ainsi qu'une offre 48 Go devient discrètement une 64 Go.

Prêt à déployer ? Payez en crypto, sans KYC — en ligne en une minute environ.

Déployer →

FAQ

De combien de RAM ma configuration RAG a-t-elle réellement besoin ?

Cela évolue avec le nombre d'embeddings et la largeur des vecteurs. Quelques centaines de milliers de chunks tiennent dans 2–4 Go ; quelques millions, avec l'application et l'OS autour, atterrissent à 16–32 Go ; des dizaines de millions poussent vers 48 Go et au-delà. Mesurez un échantillon, surveillez la mémoire résidente, extrapolez — ne visez pas trop haut, vous ne feriez que surpayer.

Pourquoi ne pas utiliser un service vectoriel managé ?

Deux raisons pour lesquelles les gens auto-hébergent vraiment : vos embeddings encodent des données privées (docs, notes, contenu client), donc les garder sur une machine que vous contrôlez compte ; et le coût est fixe — un service managé facture aux vecteurs et aux requêtes, un VPS est un seul chiffre mensuel que vous pouvez marteler autant que vous voulez.

pgvector ou un moteur dédié ?

Si vous faites déjà tourner Postgres, pgvector est la voie la moins coûteuse — une extension. Pour des millions de vecteurs avec un filtrage lourd, un moteur dédié comme Qdrant mérite son propre service. Commencez avec ce que vous exploitez ; séparez-le quand la recherche ralentit, pas avant.

Ai-je besoin d'un GPU pour le RAG ?

Non. La récupération est un travail CPU + RAM — comparer des vecteurs, pas générer du texte. L'étape de génération appelle votre LLM (une API, ou un hôte de modèle séparé). Une machine CPU haute mémoire est exactement la bonne forme pour la moitié récupération.

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.