Une démo RAG sur un portable avec deux cents documents semble sans effort. Puis vous la pointez sur un corpus réel — la documentation d'une entreprise, des années de tickets, une véritable base de connaissances — et le tout devient un problème de mémoire. Pas un problème de CPU. Un problème de mémoire.
Voici la partie que la plupart des pages d'hébergement sautent : une récupération rapide veut l'index en RAM. Chaque chunk de texte devient un embedding — un vecteur de quelques centaines à quelques milliers de nombres de large — et chercher signifie comparer votre requête à tous, rapidement. Sur disque ça fonctionne, mais chaque requête paie une taxe de latence, et la récupération à faible latence était la raison pour laquelle vous avez auto-hébergé au départ.
Le calcul de dimensionnement, honnêtement
Mesurez votre propre corpus — la dimension et le type d'index font beaucoup varier cela — mais comme point de départ :
- Quelques centaines de milliers d'embeddings — 2–4 Go. Une base de connaissances personnelle. Vous n'avez pas besoin de Pro pour ça ; une offre plus petite convient.
- Quelques millions — avec l'application, le client de modèle et l'OS autour, prévoyez 16–32 Go. Une base de connaissances d'entreprise sérieuse. C'est ici que Pro-32 ou Pro-48 commence à avoir du sens.
- Des dizaines de millions, ou des vecteurs de haute dimension — 48 Go et plus, et au-delà de ~80 Go vous répartissez l'index sur plusieurs serveurs. Grands parcs documentaires, récupération multi-tenant, plusieurs index chauds à la fois.
Nous avons détaillé toute la courbe de RAM ici si vous voulez les détails.
Pourquoi haute mémoire et sans KYC ensemble
Louer 48 Go de RAM est facile. La louer en crypto et sans vérification d'identité ne l'est pas — la plupart des hébergeurs qui vendent de la mémoire sérieuse à bas prix le font derrière une carte et un formulaire KYC. Vos embeddings ne sont pas des nombres abstraits ; ils encodent le texte dont ils proviennent. Vos docs, le contenu de vos clients, transformés en vecteurs. Si ces données sont assez sensibles pour que vous payiez de façon privée, un cloud vectoriel managé annule tout l'intérêt — tout comme un hébergeur qui lie le serveur à votre identité.
Cette combinaison — haute mémoire, IP dédiée, crypto, sans KYC, sauvegardes nocturnes — est ce à quoi sert la gamme Pro. Ce n'est pas le moins cher au gigaoctet, et si vous n'avez pas besoin de confidentialité vous pouvez trouver de la RAM moins chère ailleurs. Mais si l'index est votre produit et qu'il ne peut pas partir, c'est la forme qui convient.
Par où commencer
Choisissez une offre avec de la marge pour l'index plus tout ce qui l'entoure — l'application, le client de modèle, de la place pour grandir. Pour la plupart des corpus réels, c'est Pro-48 (48 Go) ; un grand va vers Pro-64 ou Pro-80. Chargez un échantillon d'abord, surveillez la mémoire, dimensionnez à partir du chiffre que vous avez mesuré — pas de celui que vous craigniez.
Si votre récupération fait partie d'un système d'agents plus vaste, la même machine héberge souvent aussi la flotte d'agents — c'est ainsi qu'une offre 48 Go devient discrètement une 64 Go.
Commentaires
Pas encore de commentaires. Soyez le premier.