L'erreur la plus courante avec l'hébergement d'agents est de dimensionner pour un seul agent. Quelqu'un fait tourner un agent unique, le voit utiliser 400 Mo, et conclut que les agents sont peu coûteux à héberger. Puis il passe à une vraie équipe et la machine se met à swapper à 3 h du matin.
Un agent est peu coûteux. Ce n'est pas le cas intéressant.
Où va réellement la mémoire
Un agent qui ne fait que lancer des appels d'API vers un modèle est léger — il attend surtout sur le réseau. Faites-en tourner une douzaine sur une petite offre et vous ne le remarqueriez jamais.
La RAM disparaît quand les agents conservent un état. Un historique qui grandit à chaque tour. Un ensemble de travail que plusieurs agents lisent et écrivent. Un stockage vectoriel pour la mémoire à long terme dans le même processus. Dès l'instant où l'architecture cesse d'être « appeler l'API, oublier » et devient « se souvenir, coordonner, transmettre », la mémoire est la contrainte — pas le CPU. Les boucles de type CrewAI, LangGraph, AutoGPT tendent toutes vers cela à mesure qu'elles deviennent sérieuses. Ce n'est pas le framework qui consomme la RAM ; c'est l'état. Nous avons creusé les chiffres ici.
Dimensionnement approximatif
- Agents légers, liés à l'API — vous n'avez pas besoin de Pro ; une offre NAT ou à IP dédiée (3–20 $) suffit amplement. Sautez le reste de cette page.
- Une vraie équipe (5 à 10 agents) avec mémoire partagée plus un stockage vectoriel utile — Pro-32 (32 Go) est le point idéal. La plupart des flottes atterrissent ici.
- Flottes plus grandes, historiques plus longs, un index mémoire de plusieurs millions — Pro-64 (64 Go). C'est ici qu'une machine remplace les trois plus petites que vous jongleriez autrement.
- Flotte plus services co-localisés, ou agents plus inférence locale — jusqu'à Pro-80 (80 Go).
Commencez en dessous de là où vous pensez devoir être, surveillez htop une journée, redimensionnez à la hausse quand vous voyez du swap. Viser trop haut ne fait que gaspiller de l'argent.
Pourquoi cette forme d'hébergeur
Une flotte qui provisionne ou gère ses propres serveurs veut une API qu'elle peut piloter sans humain — et, de plus en plus, payer sans un non plus. Haute mémoire, une IP dédiée, paiement en crypto, sans KYC, et le tout commandable par un agent via MCP : cette combinaison est rare, et c'est ce pour quoi la gamme Pro est bâtie. Ce n'est pas le moins cher au gigaoctet, et si vos agents sont légers, vous n'en avez vraiment pas besoin. Mais pour un système sérieux qui conserve un état et valorise la confidentialité, c'est le bon choix.
Quand vous y êtes, Pro-32 couvre une vraie équipe ; montez à 64 ou 80 Go à mesure que la flotte grandit.
Commentaires
Pas encore de commentaires. Soyez le premier.