La réponse honnête à « de combien de serveur mon agent IA a-t-il besoin ? » est : moins que vous ne le pensez — jusqu'à ce que soudain ce ne soit plus le cas. L'astuce est de savoir de quel côté de cette ligne se trouve votre charge. Alors au lieu de deviner, voici ce que chaque type d'agent utilise réellement.
La seule question qui décide de tout
Le modèle tourne-t-il sur votre serveur, ou votre agent appelle-t-il un modèle via une API ?
Si votre agent parle à un LLM hébergé (le cas courant), la partie intelligente et coûteuse se produit sur le matériel de quelqu'un d'autre. Votre machine ne fait que tourner une boucle d'orchestration : prendre l'entrée, appeler l'API, analyser le résultat, peut-être interroger une base de données, répéter. C'est léger. Vraiment léger — une machine de 1 Go le fait sans forcer.
Si vous faites tourner le modèle localement, tout change : maintenant la RAM est dominée par les poids du modèle, et vous voudrez tous les cœurs possibles. La plupart des gens n'en ont pas besoin. Ceux qui en ont besoin savent généralement exactement pourquoi (confidentialité, pas de rate-limits, hors ligne). Si c'est vous, nous avons écrit un guide séparé sur l'auto-hébergement d'un LLM local.
Dimensionnement par charge
De vrais chiffres, du genre sur lequel vous pouvez agir :
| Charge | RAM | vCPU | Disque | Notes |
|---|---|---|---|---|
| Agent de chat / assistant (via API) | 1 Go | 2 | 15 Go | La boucle est minuscule ; le modèle est distant |
| Scraper / agent de données | 2 Go | 2 | 25 Go | Marge pour le parsing + les données scrapées |
| Bot de trading | 1–2 Go | 2 | 15–25 Go | La latence compte plus que la taille — voir le guide bot de trading |
| Plusieurs agents en parallèle | 4 Go | 4 | 35 Go | Chaque agent est peu coûteux ; la concurrence s'additionne |
| LLM local, 3B–7B (quantifié) | 4–6 Go | 4–6 | 25–45 Go | CPU uniquement, tourne à un rythme lisible, pas en masse |
Le schéma : les agents via API sont minuscules ; les modèles locaux sont la seule chose lourde.
Où une machine CPU s'arrête
Pour être direct sur le plafond : nos offres culminent à 6 Go de RAM et 6 cœurs, CPU uniquement — sans GPU. Cela couvre tout ce qui est dans le tableau ci-dessus, y compris un modèle local 7B pour un usage personnel. Ce que cela ne couvre pas : les modèles 13B+, l'inférence locale à haut débit, ou tout ce qui nécessite vraiment un GPU. Si c'est votre charge, un VPS CPU — le nôtre ou celui de n'importe qui — est le mauvais outil, et il vaut mieux le savoir maintenant qu'après avoir déployé.
Pour les 95 % d'agents qui appellent une API, rien de tout cela n'est un problème. Ils sont heureux sur la plus petite machine.
Une règle pratique
- Juste un agent qui appelle une API ? Commencez à 1 Go / 2 cœurs. Vous pouvez redimensionner plus tard.
- Scraping ou stockage de données ? 2 Go et un disque plus grand.
- Plusieurs agents, ou un petit modèle local ? 4–6 Go et 4+ cœurs.
- Besoin d'un GPU ? Catégorie différente — ne le forcez pas sur du CPU.
Ne sur-provisionnez pas par nervosité. Les agents sont légers par nature ; le coût d'une machine trop petite est un redimensionnement, tandis que le coût d'une machine trop grande est de payer de la RAM inutilisée chaque mois.
Quand vous avez choisi une taille, un agent peut louer la machine lui-même via MCP, ou vous pouvez la commander en une minute sur le site. Dans les deux cas, commencez petit — vous aurez presque certainement besoin de moins que prévu.
Commentaires
Pas encore de commentaires. Soyez le premier.