Soyons honnêtes d'emblée : si vous voulez une génération rapide, bon marché et de haute qualité, appelez une API. Un VPS CPU ne battra pas un centre de données rempli de GPU, et quiconque vous dit le contraire vend quelque chose.
Alors pourquoi auto-héberger l'inférence ? Une raison, et elle est bonne : le modèle sur votre serveur n'envoie jamais vos prompts nulle part.
À quoi ressemble réellement l'inférence CPU
Vous pouvez faire tourner de vrais modèles sur CPU avec assez de RAM. Un modèle 7–8B quantifié en 4 bits fonctionne. Un 13B fonctionne. Vous pouvez même pousser un modèle de classe 30B si vous avez la mémoire. Ce que vous ne pouvez pas faire, c'est le rendre rapide — la sortie arrive à quelques tokens par seconde, pas le flux instantané que donne une API.
C'est le compromis honnête. Pour un chat interactif, c'est frustrant. Pour du travail de fond — résumer des documents pendant la nuit, classer une file, enrichir des données selon un calendrier — quelques tokens par seconde conviennent parfaitement, et personne ne regarde l'horloge.
Le calcul de RAM
Le modèle doit résider en mémoire, quantifié ou non, plus l'overhead pour le contexte et le runtime :
- 7–8B, 4 bits — environ 6–8 Go. Tourne sur une offre moyenne.
- 13B, 4 bits — à peu près 10–16 Go.
- Classe 30B, quantifiée — 24–48 Go, selon la quantification.
- Plus grand, ou précision supérieure — vous êtes vite à 64–80 Go — et au-delà de 80 Go, aucune machine Pro unique ne convient, toujours lente en CPU.
C'est pourquoi « faire tourner un modèle local » devient discrètement une question de haute mémoire. Le modèle est l'empreinte mémoire. Ajoutez un index RAG ou des agents sur la même machine et les chiffres s'additionnent.
Ollama vs vLLM, brièvement
Ollama est la porte d'entrée facile — installez, ollama run, c'est fait. C'est le bon outil pour une configuration privée mono-utilisateur où vous voulez simplement le modèle disponible. vLLM est bâti pour le débit de service : plus de configuration, meilleur sous charge concurrente, ça vaut le coup quand vous gérez réellement du volume. Commencez avec Ollama ; passez à vLLM quand vous servez du vrai trafic.
Là où le tout-privé gagne vraiment
L'argument pour l'inférence auto-hébergée n'est ni la vitesse ni le coût — c'est que certaines données ne peuvent pas partir. Documents juridiques. Dossiers médicaux. Code propriétaire. Tout ce où envoyer le prompt à une API tierce est exclu pour des raisons de politique ou de confiance. Un modèle plus lent qui tourne entièrement sur votre machine bat un modèle rapide qui journalise tout ce que vous lui envoyez.
Et si les données sont à ce point sensibles, le paiement devrait probablement l'être aussi. Louer la machine avec de la crypto et sans KYC garde toute la chaîne — serveur, modèle, prompts, facturation — hors des registres d'identité de qui que ce soit. C'est l'argument réel : non pas « une inférence moins chère », mais « une inférence que personne d'autre ne peut voir ».
En résumé
Pour la vitesse et la qualité, utilisez une API — sans honte. Auto-hébergez quand la confidentialité est l'exigence et qu'un peu plus lent est acceptable. Dimensionnez pour le modèle plus son contexte plus tout ce qui partage la machine, et n'attendez pas une vitesse GPU d'un CPU.
Quand le modèle a besoin de vraie mémoire, la gamme Pro fait tourner de 32 à 80 Go avec une IP dédiée et des sauvegardes nocturnes — assez pour héberger un modèle quantifié sérieux avec de la place pour le contexte autour.
Commentaires
Pas encore de commentaires. Soyez le premier.