Chaleur estivale — tout fond, même nos prix.−25%−25 % sur chaque offre annuelle, jusqu'au 31 aoûtVoir les offres
EQVPS
Commencer

Héberger l'inférence LLM locale en privé : ce qu'un VPS CPU peut et ne peut pas faire

Aug 9, 2026 · 3 min de lecture · EQVPS Team

Soyons honnêtes d'emblée : si vous voulez une génération rapide, bon marché et de haute qualité, appelez une API. Un VPS CPU ne battra pas un centre de données rempli de GPU, et quiconque vous dit le contraire vend quelque chose.

Alors pourquoi auto-héberger l'inférence ? Une raison, et elle est bonne : le modèle sur votre serveur n'envoie jamais vos prompts nulle part.

À quoi ressemble réellement l'inférence CPU

Vous pouvez faire tourner de vrais modèles sur CPU avec assez de RAM. Un modèle 7–8B quantifié en 4 bits fonctionne. Un 13B fonctionne. Vous pouvez même pousser un modèle de classe 30B si vous avez la mémoire. Ce que vous ne pouvez pas faire, c'est le rendre rapide — la sortie arrive à quelques tokens par seconde, pas le flux instantané que donne une API.

C'est le compromis honnête. Pour un chat interactif, c'est frustrant. Pour du travail de fond — résumer des documents pendant la nuit, classer une file, enrichir des données selon un calendrier — quelques tokens par seconde conviennent parfaitement, et personne ne regarde l'horloge.

Le calcul de RAM

Le modèle doit résider en mémoire, quantifié ou non, plus l'overhead pour le contexte et le runtime :

C'est pourquoi « faire tourner un modèle local » devient discrètement une question de haute mémoire. Le modèle est l'empreinte mémoire. Ajoutez un index RAG ou des agents sur la même machine et les chiffres s'additionnent.

Ollama vs vLLM, brièvement

Ollama est la porte d'entrée facile — installez, ollama run, c'est fait. C'est le bon outil pour une configuration privée mono-utilisateur où vous voulez simplement le modèle disponible. vLLM est bâti pour le débit de service : plus de configuration, meilleur sous charge concurrente, ça vaut le coup quand vous gérez réellement du volume. Commencez avec Ollama ; passez à vLLM quand vous servez du vrai trafic.

Là où le tout-privé gagne vraiment

L'argument pour l'inférence auto-hébergée n'est ni la vitesse ni le coût — c'est que certaines données ne peuvent pas partir. Documents juridiques. Dossiers médicaux. Code propriétaire. Tout ce où envoyer le prompt à une API tierce est exclu pour des raisons de politique ou de confiance. Un modèle plus lent qui tourne entièrement sur votre machine bat un modèle rapide qui journalise tout ce que vous lui envoyez.

Et si les données sont à ce point sensibles, le paiement devrait probablement l'être aussi. Louer la machine avec de la crypto et sans KYC garde toute la chaîne — serveur, modèle, prompts, facturation — hors des registres d'identité de qui que ce soit. C'est l'argument réel : non pas « une inférence moins chère », mais « une inférence que personne d'autre ne peut voir ».

En résumé

Pour la vitesse et la qualité, utilisez une API — sans honte. Auto-hébergez quand la confidentialité est l'exigence et qu'un peu plus lent est acceptable. Dimensionnez pour le modèle plus son contexte plus tout ce qui partage la machine, et n'attendez pas une vitesse GPU d'un CPU.

Quand le modèle a besoin de vraie mémoire, la gamme Pro fait tourner de 32 à 80 Go avec une IP dédiée et des sauvegardes nocturnes — assez pour héberger un modèle quantifié sérieux avec de la place pour le contexte autour.

FAQ

Puis-je faire tourner un LLM sans GPU ?

De petits modèles quantifiés, oui — et lentement. Un modèle 7–8B quantifié en 4 bits tourne sur CPU avec assez de RAM, mais vous mesurerez la sortie en quelques tokens par seconde, pas le flux réactif d'une API. Très bien pour du batch et des tâches de fond, pénible pour un chat interactif.

Combien de RAM pour l'inférence locale ?

Le modèle doit tenir en mémoire plus l'overhead. Un modèle 7–8B en 4 bits veut ~6–8 Go ; 13B environ 10–16 Go ; les modèles de classe 30B poussent vers 24–48 Go quantifiés. Ajoutez de la place pour le contexte et le reste sur la machine. C'est pourquoi l'inférence locale arrive vite en territoire haute mémoire.

Ollama ou vLLM ?

Ollama est la rampe d'accès facile — une commande, modèle tiré, en marche. vLLM est pour le débit et le service, plus de configuration, meilleur sous charge. Pour une machine privée mono-utilisateur, Ollama est généralement le bon choix ; vLLM quand vous servez réellement des requêtes en volume.

Pourquoi auto-héberger l'inférence si c'est plus lent ?

La confidentialité. Vos prompts et sorties ne touchent jamais les serveurs ou journaux d'un fournisseur. Pour des données sensibles — juridiques, médicales, code interne, tout ce que vous ne pouvez pas envoyer à un tiers — un modèle privé plus lent bat un modèle rapide qui voit tout. Associez-le à un paiement en crypto sans KYC et toute la chaîne reste la vôtre.

← Retour au blogVoir les offres & tarifs →

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.