Chaleur estivale — tout fond, même nos prix.−25%−25 % sur chaque offre annuelle, jusqu'au 31 aoûtVoir les offres
EQVPS
Commencer

Auto-héberger un LLM local sur un VPS avec Ollama — ce qui fonctionne vraiment

Jun 14, 2026 · 4 min de lecture · EQVPS Team

Envoyer chaque prompt à l'API de quelqu'un d'autre convient — jusqu'à ce que ce ne soit plus le cas. Peut-être que les données sont sensibles et que vous préférez qu'elles ne quittent jamais votre serveur. Peut-être que vous en avez assez des rate-limits, ou d'une version de modèle qui change sous vos pieds, ou d'un compteur au token qui tourne pendant que vous expérimentez. À un moment, « et si je faisais tourner le mien ? » cesse d'être une expérience de pensée.

Ollama rend cela vraiment facile. La question plus difficile est ce qui tient sur un VPS — et ici, la réponse honnête compte plus que le battage.

Ce que vous pouvez réellement faire tourner sur CPU

Pas de GPU ? Alors vous faites de l'inférence CPU, et la taille du modèle est tout. La quantification (compresser les poids en 4 bits) est ce qui rend cela pratique — vous perdez une miette de qualité et économisez un tas de mémoire.

Chiffres approximatifs, ceux qui comptent :

La vitesse, honnêtement : sur quelques vCPU vous verrez une poignée de tokens par seconde. Parfaitement bien pour un chatbot ou un assistant de codage où vous lisez au fur et à mesure. Pas bien pour traiter un million de documents en batch — c'est un travail de GPU, et nous ne prétendons pas le contraire. Nous n'offrons pas d'instances GPU. Si votre plan a besoin d'un modèle 70B ou d'un débit élevé, un VPS CPU — le nôtre ou celui de n'importe qui — est le mauvais outil, et vous devriez le savoir avant de dépenser un centime.

Mais un 7B privé qui répond à vos questions et ne téléphone jamais à la maison ? Ça tourne confortablement sur une machine de 6 Go.

L'installation — trois commandes

Montez le serveur, connectez-vous en SSH, et :

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

C'est tout — vous discutez dans le terminal. Pour l'utiliser depuis votre propre code, Ollama sert déjà une API HTTP sur le port 11434 :

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Un piège à connaître d'avance : par défaut, cette API se lie à localhost. Gardez-la ainsi et faites un tunnel via SSH, ou elle est exposée à Internet. Si vous voulez qu'elle soit joignable, placez-la derrière une authentification — ne laissez pas un point de terminaison de modèle ouvert sur une IP publique.

Choisir la machine

Adaptez l'offre au modèle, pas l'inverse :

Ce que vous voulez faire tournerRAM nécessaireOffre raisonnable
Modèle 3B, usage léger~3 GoSmall (4 Go)
Modèle 7B, confortablement~5-6 GoMedium (6 Go)
Plus grand / débit élevéterritoire GPUpas un VPS CPU

Pour la plupart des auto-hébergeurs, Medium (6 Go) est la recommandation honnête — assez de marge pour un modèle 7B plus votre app et l'OS. Small (4 Go) fonctionne si vous vous en tenez au 3B. Tout ce qui est en dessous est trop juste une fois que l'OS et le contexte grignotent.

Pourquoi le faire ici

Si vous auto-hébergez un LLM, la confidentialité est généralement la moitié de la raison — il serait donc étrange de remettre votre pièce d'identité pour louer la machine. Vous n'y êtes pas obligé : vous pouvez payer en USDC ou USDT (ou par carte via l'on-ramp), sans KYC, et le serveur est à vous en une minute environ. Crypto-natif, compatible agent, et les données restent sur une machine que vous contrôlez.

Le compromis est celui sur lequel nous avons été honnêtes : CPU uniquement, un plafond de 6 Go, de petits modèles. Dans ce cadre, l'auto-hébergement est excellent. En dehors, ne laissez personne vous vendre une machine CPU pour un travail qui nécessite un GPU.

Prêt à essayer ? Choisissez une offre, payez, et vous aurez root en 60 secondes environ — puis c'est trois commandes vers votre propre modèle privé.

FAQ

Puis-je faire tourner un LLM sans GPU ?

Oui, pour de petits modèles. Un modèle 3B ou 7B en quantification 4 bits tourne sur CPU et répond à un rythme lisible — bien pour un chatbot, un assistant de codage, ou des tâches de fond où vous ne fixez pas le curseur. Ce que vous ne pouvez pas faire sur CPU, c'est servir un grand modèle (13B et plus) ou pousser un débit élevé ; c'est là qu'un GPU cesse d'être facultatif.

De combien de RAM ai-je besoin pour Llama 7B ?

Environ 5 Go pour un modèle 7B en 4 bits une fois la fenêtre de contexte et l'OS ajoutés — donc une machine de 6 Go est le plancher confortable. Un modèle 3B tient dans environ 3 Go. Une quantification plus petite (Q4) échange un peu de qualité contre beaucoup moins de mémoire, ce qui est le bon compromis sur un VPS.

Auto-héberger un LLM est-il moins cher qu'une API ?

Cela dépend du volume. Une API hébergée facture au token et ne coûte rien au repos ; un VPS est une facture mensuelle fixe que vous l'utilisiez ou non. Si vous faites tourner un flux constant de requêtes, ou que vous vous souciez surtout de la confidentialité et de l'absence de rate-limits, l'auto-hébergement gagne. Pour des prompts ponctuels occasionnels, une API à l'usage est moins chère.

Pourquoi auto-héberger plutôt qu'utiliser une API cloud ?

Trois raisons pour lesquelles les gens le font vraiment : les données ne quittent jamais votre serveur (réel pour le juridique, le médical, ou juste des notes privées), il n'y a pas de rate-limits ni de compteur au token, et le modèle ne changera pas ni ne sera déprécié sous vos pieds. Le coût, c'est que vous gérez la machine et vivez dans ses limites matérielles.

Quel est le plus gros modèle que je peux réalistement faire tourner sur un VPS CPU ?

Un modèle 7B en 4 bits est le point idéal sur une machine de 6 Go. Vous pouvez techniquement charger un 13B avec assez de RAM, mais sur CPU il devient assez lent pour que vous le sentiez. Au-delà, vous voulez un GPU, qui est un autre type d'hôte.

← Retour au blogVoir les offres & tarifs →

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.