Envoyer chaque prompt à l'API de quelqu'un d'autre convient — jusqu'à ce que ce ne soit plus le cas. Peut-être que les données sont sensibles et que vous préférez qu'elles ne quittent jamais votre serveur. Peut-être que vous en avez assez des rate-limits, ou d'une version de modèle qui change sous vos pieds, ou d'un compteur au token qui tourne pendant que vous expérimentez. À un moment, « et si je faisais tourner le mien ? » cesse d'être une expérience de pensée.
Ollama rend cela vraiment facile. La question plus difficile est ce qui tient sur un VPS — et ici, la réponse honnête compte plus que le battage.
Ce que vous pouvez réellement faire tourner sur CPU
Pas de GPU ? Alors vous faites de l'inférence CPU, et la taille du modèle est tout. La quantification (compresser les poids en 4 bits) est ce qui rend cela pratique — vous perdez une miette de qualité et économisez un tas de mémoire.
Chiffres approximatifs, ceux qui comptent :
- Modèle 3B, 4 bits — ~3 Go de RAM. Assez réactif pour le chat et les tâches simples.
- Modèle 7B, 4 bits — ~5 Go de RAM. Le point idéal : nettement plus malin, tourne encore à un rythme lisible.
- 13B et plus — 8-10 Go+ et lent sur CPU. Techniquement possible, pratiquement agaçant.
La vitesse, honnêtement : sur quelques vCPU vous verrez une poignée de tokens par seconde. Parfaitement bien pour un chatbot ou un assistant de codage où vous lisez au fur et à mesure. Pas bien pour traiter un million de documents en batch — c'est un travail de GPU, et nous ne prétendons pas le contraire. Nous n'offrons pas d'instances GPU. Si votre plan a besoin d'un modèle 70B ou d'un débit élevé, un VPS CPU — le nôtre ou celui de n'importe qui — est le mauvais outil, et vous devriez le savoir avant de dépenser un centime.
Mais un 7B privé qui répond à vos questions et ne téléphone jamais à la maison ? Ça tourne confortablement sur une machine de 6 Go.
L'installation — trois commandes
Montez le serveur, connectez-vous en SSH, et :
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
C'est tout — vous discutez dans le terminal. Pour l'utiliser depuis votre propre code, Ollama sert déjà une API HTTP sur le port 11434 :
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Un piège à connaître d'avance : par défaut, cette API se lie à localhost. Gardez-la ainsi et faites un tunnel via SSH, ou elle est exposée à Internet. Si vous voulez qu'elle soit joignable, placez-la derrière une authentification — ne laissez pas un point de terminaison de modèle ouvert sur une IP publique.
Choisir la machine
Adaptez l'offre au modèle, pas l'inverse :
| Ce que vous voulez faire tourner | RAM nécessaire | Offre raisonnable |
|---|---|---|
| Modèle 3B, usage léger | ~3 Go | Small (4 Go) |
| Modèle 7B, confortablement | ~5-6 Go | Medium (6 Go) |
| Plus grand / débit élevé | territoire GPU | pas un VPS CPU |
Pour la plupart des auto-hébergeurs, Medium (6 Go) est la recommandation honnête — assez de marge pour un modèle 7B plus votre app et l'OS. Small (4 Go) fonctionne si vous vous en tenez au 3B. Tout ce qui est en dessous est trop juste une fois que l'OS et le contexte grignotent.
Pourquoi le faire ici
Si vous auto-hébergez un LLM, la confidentialité est généralement la moitié de la raison — il serait donc étrange de remettre votre pièce d'identité pour louer la machine. Vous n'y êtes pas obligé : vous pouvez payer en USDC ou USDT (ou par carte via l'on-ramp), sans KYC, et le serveur est à vous en une minute environ. Crypto-natif, compatible agent, et les données restent sur une machine que vous contrôlez.
Le compromis est celui sur lequel nous avons été honnêtes : CPU uniquement, un plafond de 6 Go, de petits modèles. Dans ce cadre, l'auto-hébergement est excellent. En dehors, ne laissez personne vous vendre une machine CPU pour un travail qui nécessite un GPU.
Prêt à essayer ? Choisissez une offre, payez, et vous aurez root en 60 secondes environ — puis c'est trois commandes vers votre propre modèle privé.
Commentaires
Pas encore de commentaires. Soyez le premier.