EQVPS

Comment installer Ollama sur un VPS (et appeler son API)

Installez Ollama sur un VPS, récupérez un petit modèle et appelez son API HTTP — avec la note honnête qu'il s'agit de machines CPU, alors restez sur de petits modèles quantifiés et des embeddings. Commandes copier-coller, et comment l'exposer en toute sécurité.

Ollama fait de l'exécution d'un modèle local une installation en une ligne. Voici le guide ; pour l'image honnête de ce que l'inférence CPU peut et ne peut pas faire (et le point idéal du RAG), voyez le cas d'usage VPS pour Ollama et auto-héberger Ollama.

1. Installer Ollama

curl -fsSL https://ollama.com/install.sh | sh

Cela installe Ollama et le démarre comme service systemd écoutant sur localhost:11434.

2. Récupérer et lancer un petit modèle

Sur une machine CPU, commencez petit :

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Les modèles 3B sont vraiment utilisables en CPU ; les 7–8B tournent à quelques tokens/sec (bien pour le batch, pénible pour le chat) ; les 13B+ vont swapper et ramper — évitez.

3. Appeler l'API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Les embeddings sont le point idéal du CPU :

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Gardez-le sur localhost — exposez en sécurité si nécessaire

Ollama écoute par défaut sur 127.0.0.1:11434. Laissez-le là. Si vous devez l'atteindre depuis une autre machine, placez devant un reverse proxy avec auth sur un plan à IP dédiée (guide nginx + HTTPS) ou utilisez un tunnel SSH — n'exposez jamais publiquement un endpoint de modèle non authentifié.

La partie honnête

Ce sont des instances CPU uniquement (pas de GPU). Les petits modèles quantifiés et les embeddings tournent bien ; les gros non. Associez Ollama à une base de données vectorielle pour une pile RAG privée — de petits embeddings locaux plus un magasin vectoriel local, c'est le montage qui brille vraiment ici. Medium (12 $/mois, 6 Go) est le plan confortable. Root en une minute environ, sans KYC, paiement en crypto.

FAQ

Comment installer Ollama sur un VPS ?

Une commande : curl -fsSL https://ollama.com/install.sh | sh. Puis ollama pull un petit modèle et ollama run, ou appelez l'API HTTP sur localhost:11434. Les étapes sont ci-dessous. Sur un VPS CPU, restez sur de petits modèles quantifiés (1B–8B) et des embeddings — les gros modèles réclament un GPU.

Les modèles seront-ils rapides sur un VPS CPU ?

Les petits oui, les gros non. Attendez-vous à quelques tokens par seconde sur un modèle 7–8B en quantification 4 bits, et des performances vraiment réactives sur les modèles 1–3B et les modèles d'embeddings. Excellent pour les jobs en arrière-plan, la classification et les pipelines RAG — pas pour un chat interactif rapide sur un gros modèle.

Faut-il exposer l'API d'Ollama à Internet ?

Non. Gardez-la sur localhost:11434. Si vous avez besoin d'un accès distant, mettez-la derrière un reverse proxy avec authentification sur un plan à IP dédiée, ou atteignez-la via un tunnel SSH. N'exposez jamais un endpoint de modèle non authentifié sur l'Internet ouvert.

Quel plan me faut-il ?

Notre Medium (12 $/mois, 6 Go) convient confortablement aux petits modèles et aux embeddings ; Small (8 $) suffit pour tester des modèles 1–3B. Ce sont des instances CPU uniquement — pas de GPU — donc dimensionnez selon l'empreinte RAM du modèle, pas en espérant de la vitesse.

Demandez-vous une pièce d'identité ou une carte ?

Non. Un e-mail pour s'inscrire, paiement en USDC ou USDT — pas de documents, pas de carte.

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.