Ollama fait de l'exécution d'un modèle local une installation en une ligne. Voici le guide ; pour l'image honnête de ce que l'inférence CPU peut et ne peut pas faire (et le point idéal du RAG), voyez le cas d'usage VPS pour Ollama et auto-héberger Ollama.
1. Installer Ollama
curl -fsSL https://ollama.com/install.sh | sh
Cela installe Ollama et le démarre comme service systemd écoutant sur localhost:11434.
2. Récupérer et lancer un petit modèle
Sur une machine CPU, commencez petit :
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Les modèles 3B sont vraiment utilisables en CPU ; les 7–8B tournent à quelques tokens/sec (bien pour le batch, pénible pour le chat) ; les 13B+ vont swapper et ramper — évitez.
3. Appeler l'API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Les embeddings sont le point idéal du CPU :
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Gardez-le sur localhost — exposez en sécurité si nécessaire
Ollama écoute par défaut sur 127.0.0.1:11434. Laissez-le là. Si vous devez l'atteindre depuis une autre machine, placez devant un reverse proxy avec auth sur un plan à IP dédiée (guide nginx + HTTPS) ou utilisez un tunnel SSH — n'exposez jamais publiquement un endpoint de modèle non authentifié.
La partie honnête
Ce sont des instances CPU uniquement (pas de GPU). Les petits modèles quantifiés et les embeddings tournent bien ; les gros non. Associez Ollama à une base de données vectorielle pour une pile RAG privée — de petits embeddings locaux plus un magasin vectoriel local, c'est le montage qui brille vraiment ici. Medium (12 $/mois, 6 Go) est le plan confortable. Root en une minute environ, sans KYC, paiement en crypto.
Commentaires
Pas encore de commentaires. Soyez le premier.