Réglons d'abord la partie décevante, car Internet est plein de pages qui ne le font pas.
Nos serveurs sont CPU uniquement. Nous n'offrons pas de GPU. Cela signifie que le travail LLM local ici a un plafond dur, et prétendre le contraire ne ferait que gaspiller votre argent.
Ce qui fonctionne vraiment sur CPU
Avec jusqu'à 6 vCPU et 6 Go de RAM (notre offre Medium — 12 $/mois), vous êtes dans la gamme des petits modèles quantifiés :
- Modèles 1B–3B (Q4) : réellement utilisables. Assez rapides pour la classification, l'étiquetage, le routage et l'extraction structurée simple.
- Modèles 7B–8B (Q4) : ils tournent, mais attendez-vous à quelques tokens par seconde. Très bien pour une file qui digère des documents pendant la nuit. Pénible comme fenêtre de chat.
- Modèles d'embeddings : excellent choix. Ils sont petits, rapides sur CPU, et c'est probablement la meilleure raison de faire tourner Ollama sur une machine comme les nôtres.
- 13B et plus : non. Vous swapperez et attendrez.
Si vous avez besoin d'un chat 70B rapide et interactif, il vous faut un hôte GPU — c'est un produit différent d'un fournisseur différent, et nous préférons vous le dire plutôt que de prendre vos 12 $.
Là où une machine CPU gagne vraiment
Confidentialité. Vos documents, vos prompts, vos embeddings — ne quittant jamais une machine que vous contrôlez, ne devenant jamais les données d'entraînement de quelqu'un. Pour beaucoup de gens, c'est tout l'intérêt, et quelques tokens par seconde sont un compromis acceptable.
Prévisibilité des coûts. Pas de facture au token. Un pipeline qui classe cinquante mille enregistrements coûte la même chose qu'un qui en classe cinquante : 12 $.
Travail asynchrone. La plupart du travail LLM utile n'est pas une fenêtre de chat. C'est une file : résume ceux-ci, étiquette ceux-là, encode ce corpus. Une machine CPU qui avale un arriéré pendant la nuit est parfaitement bonne pour ça.
Configuration
# Ubuntu 24.04 — offre Medium recommandée
curl -fsSL https://ollama.com/install.sh | sh
# Commencez petit et voyez par vous-même
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — le point idéal pour le CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama sert une API HTTP sur localhost:11434. Gardez-la là. Si vous devez l'atteindre depuis ailleurs, placez-la derrière un reverse proxy avec authentification sur une offre à IP dédiée — n'exposez jamais un point de terminaison de modèle non authentifié à Internet ouvert.
Associez-la à une base de données vectorielle (Qdrant ou pgvector dans Docker) et vous avez une pile RAG privée complète sur une seule machine à 12 $. Cette combinaison — petits embeddings locaux, stockage vectoriel local, API externe seulement pour l'étape de génération lourde — est la configuration qui a réellement du sens sur du matériel comme celui-ci.
Choisir une offre
| Usage | Offre | Prix |
|---|---|---|
| Embeddings, modèles 1–3B, pipeline RAG | Medium | 12 $/mois |
| Idem, plus un point de terminaison public derrière authentification | Medium-IP | 20 $/mois |
| Simplement tester de petits modèles | Small | 8 $/mois |
CPU uniquement, jusqu'à 6 vCPU et 6 Go de RAM. Stockage NVMe, trafic non compté, Allemagne ou Finlande. Paiement en crypto, sans KYC. La facturation annuelle est un seul transfert au lieu de douze.
Lectures liées
- Héberger une base vectorielle pour la mémoire d'IA — l'autre moitié d'une pile RAG privée
- VPS pour agents IA — l'orchestration sur la même machine
Prêt ? Déployez un serveur → — en ligne en une minute environ, payé en crypto, sans pièce d'identité requise.
Commentaires
Pas encore de commentaires. Soyez le premier.