Nous avons une page distincte pour Ollama et les petits modèles — c'est la machine CPU à 12 $ qui fait tourner du 1B–8B et des embeddings. Cette page est l'autre extrémité : les modèles assez grands pour que ce soit la RAM, et non le CPU, qui vous arrête.
Soyons honnêtes d'emblée, comme partout : nos serveurs sont CPU uniquement, sans GPU. Un grand modèle ici tourne lentement. Si vous voulez un chat interactif rapide sur un modèle 30B, il vous faut un hôte GPU — produit différent, fournisseur différent. Ce qu'une machine CPU haute mémoire fait bien, c'est faire tourner un grand modèle quantifié en privé pour du travail qui n'est pas une fenêtre de chat.
Le calcul de RAM
Le modèle réside en mémoire, quantifié ou non, plus l'overhead pour le contexte et le runtime :
- 13B, 4 bits — environ 10–16 Go. Tourne déjà sur une offre moyenne.
- Classe 30B, quantifiée — 24–48 Go selon la quantification. C'est le territoire de Pro-32 à Pro-64.
- Plus grand ou précision supérieure — 64–80 Go, et au-delà de 80 Go aucune de nos machines uniques ne convient. Pro-80 est le plafond ici.
C'est pourquoi « faire tourner un modèle local plus grand » est en réalité une question de haute mémoire. Le modèle est l'empreinte mémoire. Ajoutez un index RAG sur le même hôte et les chiffres s'additionnent.
Là où le tout-privé gagne vraiment
L'argument n'est ni la vitesse ni le coût — c'est que certaines données ne peuvent pas partir. Documents juridiques. Dossiers médicaux. Code propriétaire. Tout ce où envoyer le prompt à une API tierce est exclu. Un modèle plus lent qui tourne entièrement sur votre machine bat un modèle rapide qui journalise tout ce que vous lui envoyez. Nous avons dressé le tableau complet ici.
Et si les données sont à ce point sensibles, le paiement devrait probablement l'être aussi. Louer la machine avec de la crypto et sans KYC garde toute la chaîne — serveur, modèle, prompts, facturation — hors des registres d'identité de qui que ce soit. C'est l'argument : non pas une inférence moins chère, mais une inférence que personne d'autre ne peut voir.
Que choisir
Pour un modèle de classe 30B avec de la place pour le contexte, Pro-64 (64 Go) est le choix confortable ; une quantification plus serrée tient sur Pro-32 ou Pro-48, une plus grande va vers Pro-80. Chargez d'abord le modèle, surveillez la mémoire résidente, dimensionnez à partir de ce que vous avez mesuré. Et fixez les attentes : c'est de l'inférence batch privée, pas une fenêtre de chat rapide.
Commentaires
Pas encore de commentaires. Soyez le premier.