Chaleur estivale — tout fond, même nos prix.−25%−25 % sur chaque offre annuelle, jusqu'au 31 aoûtVoir les offres
EQVPS
Commencer

VPS pour inférence LLM privée haute mémoire

Les modèles quantifiés plus grands ont besoin de vraie RAM, pas d'un GPU que vous n'avez pas. Où une machine CPU haute mémoire fait tourner des modèles de classe 30B en privé, ce qui est réaliste, et où ça ne l'est pas. Dès 70 $/mois.

Nous avons une page distincte pour Ollama et les petits modèles — c'est la machine CPU à 12 $ qui fait tourner du 1B–8B et des embeddings. Cette page est l'autre extrémité : les modèles assez grands pour que ce soit la RAM, et non le CPU, qui vous arrête.

Soyons honnêtes d'emblée, comme partout : nos serveurs sont CPU uniquement, sans GPU. Un grand modèle ici tourne lentement. Si vous voulez un chat interactif rapide sur un modèle 30B, il vous faut un hôte GPU — produit différent, fournisseur différent. Ce qu'une machine CPU haute mémoire fait bien, c'est faire tourner un grand modèle quantifié en privé pour du travail qui n'est pas une fenêtre de chat.

Le calcul de RAM

Le modèle réside en mémoire, quantifié ou non, plus l'overhead pour le contexte et le runtime :

C'est pourquoi « faire tourner un modèle local plus grand » est en réalité une question de haute mémoire. Le modèle est l'empreinte mémoire. Ajoutez un index RAG sur le même hôte et les chiffres s'additionnent.

Là où le tout-privé gagne vraiment

L'argument n'est ni la vitesse ni le coût — c'est que certaines données ne peuvent pas partir. Documents juridiques. Dossiers médicaux. Code propriétaire. Tout ce où envoyer le prompt à une API tierce est exclu. Un modèle plus lent qui tourne entièrement sur votre machine bat un modèle rapide qui journalise tout ce que vous lui envoyez. Nous avons dressé le tableau complet ici.

Et si les données sont à ce point sensibles, le paiement devrait probablement l'être aussi. Louer la machine avec de la crypto et sans KYC garde toute la chaîne — serveur, modèle, prompts, facturation — hors des registres d'identité de qui que ce soit. C'est l'argument : non pas une inférence moins chère, mais une inférence que personne d'autre ne peut voir.

Que choisir

Pour un modèle de classe 30B avec de la place pour le contexte, Pro-64 (64 Go) est le choix confortable ; une quantification plus serrée tient sur Pro-32 ou Pro-48, une plus grande va vers Pro-80. Chargez d'abord le modèle, surveillez la mémoire résidente, dimensionnez à partir de ce que vous avez mesuré. Et fixez les attentes : c'est de l'inférence batch privée, pas une fenêtre de chat rapide.

Prêt à déployer ? Payez en crypto, sans KYC — en ligne en une minute environ.

Déployer →

FAQ

En quoi est-ce différent de votre cas d'usage Ollama ?

La page Ollama concerne les petits modèles sur une machine CPU à 12 $ — 1B–8B, embeddings, travail léger. Ceci est le haut de gamme en mémoire : des modèles quantifiés de 13B à la classe 30B qui ont besoin de 24–48 Go ou plus rien que pour se charger. Même réalité CPU uniquement, empreinte mémoire bien plus grande, offre différente.

Combien de RAM pour un modèle donné ?

Le modèle doit tenir en mémoire plus l'overhead. Un modèle 13B en 4 bits veut ~10–16 Go ; la classe 30B quantifiée pousse vers 24–48 Go ; allez plus grand ou en précision supérieure et vous êtes à 64–80 Go — au-delà, aucune de nos machines uniques ne convient. Ajoutez de la place pour le contexte par-dessus.

Sera-ce rapide ?

Non — soyez honnête avec vous-même ici. L'inférence CPU sur un grand modèle donne quelques tokens par seconde, pas un flux interactif. C'est très bien pour du batch et du travail de fond (résumer pendant la nuit, classer une file). Pour un chat en temps réel sur un gros modèle, il vous faut un GPU, que nous n'offrons pas.

Pourquoi le faire tourner ici plutôt qu'une API ?

La confidentialité. Vos prompts et sorties ne touchent jamais les serveurs ou journaux d'un fournisseur. Pour des données sensibles — juridiques, médicales, code interne — un modèle privé plus lent bat un modèle rapide qui voit tout. Associez-le à un paiement en crypto sans KYC et toute la chaîne reste la vôtre.

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.