Chaleur estivale — tout fond, même nos prix.−25%−25 % sur chaque offre annuelle, jusqu'au 31 aoûtVoir les offres
EQVPS
Commencer

VPS pour Ollama et LLM locaux

Auto-hébergez de petits modèles de langage sur un serveur CPU — privé, non compté, payé en crypto. Honnête sur ce que l'inférence CPU peut et ne peut pas faire. Dès 12 $/mois.

Réglons d'abord la partie décevante, car Internet est plein de pages qui ne le font pas.

Nos serveurs sont CPU uniquement. Nous n'offrons pas de GPU. Cela signifie que le travail LLM local ici a un plafond dur, et prétendre le contraire ne ferait que gaspiller votre argent.

Ce qui fonctionne vraiment sur CPU

Avec jusqu'à 6 vCPU et 6 Go de RAM (notre offre Medium — 12 $/mois), vous êtes dans la gamme des petits modèles quantifiés :

Si vous avez besoin d'un chat 70B rapide et interactif, il vous faut un hôte GPU — c'est un produit différent d'un fournisseur différent, et nous préférons vous le dire plutôt que de prendre vos 12 $.

Là où une machine CPU gagne vraiment

Confidentialité. Vos documents, vos prompts, vos embeddings — ne quittant jamais une machine que vous contrôlez, ne devenant jamais les données d'entraînement de quelqu'un. Pour beaucoup de gens, c'est tout l'intérêt, et quelques tokens par seconde sont un compromis acceptable.

Prévisibilité des coûts. Pas de facture au token. Un pipeline qui classe cinquante mille enregistrements coûte la même chose qu'un qui en classe cinquante : 12 $.

Travail asynchrone. La plupart du travail LLM utile n'est pas une fenêtre de chat. C'est une file : résume ceux-ci, étiquette ceux-là, encode ce corpus. Une machine CPU qui avale un arriéré pendant la nuit est parfaitement bonne pour ça.

Configuration

# Ubuntu 24.04 — offre Medium recommandée
curl -fsSL https://ollama.com/install.sh | sh

# Commencez petit et voyez par vous-même
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — le point idéal pour le CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama sert une API HTTP sur localhost:11434. Gardez-la là. Si vous devez l'atteindre depuis ailleurs, placez-la derrière un reverse proxy avec authentification sur une offre à IP dédiée — n'exposez jamais un point de terminaison de modèle non authentifié à Internet ouvert.

Associez-la à une base de données vectorielle (Qdrant ou pgvector dans Docker) et vous avez une pile RAG privée complète sur une seule machine à 12 $. Cette combinaison — petits embeddings locaux, stockage vectoriel local, API externe seulement pour l'étape de génération lourde — est la configuration qui a réellement du sens sur du matériel comme celui-ci.

Choisir une offre

UsageOffrePrix
Embeddings, modèles 1–3B, pipeline RAGMedium12 $/mois
Idem, plus un point de terminaison public derrière authentificationMedium-IP20 $/mois
Simplement tester de petits modèlesSmall8 $/mois

CPU uniquement, jusqu'à 6 vCPU et 6 Go de RAM. Stockage NVMe, trafic non compté, Allemagne ou Finlande. Paiement en crypto, sans KYC. La facturation annuelle est un seul transfert au lieu de douze.

Lectures liées


Prêt ? Déployez un serveur → — en ligne en une minute environ, payé en crypto, sans pièce d'identité requise.

Prêt à déployer ? Payez en crypto, sans KYC — en ligne en une minute environ.

Déployer →

FAQ

Puis-je faire tourner Llama 70B dessus ?

Non. Nos offres sont CPU uniquement avec jusqu'à 6 Go de RAM — c'est la gamme des petits modèles quantifiés (à peu près 1B–8B en 4 bits). Un modèle 70B nécessite un GPU et beaucoup plus de mémoire. Nous n'offrons pas de GPU, et nous préférons le dire plutôt que de vous vendre une déception.

À quelle vitesse va l'inférence CPU, vraiment ?

Attendez-vous à quelques tokens par seconde sur un modèle 7–8B en quantification 4 bits, et sensiblement mieux sur des modèles 1–3B. C'est très bien pour des tâches de fond, des embeddings, de la classification et des pipelines asynchrones. Ce n'est pas bien pour un chat interactif réactif.

Alors à quoi est-ce vraiment bon ?

Embeddings privés, classification, files de résumé, pipelines RAG où la latence n'importe pas, et garder les données hors des API tierces. Aussi : apprendre, tester et prototyper avant de louer un GPU ailleurs.

Demandez-vous une pièce d'identité ?

Non. Un e-mail pour s'inscrire, des USDC ou USDT pour payer. Ce qui est souvent la raison même pour laquelle les gens veulent un modèle privé au départ.

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.