EQVPS

Auto-héberger un proxy LiteLLM sur un VPS : un point de terminaison compatible OpenAI pour tous les modèles

2 sept. 2026 · 3 min de lecture · EQVPS Team

Si vous faites tourner plus d'une application — ou un agent qui se ramifie vers plusieurs modèles — vous finissez par heurter le même mur : chaque fournisseur a son SDK, ses clés, ses limites de débit, et aucun endroit unique pour voir la dépense. LiteLLM règle cela en plaçant un point de terminaison compatible OpenAI devant tout. Votre code appelle une URL avec un nom de modèle ; LiteLLM le route vers OpenAI, Anthropic, Groq, Together, Mistral, un Ollama local — ce que vous avez configuré — et vous donne budgets, fallbacks et un log de chaque appel.

L'auto-héberger sur un VPS signifie que vos clés de fournisseurs, vos prompts et vos données de dépenses vivent sur une machine que vous contrôlez, payée en crypto sans KYC.

Ce dont un proxy LiteLLM a besoin

Configuration Docker (Ubuntu 24.04)

apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Placez Caddy ou Nginx devant pour un HTTPS automatique sur votre domaine, puis tout SDK OpenAI fonctionne :

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Pourquoi c'est excellent pour les agents

Un agent IA ou une flotte multi-agents fait généralement beaucoup d'appels de modèles. Derrière un proxy LiteLLM, vous pouvez : plafonner chaque agent avec sa propre clé virtuelle et son budget, retomber automatiquement d'un modèle de pointe vers un moins cher, mélanger un Ollama local avec des API cloud, et lire un seul log de ce que chaque agent a dépensé. Changez de modèle sans toucher au code de l'agent — changez juste la config.

Pourquoi EQVPS pour une passerelle LiteLLM

VPS pour agents IA → · Auto-héberger Ollama sur un VPS →

FAQ

Qu'apporte concrètement un proxy LiteLLM ?

Un point de terminaison compatible OpenAI devant plusieurs fournisseurs. Vos applications et agents appellent une seule URL et un nom de modèle ; LiteLLM route vers OpenAI, Anthropic, Groq, Together, un Ollama local, etc. Vous obtenez des budgets par clé, des limites, des fallbacks et un seul endroit pour les logs et les coûts — sans changer le code applicatif quand vous changez de modèle.

Quel plan faut-il ?

LiteLLM lui-même est léger — Small ($8/mois, 4 Go RAM) fait tourner confortablement le proxy plus un Postgres pour les clés/dépenses. C'est une passerelle, pas une machine d'inférence : le gros calcul tourne chez les fournisseurs (ou sur un GPU/hôte séparé). Prenez un plan à IP dédiée pour une domaine et HTTPS.

Pourquoi auto-héberger plutôt qu'une passerelle hébergée ?

Vos clés de fournisseurs, prompts, données de dépenses et logs restent sur une machine que vous contrôlez, pas chez un tiers. Vous fixez les budgets et voyez chaque requête. Pour des agents qui font beaucoup d'appels, cette visibilité et ce contrôle des coûts sont tout l'intérêt.

Fonctionne-t-il aussi avec des modèles locaux ?

Oui. Pointez une des entrées de modèle LiteLLM vers un Ollama local (même VPS ou autre machine) et il est exposé via la même API compatible OpenAI que les modèles cloud — une application peut ainsi mélanger un modèle local bon marché et une API de pointe derrière un seul point de terminaison.

Demandez-vous une pièce d'identité ou une carte ?

Non. Inscription par e-mail, paiement en USDC ou USDT. Aucun document, aucune carte, pas de KYC.

← Retour au blogVoir les offres & tarifs →

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.