Si vous faites tourner plus d'une application — ou un agent qui se ramifie vers plusieurs modèles — vous finissez par heurter le même mur : chaque fournisseur a son SDK, ses clés, ses limites de débit, et aucun endroit unique pour voir la dépense. LiteLLM règle cela en plaçant un point de terminaison compatible OpenAI devant tout. Votre code appelle une URL avec un nom de modèle ; LiteLLM le route vers OpenAI, Anthropic, Groq, Together, Mistral, un Ollama local — ce que vous avez configuré — et vous donne budgets, fallbacks et un log de chaque appel.
L'auto-héberger sur un VPS signifie que vos clés de fournisseurs, vos prompts et vos données de dépenses vivent sur une machine que vous contrôlez, payée en crypto sans KYC.
Ce dont un proxy LiteLLM a besoin
- Peu de calcul — c'est une passerelle. Le gros du travail se passe chez les fournisseurs ; LiteLLM ne fait que router. Small ($8/mois — 4 vCPU, 4 Go RAM) fait tourner confortablement le proxy plus un Postgres pour les clés virtuelles et le suivi des dépenses.
- Une IP dédiée, une domaine et HTTPS. Les applications et agents se connectent en entrée, il vous faut donc un plan à IPv4 dédiée, une domaine et TLS. Les plans NAT ne prennent pas le trafic web entrant.
- Sortant vers les fournisseurs. La machine a besoin d'un HTTPS sortant normal pour joindre les API de modèles — chaque plan l'a.
Configuration Docker (Ubuntu 24.04)
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-...
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Placez Caddy ou Nginx devant pour un HTTPS automatique sur votre domaine, puis tout SDK OpenAI fonctionne :
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Pourquoi c'est excellent pour les agents
Un agent IA ou une flotte multi-agents fait généralement beaucoup d'appels de modèles. Derrière un proxy LiteLLM, vous pouvez : plafonner chaque agent avec sa propre clé virtuelle et son budget, retomber automatiquement d'un modèle de pointe vers un moins cher, mélanger un Ollama local avec des API cloud, et lire un seul log de ce que chaque agent a dépensé. Changez de modèle sans toucher au code de l'agent — changez juste la config.
Pourquoi EQVPS pour une passerelle LiteLLM
- IPv4 dédiée à partir de $8/mois, compatible domaine + HTTPS, tous les ports, DNS inverse en libre-service.
- Emplacements UE (Allemagne, Finlande) — routes propres, vrai droit de protection des données ; vos clés et logs restent dans l'UE.
- Sans KYC, paiement en crypto. E-mail pour s'inscrire, USDC/USDT pour payer.
- Root en ~60 secondes. Images Ubuntu/Debian propres ;
docker compose upet votre passerelle est en ligne.
Commentaires
Pas encore de commentaires. Soyez le premier.