Si corres más de una app — o un agente que se ramifica a varios modelos — acabas chocando con el mismo muro: cada proveedor tiene su SDK, sus claves, sus límites, y ningún lugar único para ver el gasto. LiteLLM lo arregla poniendo un endpoint compatible con OpenAI delante de todo. Tu código llama a una URL con un nombre de modelo; LiteLLM lo enruta a OpenAI, Anthropic, Groq, Together, Mistral, un Ollama local — lo que configures — y te da presupuestos, fallbacks y un log de cada llamada.
Autoalojarlo en un VPS significa que tus claves de proveedores, tus prompts y tus datos de gasto viven en una máquina que tú controlas, pagada en cripto sin KYC.
Qué necesita un proxy LiteLLM
- Poco cómputo — es una pasarela. El trabajo pesado ocurre en los proveedores; LiteLLM solo enruta. Small ($8/mes — 4 vCPU, 4 GB RAM) corre cómodo el proxy más un Postgres para claves virtuales y seguimiento de gasto.
- Una IP dedicada, un dominio y HTTPS. Apps y agentes conectan de entrada, así que quieres un plan de IPv4 dedicada, un dominio y TLS. Los planes NAT no aceptan tráfico web entrante.
- Salida a los proveedores. La máquina necesita HTTPS de salida normal para alcanzar las API de modelos — cada plan lo tiene.
Configuración con Docker (Ubuntu 24.04)
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-...
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Pon Caddy o Nginx delante para HTTPS automático en tu dominio, y cualquier SDK de OpenAI funciona:
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Por qué esto es genial para agentes
Un agente de IA o una flota multiagente suele hacer muchas llamadas a modelos. Tras un proxy LiteLLM puedes: limitar cada agente con su propia clave virtual y presupuesto, caer automáticamente de un modelo de frontera a uno más barato, mezclar un Ollama local con API en la nube, y leer un solo log de cuánto gastó cada agente. Cambia de modelo sin tocar el código del agente — solo cambia la config.
Por qué EQVPS para una pasarela LiteLLM
- IPv4 dedicada desde $8/mes, cómodo para dominio + HTTPS, todos los puertos, DNS inverso autogestionado.
- Ubicaciones en la UE (Alemania, Finlandia) — rutas limpias, ley real de protección de datos; tus claves y logs quedan en la UE.
- Sin KYC, pago en cripto. Correo para registrarte, USDC/USDT para pagar.
- Root en ~60 segundos. Imágenes Ubuntu/Debian limpias;
docker compose upy tu pasarela está en línea.
Comentarios
Aún no hay comentarios. Sé el primero.