Se você roda mais de um app — ou um agente que se ramifica para vários modelos — acaba batendo na mesma parede: cada provedor tem seu SDK, suas chaves, seus limites, e nenhum lugar único para ver o gasto. O LiteLLM resolve isso colocando um endpoint compatível com OpenAI na frente de tudo. Seu código chama uma URL com um nome de modelo; o LiteLLM o roteia para OpenAI, Anthropic, Groq, Together, Mistral, um Ollama local — o que você configurar — e te dá orçamentos, fallbacks e um log de cada chamada.
Auto-hospedá-lo num VPS significa que suas chaves de provedores, prompts e dados de gasto vivem numa máquina que você controla, paga em cripto sem KYC.
O que um proxy LiteLLM precisa
- Pouco cálculo — é um gateway. O trabalho pesado acontece nos provedores; o LiteLLM só roteia. Small ($8/mês — 4 vCPU, 4 GB RAM) roda tranquilo o proxy mais um Postgres para chaves virtuais e rastreio de gasto.
- Um IP dedicado, um domínio e HTTPS. Apps e agentes conectam de entrada, então você quer um plano de IPv4 dedicado, um domínio e TLS. Planos NAT não aceitam tráfego web de entrada.
- Saída para os provedores. A máquina precisa de HTTPS de saída normal para alcançar as APIs de modelos — todo plano tem.
Configuração com Docker (Ubuntu 24.04)
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-...
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Coloque Caddy ou Nginx na frente para HTTPS automático no seu domínio, e qualquer SDK OpenAI funciona:
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Por que isto é ótimo para agentes
Um agente de IA ou uma frota multiagente costuma fazer muitas chamadas de modelo. Atrás de um proxy LiteLLM você pode: limitar cada agente com sua própria chave virtual e orçamento, cair automaticamente de um modelo de ponta para um mais barato, misturar um Ollama local com APIs na nuvem, e ler um único log do que cada agente gastou. Troque de modelo sem tocar no código do agente — só mude a config.
Por que EQVPS para um gateway LiteLLM
- IPv4 dedicado a partir de $8/mês, amigável a domínio + HTTPS, todas as portas, DNS reverso autogerido.
- Localizações na UE (Alemanha, Finlândia) — rotas limpas, lei real de proteção de dados; suas chaves e logs ficam na UE.
- Sem KYC, pagamento em cripto. E-mail para se cadastrar, USDC/USDT para pagar.
- Root em ~60 segundos. Imagens Ubuntu/Debian limpas;
docker compose upe seu gateway está no ar.
Comentários
Nenhum comentário ainda. Seja o primeiro.