EQVPS

Auto-hospede um proxy LiteLLM num VPS: um endpoint compatível com OpenAI para todos os modelos

2 de set. de 2026 · 3 min de leitura · EQVPS Team

Se você roda mais de um app — ou um agente que se ramifica para vários modelos — acaba batendo na mesma parede: cada provedor tem seu SDK, suas chaves, seus limites, e nenhum lugar único para ver o gasto. O LiteLLM resolve isso colocando um endpoint compatível com OpenAI na frente de tudo. Seu código chama uma URL com um nome de modelo; o LiteLLM o roteia para OpenAI, Anthropic, Groq, Together, Mistral, um Ollama local — o que você configurar — e te dá orçamentos, fallbacks e um log de cada chamada.

Auto-hospedá-lo num VPS significa que suas chaves de provedores, prompts e dados de gasto vivem numa máquina que você controla, paga em cripto sem KYC.

O que um proxy LiteLLM precisa

Configuração com Docker (Ubuntu 24.04)

apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Coloque Caddy ou Nginx na frente para HTTPS automático no seu domínio, e qualquer SDK OpenAI funciona:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Por que isto é ótimo para agentes

Um agente de IA ou uma frota multiagente costuma fazer muitas chamadas de modelo. Atrás de um proxy LiteLLM você pode: limitar cada agente com sua própria chave virtual e orçamento, cair automaticamente de um modelo de ponta para um mais barato, misturar um Ollama local com APIs na nuvem, e ler um único log do que cada agente gastou. Troque de modelo sem tocar no código do agente — só mude a config.

Por que EQVPS para um gateway LiteLLM

VPS para agentes de IA → · Auto-hospede Ollama num VPS →

FAQ

O que um proxy LiteLLM realmente me dá?

Um endpoint compatível com OpenAI na frente de vários provedores. Seus apps e agentes chamam uma única URL e nome de modelo; o LiteLLM roteia para OpenAI, Anthropic, Groq, Together, um Ollama local, etc. Você ganha orçamentos por chave, limites, fallbacks e um único lugar para logs e custo — sem mudar o código ao trocar de modelo.

Qual plano ele precisa?

O LiteLLM em si é leve — Small ($8/mês, 4 GB RAM) roda tranquilo o proxy mais um Postgres para chaves/gastos. É um gateway, não uma máquina de inferência: o cálculo pesado roda nos provedores (ou num GPU/host separado). Pegue um plano de IP dedicado para domínio e HTTPS.

Por que auto-hospedar em vez de um gateway hospedado?

Suas chaves de provedores, prompts, dados de gasto e logs ficam numa máquina que você controla, não num terceiro. Você define os orçamentos e vê cada requisição. Para agentes que disparam muitas chamadas, essa visibilidade e controle de custo são todo o propósito.

Funciona também com modelos locais?

Sim. Aponte uma das entradas de modelo do LiteLLM para um Ollama local (mesmo VPS ou outra máquina) e ele é exposto pela mesma API compatível com OpenAI que os modelos na nuvem — um app pode misturar um modelo local barato e uma API de ponta atrás de um endpoint.

Vocês pedem documento ou cartão?

Não. Registro por e-mail, pagamento em USDC ou USDT. Sem documentos, sem cartão, sem KYC.

← Voltar ao blogVer planos e preços →

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.