EQVPS
Inizia

Fai self-hosting di un proxy LiteLLM su un VPS: un unico endpoint compatibile OpenAI per ogni modello

2 set 2026 · 3 min di lettura · EQVPS Team

Se fai girare più di un'app — o un agente che dirama verso diversi modelli — prima o poi incontri lo stesso muro: ogni provider ha il proprio SDK, le proprie chiavi, i propri rate limit, e nessun posto unico per vedere la spesa. LiteLLM risolve questo mettendo un unico endpoint compatibile OpenAI davanti a tutto. Il tuo codice chiama un URL con un nome di modello; LiteLLM lo instrada verso OpenAI, Anthropic, Groq, Together, Mistral, un Ollama locale — qualunque cosa tu abbia configurato — e ti dà budget, fallback, e un unico log di ogni chiamata.

Farne self-hosting su un VPS significa che le chiavi dei tuoi provider, i tuoi prompt e i tuoi dati di spesa vivono su una macchina che controlli tu, pagata in crypto senza KYC.

Cosa serve a un proxy LiteLLM

Setup Docker (Ubuntu 24.04)

# piano con IP dedicato, shell root
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME          # chiave admin; emetti invece chiavi virtuali per-app
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...            # le chiavi dei tuoi provider
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Metti Caddy o Nginx davanti per HTTPS automatico sul tuo dominio, poi qualsiasi SDK OpenAI funziona e basta:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Perché è ottimo per gli agenti

Un agente AI o una flotta multi-agente di solito fa molte chiamate al modello. Dietro un proxy LiteLLM puoi: limitare ogni agente con la propria chiave virtuale e il proprio budget, ripiegare automaticamente da un modello di frontiera a uno più economico, mischiare un Ollama locale con API cloud, e leggere un unico log di esattamente quanto ha speso ogni agente. Cambia modelli senza toccare il codice dell'agente — cambia solo la config.

Perché EQVPS per un gateway LiteLLM

VPS per agenti AI → · Fai self-hosting di Ollama su un VPS →

FAQ

Cosa mi dà davvero un proxy LiteLLM?

Un unico endpoint compatibile OpenAI davanti a molti provider. Le tue app e i tuoi agenti chiamano un singolo URL e nome di modello; LiteLLM instrada verso OpenAI, Anthropic, Groq, Together, un Ollama locale, ecc. Ottieni budget per chiave, rate limit, fallback e un unico posto per log e costi — senza cambiare il codice dell'app quando cambi modello.

Quale piano gli serve?

LiteLLM in sé è leggero — Small ($8/mese, 4 GB RAM) è comodo per il proxy più Postgres per chiavi/spesa. È un gateway, non una macchina di inferenza: il calcolo pesante gira dai provider (o su una GPU/host separati). Prendi un piano con IP dedicato così puoi mettere davanti un dominio e HTTPS.

Perché fare self-hosting invece di usare un gateway ospitato?

Le chiavi dei tuoi provider, i prompt, i dati di spesa e i log restano su una macchina che controlli invece che di una terza parte. Imposti tu i budget e vedi ogni richiesta. Per agenti che diramano molte chiamate, quella visibilità e quel controllo dei costi sono tutto il senso.

Funziona anche con modelli locali?

Sì. Punta una delle voci di modello LiteLLM a un Ollama locale (stesso VPS o un'altra macchina) ed è esposto attraverso la stessa API compatibile OpenAI dei modelli cloud — così un'app può mischiare un modello locale economico e un'API di frontiera dietro un unico endpoint.

Chiedete un documento o una carta?

No. Registrati con un'email, paga in USDC o USDT. Niente documenti, niente carta, niente KYC.

← Torna al blogVedi piani e prezzi →

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.