EQVPS

Self-host een LiteLLM-proxy op een VPS: één OpenAI-compatibel endpoint voor elk model

2 sep 2026 · 3 min lezen · EQVPS Team

Als je meer dan één app draait — of één agent die uitwaaiert naar verschillende modellen — stuit je uiteindelijk op dezelfde muur: elke provider heeft zijn eigen SDK, zijn eigen keys, zijn eigen rate limits, en geen enkele plek om spend te zien. LiteLLM fixt dat door één OpenAI-compatibel endpoint vóór alles te zetten. Je code roept één URL aan met een modelnaam; LiteLLM routeert het naar OpenAI, Anthropic, Groq, Together, Mistral, een lokale Ollama — wat je ook configureerde — en geeft je budgetten, fallbacks, en één log van elke call.

Het zelf-hosten op een VPS betekent dat je provider-keys, je prompts en je spend-data op een box leven die jij beheert, betaald in crypto zonder KYC.

Wat een LiteLLM-proxy nodig heeft

Docker-setup (Ubuntu 24.04)

# dedicated-IP plan, root shell
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME          # admin key; issue per-app virtual keys instead
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...            # your provider keys
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Zet Caddy of Nginx ervoor voor automatische HTTPS op je domein, dan werkt elke OpenAI SDK gewoon:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Waarom dit geweldig is voor agents

Een AI-agent of een multi-agent-vloot maakt meestal veel model-calls. Achter een LiteLLM-proxy kun je: elke agent aftoppen met zijn eigen virtuele key en budget, automatisch terugvallen van een frontier-model naar een goedkopere, een lokale Ollama mixen met cloud-API's, en één log lezen van precies wat elke agent uitgaf. Wissel modellen zonder agent-code aan te raken — verander gewoon de config.

Waarom EQVPS voor een LiteLLM-gateway

VPS voor AI-agents → · Self-host Ollama op een VPS →

FAQ

Wat geeft een LiteLLM-proxy me eigenlijk?

Eén OpenAI-compatibel endpoint vóór veel providers. Je apps en agents roepen een enkele URL en modelnaam aan; LiteLLM routeert naar OpenAI, Anthropic, Groq, Together, een lokale Ollama, etc. Je krijgt per-key budgetten, rate limits, fallbacks en één plek voor logs en kosten — zonder app-code te veranderen wanneer je modellen wisselt.

Welk plan heeft het nodig?

LiteLLM zelf is licht — Small ($8/mnd, 4 GB RAM) is comfortabel voor de proxy plus Postgres voor keys/spend. Het is een gateway, geen inferentie-box: het zware compute draait bij de providers (of op een aparte GPU/host). Neem een dedicated-IP-plan zodat je een domein en HTTPS ervoor kunt zetten.

Waarom zelf-hosten in plaats van een hosted gateway gebruiken?

Je provider-keys, prompts, spend-data en logs blijven op een machine die je beheert in plaats van die van een derde partij. Jij stelt de budgetten in en ziet elk verzoek. Voor agents die veel calls uitwaaieren, is die zichtbaarheid en kostencontrole het hele punt.

Werkt het ook met lokale modellen?

Ja. Richt een van de LiteLLM-model-entries op een lokale Ollama (zelfde VPS of andere box) en het is blootgesteld via dezelfde OpenAI-compatibele API als de cloud-modellen — zodat een app een goedkoop lokaal model en een frontier-API kan mixen achter één endpoint.

Vragen jullie om ID of een kaart?

Nee. Registreer met een e-mail, betaal in USDC of USDT. Geen documenten, geen kaart, geen KYC.

← Terug naar blogBekijk plannen & prijzen →

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.