Αν τρέχετε περισσότερες από μία εφαρμογές — ή έναν πράκτορα που φαν-άουτ σε αρκετά μοντέλα — τελικά χτυπάτε τον ίδιο τοίχο: κάθε πάροχος έχει το δικό του SDK, τα δικά του keys, τα δικά του rate limits, και κανένα μοναδικό μέρος να δείτε το spend. Το LiteLLM το διορθώνει βάζοντας ένα OpenAI-compatible endpoint μπροστά από τα πάντα. Ο κώδικάς σας καλεί ένα URL με ένα όνομα μοντέλου· το LiteLLM το δρομολογεί σε OpenAI, Anthropic, Groq, Together, Mistral, ένα τοπικό Ollama — ό,τι διαμορφώσατε — και σας δίνει προϋπολογισμούς, fallbacks, και ένα log κάθε κλήσης.
Το self-hosting σε VPS σημαίνει ότι τα keys παρόχων, τα prompts και τα δεδομένα spend σας ζουν σε ένα box που εσείς ελέγχετε, πληρωμένο σε crypto χωρίς KYC.
Τι χρειάζεται ένα LiteLLM proxy
- Όχι πολύ compute — είναι gateway. Η βαριά δουλειά συμβαίνει στους παρόχους· το LiteLLM απλώς δρομολογεί. Το Small ($8/μήνα — 4 vCPU, 4 GB RAM) τρέχει άνετα το proxy συν ένα Postgres για virtual keys και spend tracking.
- Ένα αποκλειστικό IP, ένα domain και HTTPS. Οι εφαρμογές και οι πράκτορές σας συνδέονται εισερχόμενα, οπότε θέλετε ένα πακέτο αποκλειστικού IPv4, ένα domain και TLS. Τα πακέτα NAT δεν δέχονται εισερχόμενη web κίνηση.
- Εξερχόμενα προς τους παρόχους. Το box χρειάζεται κανονικό εξερχόμενο HTTPS για να φτάσει τα APIs μοντέλων — κάθε πακέτο το έχει.
Εγκατάσταση Docker (Ubuntu 24.04)
# dedicated-IP plan, root shell
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME # admin key; issue per-app virtual keys instead
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-... # your provider keys
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Βάλτε Caddy ή Nginx μπροστά για αυτόματο HTTPS στο domain σας, μετά οποιοδήποτε OpenAI SDK απλώς λειτουργεί:
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Γιατί αυτό είναι εξαιρετικό για πράκτορες
Ένας AI πράκτορας ή ένας στόλος πολλαπλών πρακτόρων συνήθως κάνει πολλές κλήσεις μοντέλου. Πίσω από ένα LiteLLM proxy μπορείτε να: περιορίσετε κάθε πράκτορα με το δικό του virtual key και προϋπολογισμό, να κάνετε fallback από ένα frontier μοντέλο σε ένα φθηνότερο αυτόματα, να αναμείξετε ένα τοπικό Ollama με cloud APIs, και να διαβάσετε ένα log ακριβώς του τι ξόδεψε κάθε πράκτορας. Αλλάξτε μοντέλα χωρίς να αγγίξετε τον κώδικα πράκτορα — απλώς αλλάξτε τη config.
Γιατί EQVPS για ένα LiteLLM gateway
- Αποκλειστικό IPv4 από $8/μήνα, domain + HTTPS-φιλικό, όλα τα ports, self-service rDNS.
- EU τοποθεσίες (Γερμανία, Φινλανδία) — καθαρές διαδρομές, πραγματικός νόμος προστασίας δεδομένων· τα keys και τα logs σας μένουν στην ΕΕ.
- Χωρίς KYC, πληρωμή με crypto. Email για εγγραφή, USDC/USDT για πληρωμή.
- Root σε ~60 δευτερόλεπτα. Καθαρές images Ubuntu/Debian·
docker compose upκαι το gateway σας είναι ζωντανό.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.