Jeśli uruchamiasz więcej niż jedną aplikację — albo jednego agenta, który rozgałęzia się na kilka modeli — w końcu uderzasz w tę samą ścianę: każdy dostawca ma własny SDK, własne klucze, własne limity i żadnego jednego miejsca, by zobaczyć wydatki. LiteLLM naprawia to, stawiając jeden zgodny z OpenAI endpoint przed wszystkim. Twój kod wywołuje jeden URL z nazwą modelu; LiteLLM routuje go do OpenAI, Anthropic, Groq, Together, Mistral, lokalnego Ollama — cokolwiek skonfigurujesz — i daje ci budżety, fallbacki oraz jeden log każdego wywołania.
Samodzielne hostowanie na VPS oznacza, że klucze dostawców, prompty i dane o wydatkach żyją na maszynie, którą kontrolujesz ty, opłacanej kryptowalutą bez KYC.
Czego potrzebuje proxy LiteLLM
- Niewiele obliczeń — to brama. Ciężka praca dzieje się u dostawców; LiteLLM tylko routuje. Small ($8/mies — 4 vCPU, 4 GB RAM) spokojnie uruchamia proxy plus Postgres na klucze wirtualne i śledzenie wydatków.
- Dedykowany IP, domena i HTTPS. Aplikacje i agenci łączą się przychodząco, więc potrzebujesz planu z dedykowanym IPv4, domeny i TLS. Plany NAT nie przyjmują przychodzącego ruchu webowego.
- Wychodzący do dostawców. Maszyna potrzebuje zwykłego wychodzącego HTTPS, by dosięgnąć API modeli — każdy plan to ma.
Konfiguracja Docker (Ubuntu 24.04)
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-...
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Postaw z przodu Caddy lub Nginx dla automatycznego HTTPS na twojej domenie, a każdy SDK OpenAI po prostu działa:
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Dlaczego to świetne dla agentów
Agent AI lub flota multi-agent zwykle robi wiele wywołań modeli. Za proxy LiteLLM możesz: ograniczyć każdego agenta własnym kluczem wirtualnym i budżetem, automatycznie schodzić z modelu frontierowego na tańszy, mieszać lokalne Ollama z API w chmurze i czytać jeden log tego, ile dokładnie wydał każdy agent. Zmieniaj modele bez dotykania kodu agenta — po prostu zmień konfigurację.
Dlaczego EQVPS dla bramy LiteLLM
- Dedykowany IPv4 od $8/mies, przyjazny domenie + HTTPS, wszystkie porty, samoobsługowy reverse DNS.
- Lokalizacje w UE (Niemcy, Finlandia) — czyste trasy, prawdziwe prawo o ochronie danych; klucze i logi zostają w UE.
- Bez KYC, płatność kryptowalutą. E-mail do rejestracji, USDC/USDT do zapłaty.
- Root w ~60 sekund. Czyste obrazy Ubuntu/Debian;
docker compose upi twoja brama działa.
Komentarze
Brak komentarzy. Bądź pierwszy.