Якщо у вас більше одного застосунку — або один агент, що розходиться на кілька моделей — ви рано чи пізно впираєтеся в одну стіну: у кожного провайдера свій SDK, свої ключі, свої ліміти й немає єдиного місця, де видно витрати. LiteLLM вирішує це, ставлячи один OpenAI-сумісний ендпоінт перед усім. Ваш код викликає один URL з іменем моделі; LiteLLM маршрутизує до OpenAI, Anthropic, Groq, Together, Mistral, локальної Ollama — що налаштуєте — і дає бюджети, фолбеки й один лог кожного виклику.
Self-hosting на VPS означає, що ключі провайдерів, ваші промпти й дані про витрати живуть на машині, якою керуєте ви, з оплатою криптою без KYC.
Що потрібно LiteLLM-проксі
- Небагато обчислень — це шлюз. Важке відбувається у провайдерів; LiteLLM лише маршрутизує. Small ($8/міс — 4 vCPU, 4 ГБ RAM) комфортно тримає проксі плюс Postgres для віртуальних ключів і обліку витрат.
- Виділений IP, домен і HTTPS. Застосунки й агенти підключаються вхідними, тож потрібен план із виділеним IPv4, домен і TLS. NAT-плани не приймають вхідний веб-трафік.
- Вихідний до провайдерів. Машині потрібен звичайний вихідний HTTPS до API моделей — він є в будь-якого плану.
Налаштування через Docker (Ubuntu 24.04)
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker
mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
- model_name: gpt-4o
litellm_params:
model: openai/gpt-4o
api_key: os.environ/OPENAI_API_KEY
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-4-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
general_settings:
master_key: sk-CHANGE-ME
EOF
cat > docker-compose.yml <<'EOF'
services:
litellm:
image: ghcr.io/berriai/litellm:main-latest
restart: always
ports: [ "127.0.0.1:4000:4000" ]
environment:
OPENAI_API_KEY: sk-...
ANTHROPIC_API_KEY: sk-ant-...
DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
volumes: [ ./config.yaml:/app/config.yaml ]
command: [ "--config", "/app/config.yaml" ]
postgres:
image: postgres:16
restart: always
environment:
POSTGRES_USER: litellm
POSTGRES_PASSWORD: change_me
POSTGRES_DB: litellm
volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF
docker compose up -d
Поставте перед ним Caddy або Nginx для автоматичного HTTPS на вашому домені — і будь-який OpenAI SDK просто працює:
curl https://llm.yourdomain.com/v1/chat/completions \
-H "Authorization: Bearer sk-your-virtual-key" \
-H "Content-Type: application/json" \
-d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'
Чому це чудово для агентів
ШІ-агент або флот із кількох агентів зазвичай робить багато викликів моделей. За LiteLLM-проксі ви можете: обмежити кожного агента своїм віртуальним ключем і бюджетом, автоматично відкочуватися з фронтир-моделі на дешеву, змішувати локальну Ollama з хмарними API й читати один лог того, скільки витратив кожен агент. Змінюйте моделі без правки коду агента — просто змінюйте конфіг.
Чому EQVPS для LiteLLM-шлюзу
- Виділений IPv4 від $8/міс, зручно для домену + HTTPS, усі порти, самостійний rDNS.
- Локації в ЄС (Німеччина, Фінляндія) — чисті маршрути, реальний закон про захист даних; ваші ключі й логи лишаються в ЄС.
- Без KYC, оплата криптою. Email для реєстрації, USDC/USDT для оплати.
- Root за ~60 секунд. Чисті образи Ubuntu/Debian;
docker compose up— і шлюз працює.
Коментарі
Поки немає коментарів. Будьте першим.