EQVPS

Self-hosted LiteLLM-прокси на VPS: один OpenAI-совместимый эндпоинт для всех моделей

2 сент. 2026 г. · 2 мин чтения · EQVPS Team

Если у вас больше одного приложения — или один агент, который расходится на несколько моделей — вы рано или поздно упираетесь в одну стену: у каждого провайдера свой SDK, свои ключи, свои лимиты и нет единого места, где виден расход. LiteLLM решает это, ставя один OpenAI-совместимый эндпоинт перед всем. Ваш код вызывает один URL с именем модели; LiteLLM маршрутизирует к OpenAI, Anthropic, Groq, Together, Mistral, локальной Ollama — что настроите — и даёт бюджеты, фолбэки и один лог каждого вызова.

Self-hosting на VPS означает, что ключи провайдеров, ваши промпты и данные о расходах живут на машине, которой управляете вы, с оплатой криптой без KYC.

Что нужно LiteLLM-прокси

Настройка через Docker (Ubuntu 24.04)

# план с выделенным IP, root-шелл
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME          # admin-ключ; вместо него выдавайте виртуальные ключи по приложениям
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...            # ваши ключи провайдеров
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Поставьте перед ним Caddy или Nginx для автоматического HTTPS на вашем домене — и любой OpenAI SDK просто работает:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Почему это отлично для агентов

ИИ-агент или флот из нескольких агентов обычно делает много вызовов моделей. За LiteLLM-прокси вы можете: ограничить каждого агента своим виртуальным ключом и бюджетом, автоматически откатываться с фронтир-модели на дешёвую, смешивать локальную Ollama с облачными API и читать один лог того, сколько потратил каждый агент. Меняйте модели без правки кода агента — просто меняйте конфиг.

Почему EQVPS для LiteLLM-шлюза

VPS для ИИ-агентов → · Self-hosting Ollama на VPS →

Частые вопросы

Что реально даёт LiteLLM-прокси?

Один OpenAI-совместимый эндпоинт перед множеством провайдеров. Ваши приложения и агенты вызывают единый URL и имя модели; LiteLLM маршрутизирует к OpenAI, Anthropic, Groq, Together, локальной Ollama и т.д. Вы получаете бюджеты по ключам, лимиты, фолбэки и одно место для логов и стоимости — без правки кода при смене модели.

Какой тариф нужен?

Сам LiteLLM лёгкий — Small ($8/мес, 4 ГБ RAM) комфортно тянет прокси плюс Postgres для ключей/расходов. Это шлюз, а не инференс-машина: тяжёлые вычисления идут у провайдеров (или на отдельном GPU/хосте). Возьмите план с выделенным IP, чтобы поставить домен и HTTPS.

Зачем self-hosting, а не готовый шлюз?

Ваши ключи провайдеров, промпты, данные о расходах и логи остаются на машине, которой управляете вы, а не у третьей стороны. Бюджеты задаёте вы и видите каждый запрос. Для агентов, делающих много вызовов, эта прозрачность и контроль стоимости — весь смысл.

Работает ли с локальными моделями?

Да. Направьте одну запись модели LiteLLM на локальную Ollama (тот же VPS или другой хост) — и она доступна через тот же OpenAI-совместимый API, что и облачные модели. Приложение может смешивать дешёвую локальную модель и фронтир-API за одним эндпоинтом.

Вы спрашиваете удостоверение или карту?

Нет. Регистрация по email, оплата в USDC или USDT. Никаких документов, карт и KYC.

← Назад в блогТарифы и цены →

Комментарии

Пока нет комментариев. Будьте первым.

Оставить комментарий

Комментарии проходят модерацию перед публикацией.