EQVPS

Хоствай сам LiteLLM proxy на VPS: един OpenAI-съвместим endpoint за всеки модел

2.09.2026 г. · 3 мин четене · EQVPS Team

Ако пускаш повече от едно приложение — или един агент, който диама към няколко модела — в крайна сметка удряш същата стена: всеки доставчик има собствен SDK, собствени ключове, собствени rate limits и нито едно място да видиш разхода. LiteLLM поправя това, като слага един OpenAI-съвместим endpoint пред всичко. Кодът ти извиква един URL с име на модел; LiteLLM го маршрутизира към OpenAI, Anthropic, Groq, Together, Mistral, локален Ollama — каквото си конфигурирал — и ти дава бюджети, fallbacks и един лог на всяко извикване.

Хостването му на VPS значи, че ключовете на доставчиците ти, промптовете ти и данните ти за разход живеят на машина, която контролираш ти, платена в crypto без KYC.

Какво се нуждае LiteLLM proxy

Docker настройка (Ubuntu 24.04)

# dedicated-IP plan, root shell
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME          # admin key; issue per-app virtual keys instead
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...            # your provider keys
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Сложи Caddy или Nginx отпред за автоматичен HTTPS на домейна ти, после всеки OpenAI SDK просто работи:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Защо това е чудесно за агенти

AI агент или multi-agent флот обикновено прави много извиквания на модел. Зад LiteLLM proxy можеш: да ограничиш всеки агент със собствен виртуален ключ и бюджет, да ripиеш от frontier модел към по-евтин автоматично, да смесиш локален Ollama с облачни API-та, и да четеш един лог на точно колко е похарчил всеки агент. Сменяй модели, без да докосваш кода на агента — просто смени конфигурацията.

Защо EQVPS за LiteLLM gateway

VPS за AI агенти → · Хоствай сам Ollama на VPS →

Въпроси

Какво реално ми дава LiteLLM proxy?

Един OpenAI-съвместим endpoint пред много доставчици. Приложенията и агентите ти извикват един URL и име на модел; LiteLLM маршрутизира към OpenAI, Anthropic, Groq, Together, локален Ollama и т.н. Получаваш бюджети на ключ, rate limits, fallbacks и едно място за логове и разход — без да сменяш кода на приложението, когато сменяш модели.

Какъв план се нуждае?

Самият LiteLLM е лек — Small ($8/месец, 4 GB RAM) е комфортен за proxy-то плюс Postgres за ключове/разход. Той е gateway, не машина за inference: тежкото изчисление работи при доставчиците (или на отделен GPU/хост). Вземи план с dedicated IP, за да можеш да сложиш домейн и HTTPS отпред.

Защо да хоствам сам вместо да използвам хостнат gateway?

Ключовете на доставчиците ти, промптовете, данните за разход и логовете остават на машина, която контролираш, вместо на трета страна. Ти задаваш бюджетите и виждаш всяка заявка. За агенти, които диамат много извиквания, тази видимост и контрол на разхода са целият смисъл.

Работи ли и с локални модели?

Да. Насочи една от LiteLLM модел записите към локален Ollama (същия VPS или друга машина) и той е изложен през същото OpenAI-съвместимо API като облачните модели — така че приложение може да смеси евтин локален модел и frontier API зад един endpoint.

Искате ли документ или карта?

Не. Регистрирай се с имейл, плати в USDC или USDT. Без документи, без карта, без KYC.

← Обратно към блогаВиж планове и цени →

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.