EQVPS

Tự host một proxy LiteLLM trên một VPS: một endpoint tương thích OpenAI cho mọi mô hình

2 thg 9, 2026 · 3 phút đọc · EQVPS Team

Nếu bạn chạy nhiều hơn một ứng dụng — hoặc một agent bung ra nhiều mô hình — bạn cuối cùng đâm vào cùng bức tường: mỗi nhà cung cấp có SDK riêng, các khóa riêng, các giới hạn tần suất riêng, và không nơi duy nhất để thấy chi tiêu. LiteLLM sửa điều đó bằng cách đặt một endpoint tương thích OpenAI ở phía trước mọi thứ. Mã của bạn gọi một URL với một tên mô hình; LiteLLM định tuyến nó tới OpenAI, Anthropic, Groq, Together, Mistral, một Ollama cục bộ — bất cứ gì bạn cấu hình — và cho bạn các ngân sách, dự phòng, và một log của mọi cuộc gọi.

Tự host nó trên một VPS nghĩa là các khóa nhà cung cấp, prompt và dữ liệu chi tiêu của bạn sống trên một cỗ máy bạn kiểm soát, thanh toán bằng crypto không KYC.

Một proxy LiteLLM cần gì

Thiết lập Docker (Ubuntu 24.04)

# gói IP riêng, root shell
apt update && apt install -y docker.io docker-compose-v2
systemctl enable --now docker

mkdir -p /opt/litellm && cd /opt/litellm
cat > config.yaml <<'EOF'
model_list:
  - model_name: gpt-4o
    litellm_params:
      model: openai/gpt-4o
      api_key: os.environ/OPENAI_API_KEY
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-4-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434
general_settings:
  master_key: sk-CHANGE-ME          # khóa admin; phát các khóa ảo theo-ứng-dụng thay vào đó
EOF

cat > docker-compose.yml <<'EOF'
services:
  litellm:
    image: ghcr.io/berriai/litellm:main-latest
    restart: always
    ports: [ "127.0.0.1:4000:4000" ]
    environment:
      OPENAI_API_KEY: sk-...            # các khóa nhà cung cấp của bạn
      ANTHROPIC_API_KEY: sk-ant-...
      DATABASE_URL: postgresql://litellm:change_me@postgres:5432/litellm
    volumes: [ ./config.yaml:/app/config.yaml ]
    command: [ "--config", "/app/config.yaml" ]
  postgres:
    image: postgres:16
    restart: always
    environment:
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: change_me
      POSTGRES_DB: litellm
    volumes: [ ./pgdata:/var/lib/postgresql/data ]
EOF

docker compose up -d

Đặt Caddy hoặc Nginx ở phía trước cho HTTPS tự động trên tên miền của bạn, rồi bất kỳ OpenAI SDK nào cứ hoạt động:

curl https://llm.yourdomain.com/v1/chat/completions \
  -H "Authorization: Bearer sk-your-virtual-key" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude","messages":[{"role":"user","content":"ping"}]}'

Vì sao điều này tuyệt cho agent

Một AI agent hoặc một đội đa agent thường tạo nhiều cuộc gọi mô hình. Sau một proxy LiteLLM bạn có thể: giới hạn mỗi agent với khóa ảo và ngân sách riêng của nó, dự phòng từ một mô hình tiền tuyến sang một cái rẻ hơn tự động, trộn một Ollama cục bộ với các API cloud, và đọc một log của chính xác cái mỗi agent chi. Đổi mô hình mà không chạm mã agent — chỉ đổi cấu hình.

Vì sao EQVPS cho một gateway LiteLLM

VPS cho AI agent → · Tự host Ollama trên một VPS →

FAQ

Một proxy LiteLLM thực sự cho tôi gì?

Một endpoint tương thích OpenAI ở phía trước nhiều nhà cung cấp. Các ứng dụng và agent của bạn gọi một URL và tên mô hình duy nhất; LiteLLM định tuyến tới OpenAI, Anthropic, Groq, Together, một Ollama cục bộ, v.v. Bạn có các ngân sách theo-khóa, giới hạn tần suất, dự phòng và một nơi cho log và chi phí — mà không đổi mã ứng dụng khi bạn chuyển mô hình.

Nó cần gói nào?

Bản thân LiteLLM nhẹ — Small ($8/tháng, 4 GB RAM) là thoải mái cho proxy cộng Postgres cho các khóa/chi tiêu. Nó là một gateway, không phải một cỗ máy suy luận: tính toán nặng chạy ở các nhà cung cấp (hoặc trên một GPU/host riêng). Chọn một gói IP riêng để bạn có thể đặt một tên miền và HTTPS ở phía trước.

Vì sao tự host thay vì dùng một gateway được host?

Các khóa nhà cung cấp, prompt, dữ liệu chi tiêu và log của bạn ở lại trên một cỗ máy bạn kiểm soát thay vì của một bên thứ ba. Bạn đặt các ngân sách và thấy mọi yêu cầu. Cho các agent bung ra nhiều cuộc gọi, sự minh bạch và kiểm soát chi phí đó là toàn bộ mục đích.

Nó có hoạt động với các mô hình cục bộ không?

Có. Trỏ một trong các mục mô hình LiteLLM tới một Ollama cục bộ (cùng VPS hoặc một cỗ máy khác) và nó được phơi bày qua cùng API tương thích OpenAI như các mô hình cloud — nên một ứng dụng có thể trộn một mô hình cục bộ rẻ và một API tiền tuyến sau một endpoint.

Bạn có hỏi giấy tờ hay một thẻ không?

Không. Đăng ký bằng một email, thanh toán bằng USDC hoặc USDT. Không giấy tờ, không thẻ, không KYC.

← Quay lại blogXem gói & giá →

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.