Bạn dùng ba nhà cung cấp mô hình khác nhau, mỗi nơi một cửa sổ chat, một gói đăng ký và một lịch sử riêng. Open WebUI gom tất cả sau một giao diện do bạn tự host: chọn mô hình cho từng cuộc trò chuyện, giữ toàn bộ lịch sử trên máy chủ của mình, chia sẻ với nhóm, và cắm mô hình cục bộ khi không muốn thứ gì rời khỏi máy.
Hai cách chạy
Làm giao diện cho API. Open WebUI kết nối với bất kỳ API nào tương thích OpenAI — nhà cung cấp có sẵn, một proxy LiteLLM hoặc endpoint của riêng bạn. Máy chủ gần như chẳng phải làm gì; một gói nhỏ là thừa đủ.
Với mô hình cục bộ. Thêm Ollama trên cùng máy chủ và chạy các mô hình trọng số mở ngay tại chỗ. Khi đó RAM là giới hạn, và suy luận trên CPU thì chậm. Đánh đổi thành thật: riêng tư tuyệt đối, tốc độ khiêm tốn.
| Cấu hình | Gói |
|---|---|
| Giao diện API, dùng cá nhân | Micro — 1 vCPU, 2 GB, $5/tháng (đường hầm SSH) |
| Giao diện API, nhóm truy cập qua HTTPS | Micro-IP — 1 vCPU, 2 GB, $10/tháng |
| Mô hình 3B cục bộ qua Ollama | AI-Agent — 2 vCPU, 4 GB, $10/tháng |
| Mô hình 7–8B cục bộ | Medium — 4 vCPU, 6 GB, $12/tháng, hoặc gói Pro cho mô hình lớn hơn |
Cài đặt bằng Docker
Trên máy chủ đã cài Docker:
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Gắn vào 127.0.0.1 giữ nó khỏi internet công cộng cho tới khi bạn quyết định cách mở ra. Chat, người dùng và cài đặt nằm trong volume open-webui.
Truy cập an toàn
Đường hầm SSH — dùng được với mọi gói, kể cả NAT:
ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10
Mở http://localhost:3000. Với gói NAT, dùng cổng SSH cá nhân của bạn.
HTTPS trên tên miền của bạn — cho nhóm trên gói IP riêng. Trỏ một tên miền phụ về máy chủ (hướng dẫn) và proxy bằng nginx, kèm các header WebSocket:
location / {
proxy_pass http://127.0.0.1:3000;
proxy_set_header Host $host;
proxy_set_header Upgrade $http_upgrade;
proxy_set_header Connection upgrade;
proxy_read_timeout 300s;
}
Sau đó chạy certbot --nginx -d chat.example.com. Thời gian chờ đọc dài là quan trọng: mô hình chậm stream câu trả lời trong nhiều phút.
Những bước đầu bên trong
- Đăng ký ngay. Tài khoản đầu tiên trở thành quản trị viên. Đừng để bản cài mới công khai — người khác có thể chiếm mất.
- Đóng đăng ký. Cài đặt quản trị → đặt vai trò mặc định của người dùng mới là chờ duyệt, hoặc tắt đăng ký.
- Thêm kết nối. Cài đặt → Kết nối → dán URL gốc của API và khóa. Các mô hình của nhà cung cấp đó xuất hiện trong danh sách chọn mô hình.
Thêm mô hình cục bộ
Cài Ollama trên máy chủ (hướng dẫn của chúng tôi), kéo một mô hình nhỏ, rồi khởi động Open WebUI sao cho nó truy cập được:
ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main
Volume giữ nguyên các cuộc chat khi khởi động lại. Hãy chờ đợi vài token mỗi giây trên CPU — ổn cho tóm tắt và ghi chú riêng, chậm với bài viết dài. Để suy luận cục bộ nặng hơn, xem VPS cho Ollama.
Đáng biết
- Cập nhật diễn ra thường xuyên.
docker pull ghcr.io/open-webui/open-webui:main, rồi tạo lại container. Sao lưu volume trước. - Chi phí API do bạn chịu. Mặc định Open WebUI không giới hạn mức dùng theo người; hãy để ý chi tiêu nếu chia sẻ với nhóm.
- Đây là ứng dụng chat, không phải mô hình. Chất lượng câu trả lời phụ thuộc hoàn toàn vào mô hình phía sau.
Giới hạn và nâng cấp của các gói có trong tài liệu về các gói.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.