你同时用着三家模型服务,每家都有自己的聊天窗口、订阅和历史记录。Open WebUI 把它们收拢到一个你自己托管的界面后面:每段对话单独选模型,所有历史都留在你的服务器上,可以和团队共享,还能在不想让任何数据离开机器时接入本地模型。
两种用法
作为 API 的前端。 Open WebUI 能连接任何 OpenAI 兼容的 API——托管服务商、一个 LiteLLM 代理,或者你自己的端点。服务器几乎不干活;小套餐绰绰有余。
搭配本地模型。 在同一台服务器上加装 Ollama,在本地运行开放权重的模型。这时内存就成了瓶颈,CPU 推理也很慢。实话实说的取舍是:完全的隐私,一般的速度。
| 配置 | 套餐 |
|---|---|
| API 前端,个人使用 | Micro — 1 vCPU、2 GB、每月 $5(SSH 隧道) |
| API 前端,团队通过 HTTPS 访问 | Micro-IP — 1 vCPU、2 GB、每月 $10 |
| 通过 Ollama 运行本地 3B 模型 | AI-Agent — 2 vCPU、4 GB、每月 $10 |
| 本地 7–8B 模型 | Medium — 4 vCPU、6 GB、每月 $12,更大的模型用 Pro 套餐 |
用 Docker 安装
在装好了 Docker 的服务器上:
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
绑定到 127.0.0.1 能让它在你决定怎么公开之前,都不出现在公网上。聊天记录、用户和设置都存在 open-webui 卷里。
安全地访问
SSH 隧道——所有套餐都能用,包括 NAT:
ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10
打开 http://localhost:3000。NAT 套餐请使用你的专属 SSH 端口。
在你的域名上用 HTTPS——适合独立 IP 套餐上的团队。把一个子域名解析到服务器(指南),再用 nginx 反向代理,别忘了 WebSocket 头:
location / {
proxy_pass http://127.0.0.1:3000;
proxy_set_header Host $host;
proxy_set_header Upgrade $http_upgrade;
proxy_set_header Connection upgrade;
proxy_read_timeout 300s;
}
然后运行 certbot --nginx -d chat.example.com。较长的读取超时很重要:慢模型会连续几分钟流式输出回答。
进去后的第一步
- 马上注册。 第一个账号会成为管理员。别让刚装好的实例公开晾着——可能被别人抢先占了。
- 关闭注册。 管理设置 → 把新用户的默认角色设为待审批,或者直接关闭注册。
- 添加连接。 设置 → 连接 → 粘贴 API 的基础 URL 和密钥。该服务商的模型就会出现在模型选择器里。
添加本地模型
在主机上安装 Ollama(我们的指南),拉一个小模型,再以能访问到它的方式启动 Open WebUI:
ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main
有卷在,重启后聊天记录还在。CPU 上预计每秒几个 token——写摘要、记私人笔记可以,写长文就慢了。更重的本地推理,见 Ollama 专用 VPS。
值得知道
- 更新很频繁。
docker pull ghcr.io/open-webui/open-webui:main,然后重建容器。先备份卷。 - API 费用你自己出。 Open WebUI 默认不限制每个用户的用量;和团队共享时请留意花费。
- 它是聊天应用,不是模型。 回答质量完全取决于背后的模型。
套餐限制和升级方式见套餐文档。
评论
暂无评论。来做第一个吧。