Você usa três provedores de modelos diferentes, cada um com sua janela de chat, sua assinatura e seu histórico. O Open WebUI junta tudo numa só interface que você mesmo hospeda: escolha um modelo por conversa, mantenha todo o histórico no seu servidor, compartilhe com a equipe e conecte modelos locais quando não quiser que nada saia da máquina.
Duas formas de usar
Como interface para APIs. O Open WebUI se conecta a qualquer API compatível com OpenAI — provedores hospedados, um proxy LiteLLM ou seu próprio endpoint. O servidor quase não trabalha; um plano pequeno sobra.
Com modelos locais. Adicione o Ollama no mesmo servidor e rode modelos de pesos abertos localmente. Aí a RAM vira o limite, e inferência em CPU é lenta. A troca honesta: privacidade total, velocidade modesta.
| Configuração | Plano |
|---|---|
| Interface de API, uso pessoal | Micro — 1 vCPU, 2 GB, $5/mês (túnel SSH) |
| Interface de API, acesso da equipe via HTTPS | Micro-IP — 1 vCPU, 2 GB, $10/mês |
| Modelos locais de 3B via Ollama | AI-Agent — 2 vCPU, 4 GB, $10/mês |
| Modelos locais de 7–8B | Medium — 4 vCPU, 6 GB, $12/mês, ou planos Pro para os maiores |
Instalação com Docker
Num servidor com o Docker instalado:
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
O bind em 127.0.0.1 o mantém fora da internet até você decidir como expô-lo. Conversas, usuários e configurações ficam no volume open-webui.
Acesse com segurança
Túnel SSH — funciona em todos os planos, inclusive NAT:
ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10
Abra http://localhost:3000. Num plano NAT, use sua porta SSH pessoal.
HTTPS no seu domínio — para uma equipe num plano com IP dedicado. Aponte um subdomínio para o servidor (guia) e faça o proxy com nginx, incluindo os cabeçalhos de WebSocket:
location / {
proxy_pass http://127.0.0.1:3000;
proxy_set_header Host $host;
proxy_set_header Upgrade $http_upgrade;
proxy_set_header Connection upgrade;
proxy_read_timeout 300s;
}
Depois rode certbot --nginx -d chat.example.com. O timeout de leitura longo importa: modelos lentos transmitem respostas por minutos.
Primeiros passos lá dentro
- Cadastre-se imediatamente. A primeira conta vira administradora. Não deixe uma instalação nova pública — outra pessoa pode tomá-la.
- Feche os cadastros. Configurações de administração → defina o papel padrão de novos usuários como pendente, ou desative o cadastro.
- Adicione uma conexão. Configurações → Conexões → cole a URL base da API e a chave. Os modelos desse provedor aparecem no seletor.
Adicionando modelos locais
Instale o Ollama no host (nosso guia), baixe um modelo pequeno e suba o Open WebUI de forma que ele o alcance:
ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main
O volume preserva suas conversas no reinício. Espere poucos tokens por segundo na CPU — bom para resumos e notas privadas, lento para textos longos. Para inferência local mais pesada, veja VPS para Ollama.
Vale saber
- As atualizações são frequentes.
docker pull ghcr.io/open-webui/open-webui:maine recrie o contêiner. Faça backup do volume antes. - Os custos de API são seus. Por padrão, o Open WebUI não limita o uso por usuário; acompanhe os gastos se compartilhar com uma equipe.
- É um app de chat, não um modelo. A qualidade das respostas depende inteiramente do modelo por trás.
Limites e upgrades dos planos estão na documentação dos planos.
Comentários
Nenhum comentário ainda. Seja o primeiro.