−25%

no Windows com pagamento anual, até 31/10. Ver planos

EQVPS

VPS para Open WebUI: uma interface de chat privada para LLMs

Hospede o Open WebUI num VPS como interface de chat privada para qualquer API compatível com OpenAI ou modelos locais no Ollama: Docker, acesso seguro e dimensionamento.

Você usa três provedores de modelos diferentes, cada um com sua janela de chat, sua assinatura e seu histórico. O Open WebUI junta tudo numa só interface que você mesmo hospeda: escolha um modelo por conversa, mantenha todo o histórico no seu servidor, compartilhe com a equipe e conecte modelos locais quando não quiser que nada saia da máquina.

Duas formas de usar

Como interface para APIs. O Open WebUI se conecta a qualquer API compatível com OpenAI — provedores hospedados, um proxy LiteLLM ou seu próprio endpoint. O servidor quase não trabalha; um plano pequeno sobra.

Com modelos locais. Adicione o Ollama no mesmo servidor e rode modelos de pesos abertos localmente. Aí a RAM vira o limite, e inferência em CPU é lenta. A troca honesta: privacidade total, velocidade modesta.

ConfiguraçãoPlano
Interface de API, uso pessoalMicro — 1 vCPU, 2 GB, $5/mês (túnel SSH)
Interface de API, acesso da equipe via HTTPSMicro-IP — 1 vCPU, 2 GB, $10/mês
Modelos locais de 3B via OllamaAI-Agent — 2 vCPU, 4 GB, $10/mês
Modelos locais de 7–8BMedium — 4 vCPU, 6 GB, $12/mês, ou planos Pro para os maiores

Instalação com Docker

Num servidor com o Docker instalado:

docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

O bind em 127.0.0.1 o mantém fora da internet até você decidir como expô-lo. Conversas, usuários e configurações ficam no volume open-webui.

Acesse com segurança

Túnel SSH — funciona em todos os planos, inclusive NAT:

ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10

Abra http://localhost:3000. Num plano NAT, use sua porta SSH pessoal.

HTTPS no seu domínio — para uma equipe num plano com IP dedicado. Aponte um subdomínio para o servidor (guia) e faça o proxy com nginx, incluindo os cabeçalhos de WebSocket:

location / {
    proxy_pass http://127.0.0.1:3000;
    proxy_set_header Host $host;
    proxy_set_header Upgrade $http_upgrade;
    proxy_set_header Connection upgrade;
    proxy_read_timeout 300s;
}

Depois rode certbot --nginx -d chat.example.com. O timeout de leitura longo importa: modelos lentos transmitem respostas por minutos.

Primeiros passos lá dentro

  1. Cadastre-se imediatamente. A primeira conta vira administradora. Não deixe uma instalação nova pública — outra pessoa pode tomá-la.
  2. Feche os cadastros. Configurações de administração → defina o papel padrão de novos usuários como pendente, ou desative o cadastro.
  3. Adicione uma conexão. Configurações → Conexões → cole a URL base da API e a chave. Os modelos desse provedor aparecem no seletor.

Adicionando modelos locais

Instale o Ollama no host (nosso guia), baixe um modelo pequeno e suba o Open WebUI de forma que ele o alcance:

ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main

O volume preserva suas conversas no reinício. Espere poucos tokens por segundo na CPU — bom para resumos e notas privadas, lento para textos longos. Para inferência local mais pesada, veja VPS para Ollama.

Vale saber

Limites e upgrades dos planos estão na documentação dos planos.

Pronto para implantar? Pague com cripto, sem KYC — online em cerca de um minuto.

Implantar agora →

FAQ

Quanta RAM o Open WebUI precisa?

O Open WebUI sozinho roda com cerca de 1 GB. Se ele só conversa com APIs remotas, um plano de 2 GB basta. Quem pede memória são os modelos locais no Ollama — 4 GB para modelos pequenos de 3B, 6 GB ou mais para modelos de 7–8B.

Dá para rodar modelos locais num VPS sem GPU?

Sim, com expectativas realistas. Modelos pequenos quantizados respondem na CPU a poucos tokens por segundo. Serve para tarefas curtas e testes privados, não para um chat ágil com respostas longas.

Posso usar num plano NAT?

Sim, por um túnel SSH na sua porta SSH pessoal. Para um endereço HTTPS público que sua equipe abra no navegador, você precisa de um plano com IP dedicado.

Quem pode criar contas?

A primeira conta registrada vira administradora. Depois disso, deixe novos cadastros como pendentes ou desative-os nas configurações de administração, senão qualquer um que achar a URL cria uma conta.

Onde minhas conversas ficam guardadas?

Num volume Docker no seu servidor. Nada vai para terceiros, exceto os prompts que você envia à API de modelo que conectou.

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.