Usi tre provider di modelli diversi, ognuno con la sua finestra di chat, il suo abbonamento e la sua cronologia. Open WebUI li mette dietro un'unica interfaccia che ospiti tu: scegli un modello per ogni conversazione, tieni tutta la cronologia sul tuo server, condividilo con il team e collega modelli locali quando non vuoi che nulla lasci la macchina.
Due modi di usarlo
Come interfaccia per API. Open WebUI si collega a qualsiasi API compatibile OpenAI: provider ospitati, un proxy LiteLLM o un tuo endpoint. Il server non fa quasi nulla; un piano piccolo basta e avanza.
Con modelli locali. Aggiungi Ollama sullo stesso server ed esegui in locale modelli open-weight. Ora il vincolo è la RAM, e l'inferenza su CPU è lenta. Il compromesso onesto: privacy totale, velocità modesta.
| Configurazione | Piano |
|---|---|
| Interfaccia API, uso personale | Micro — 1 vCPU, 2 GB, $5/mese (tunnel SSH) |
| Interfaccia API, accesso del team via HTTPS | Micro-IP — 1 vCPU, 2 GB, $10/mese |
| Modelli locali 3B via Ollama | AI-Agent — 2 vCPU, 4 GB, $10/mese |
| Modelli locali 7–8B | Medium — 4 vCPU, 6 GB, $12/mese, o piani Pro per quelli più grandi |
Installazione con Docker
Su un server con Docker installato:
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Il bind su 127.0.0.1 lo tiene fuori da Internet finché non decidi come esporlo. Chat, utenti e impostazioni vivono nel volume open-webui.
Accedere in sicurezza
Tunnel SSH — funziona con tutti i piani, NAT compreso:
ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10
Apri http://localhost:3000. Su un piano NAT usa la tua porta SSH personale.
HTTPS sul tuo dominio — per un team su un piano con IP dedicato. Punta un sottodominio al server (guida) e fai il proxy con nginx, header WebSocket compresi:
location / {
proxy_pass http://127.0.0.1:3000;
proxy_set_header Host $host;
proxy_set_header Upgrade $http_upgrade;
proxy_set_header Connection upgrade;
proxy_read_timeout 300s;
}
Poi esegui certbot --nginx -d chat.example.com. Il lungo timeout di lettura conta: i modelli lenti trasmettono le risposte per minuti.
Primi passi all'interno
- Registrati subito. Il primo account diventa amministratore. Non lasciare pubblica un'installazione nuova: qualcun altro potrebbe prendersela.
- Chiudi le registrazioni. Impostazioni di amministrazione → ruolo predefinito dei nuovi utenti su in attesa, oppure disattiva la registrazione.
- Aggiungi una connessione. Impostazioni → Connessioni → incolla un URL base dell'API e una chiave. I modelli di quel provider compaiono nel selettore.
Aggiungere modelli locali
Installa Ollama sull'host (la nostra guida), scarica un modello piccolo e avvia Open WebUI in modo che possa raggiungerlo:
ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main
Il volume conserva le chat al riavvio. Aspettati pochi token al secondo su CPU: va bene per riassunti e note private, è lento per testi lunghi. Per un'inferenza locale più seria, vedi VPS per Ollama.
Da sapere
- Gli aggiornamenti sono frequenti.
docker pull ghcr.io/open-webui/open-webui:main, poi ricrea il container. Prima fai il backup del volume. - I costi delle API sono tuoi. Di default Open WebUI non limita l'uso per utente; tieni d'occhio la spesa se lo condividi con un team.
- È un'app di chat, non un modello. La qualità delle risposte dipende interamente dal modello dietro.
Limiti e upgrade dei piani nella documentazione dei piani.
Commenti
Ancora nessun commento. Sii il primo.