−25%

su Windows con pagamento annuale, fino al 31/10. Vai ai piani

EQVPS
Inizia

VPS per Open WebUI: un'interfaccia chat privata per LLM

Ospita Open WebUI su un VPS come interfaccia chat privata per qualsiasi API compatibile OpenAI o modelli Ollama locali: setup Docker, accesso sicuro e dimensionamento.

Usi tre provider di modelli diversi, ognuno con la sua finestra di chat, il suo abbonamento e la sua cronologia. Open WebUI li mette dietro un'unica interfaccia che ospiti tu: scegli un modello per ogni conversazione, tieni tutta la cronologia sul tuo server, condividilo con il team e collega modelli locali quando non vuoi che nulla lasci la macchina.

Due modi di usarlo

Come interfaccia per API. Open WebUI si collega a qualsiasi API compatibile OpenAI: provider ospitati, un proxy LiteLLM o un tuo endpoint. Il server non fa quasi nulla; un piano piccolo basta e avanza.

Con modelli locali. Aggiungi Ollama sullo stesso server ed esegui in locale modelli open-weight. Ora il vincolo è la RAM, e l'inferenza su CPU è lenta. Il compromesso onesto: privacy totale, velocità modesta.

ConfigurazionePiano
Interfaccia API, uso personaleMicro — 1 vCPU, 2 GB, $5/mese (tunnel SSH)
Interfaccia API, accesso del team via HTTPSMicro-IP — 1 vCPU, 2 GB, $10/mese
Modelli locali 3B via OllamaAI-Agent — 2 vCPU, 4 GB, $10/mese
Modelli locali 7–8BMedium — 4 vCPU, 6 GB, $12/mese, o piani Pro per quelli più grandi

Installazione con Docker

Su un server con Docker installato:

docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Il bind su 127.0.0.1 lo tiene fuori da Internet finché non decidi come esporlo. Chat, utenti e impostazioni vivono nel volume open-webui.

Accedere in sicurezza

Tunnel SSH — funziona con tutti i piani, NAT compreso:

ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10

Apri http://localhost:3000. Su un piano NAT usa la tua porta SSH personale.

HTTPS sul tuo dominio — per un team su un piano con IP dedicato. Punta un sottodominio al server (guida) e fai il proxy con nginx, header WebSocket compresi:

location / {
    proxy_pass http://127.0.0.1:3000;
    proxy_set_header Host $host;
    proxy_set_header Upgrade $http_upgrade;
    proxy_set_header Connection upgrade;
    proxy_read_timeout 300s;
}

Poi esegui certbot --nginx -d chat.example.com. Il lungo timeout di lettura conta: i modelli lenti trasmettono le risposte per minuti.

Primi passi all'interno

  1. Registrati subito. Il primo account diventa amministratore. Non lasciare pubblica un'installazione nuova: qualcun altro potrebbe prendersela.
  2. Chiudi le registrazioni. Impostazioni di amministrazione → ruolo predefinito dei nuovi utenti su in attesa, oppure disattiva la registrazione.
  3. Aggiungi una connessione. Impostazioni → Connessioni → incolla un URL base dell'API e una chiave. I modelli di quel provider compaiono nel selettore.

Aggiungere modelli locali

Installa Ollama sull'host (la nostra guida), scarica un modello piccolo e avvia Open WebUI in modo che possa raggiungerlo:

ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main

Il volume conserva le chat al riavvio. Aspettati pochi token al secondo su CPU: va bene per riassunti e note private, è lento per testi lunghi. Per un'inferenza locale più seria, vedi VPS per Ollama.

Da sapere

Limiti e upgrade dei piani nella documentazione dei piani.

Pronto a fare il deploy? Paga in crypto, niente KYC — online in circa un minuto.

Fai il deploy ora →

FAQ

Quanta RAM serve a Open WebUI?

Open WebUI da solo gira con circa 1 GB. Se parla solo con API remote, un piano da 2 GB basta. Sono i modelli locali via Ollama a chiedere memoria: 4 GB per piccoli modelli 3B, 6 GB o più per modelli 7–8B.

Posso eseguire modelli locali su un VPS senza GPU?

Sì, con aspettative realistiche. I piccoli modelli quantizzati rispondono su CPU a pochi token al secondo. Va bene per compiti brevi e prove private, non per una chat reattiva con risposte lunghe.

Posso usarlo su un piano NAT?

Sì, tramite un tunnel SSH sulla tua porta SSH personale. Per un indirizzo HTTPS pubblico che il team apre nel browser serve un piano con IP dedicato.

Chi può creare account?

Il primo account registrato diventa amministratore. Dopo, metti le nuove registrazioni in attesa o disattivale nelle impostazioni di amministrazione, altrimenti chiunque trovi l'URL può crearsi un account.

Dove vengono salvate le conversazioni?

In un volume Docker sul tuo server. Niente va a terzi, a parte i prompt che invii all'API del modello che hai collegato.

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.