Korzystasz z trzech różnych dostawców modeli, każdy z własnym oknem czatu, subskrypcją i historią. Open WebUI zbiera je za jednym interfejsem, który hostujesz sam: wybierasz model do każdej rozmowy, całą historię trzymasz na swoim serwerze, dzielisz się nim z zespołem i podłączasz lokalne modele, gdy nic nie powinno opuszczać maszyny.
Dwa sposoby użycia
Jako interfejs do API. Open WebUI łączy się z dowolnym API zgodnym z OpenAI — hostowanymi dostawcami, proxy LiteLLM albo własnym endpointem. Serwer prawie nic nie robi; mały plan w zupełności wystarczy.
Z lokalnymi modelami. Dodaj Ollamę na tym samym serwerze i uruchamiaj lokalnie modele z otwartymi wagami. Teraz ograniczeniem jest RAM, a inferencja na CPU jest powolna. Uczciwy kompromis: pełna prywatność, skromna szybkość.
| Konfiguracja | Plan |
|---|---|
| Interfejs API, użytek prywatny | Micro — 1 vCPU, 2 GB, $5/mies. (tunel SSH) |
| Interfejs API, dostęp zespołu przez HTTPS | Micro-IP — 1 vCPU, 2 GB, $10/mies. |
| Lokalne modele 3B przez Ollamę | AI-Agent — 2 vCPU, 4 GB, $10/mies. |
| Lokalne modele 7–8B | Medium — 4 vCPU, 6 GB, $12/mies., albo plany Pro dla większych |
Instalacja w Dockerze
Na serwerze z zainstalowanym Dockerem:
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 \
-v open-webui:/app/backend/data \
ghcr.io/open-webui/open-webui:main
Powiązanie z 127.0.0.1 trzyma go z dala od internetu, dopóki nie zdecydujesz, jak go udostępnić. Czaty, użytkownicy i ustawienia żyją w wolumenie open-webui.
Bezpieczny dostęp
Tunel SSH — działa na każdym planie, także NAT:
ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10
Otwórz http://localhost:3000. Na planie NAT użyj osobistego portu SSH.
HTTPS na twojej domenie — dla zespołu na planie z dedykowanym IP. Skieruj subdomenę na serwer (poradnik) i puść ją przez nginx razem z nagłówkami WebSocket:
location / {
proxy_pass http://127.0.0.1:3000;
proxy_set_header Host $host;
proxy_set_header Upgrade $http_upgrade;
proxy_set_header Connection upgrade;
proxy_read_timeout 300s;
}
Potem uruchom certbot --nginx -d chat.example.com. Długi timeout odczytu ma znaczenie: wolne modele strumieniują odpowiedzi przez całe minuty.
Pierwsze kroki w środku
- Zarejestruj się od razu. Pierwsze konto zostaje administratorem. Nie zostawiaj świeżej instalacji publicznie — ktoś inny może ją przejąć.
- Zamknij rejestrację. Ustawienia administratora → domyślna rola nowych użytkowników na oczekującą albo wyłącz rejestrację.
- Dodaj połączenie. Ustawienia → Połączenia → wklej bazowy URL API i klucz. Modele tego dostawcy pojawią się w wyborze modelu.
Dodawanie lokalnych modeli
Zainstaluj Ollamę na hoście (nasz poradnik), pobierz mały model i uruchom Open WebUI tak, żeby mógł do niego sięgnąć:
ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
-p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
-v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main
Wolumen zachowuje twoje czaty po restarcie. Spodziewaj się kilku tokenów na sekundę na CPU — dobre do streszczeń i prywatnych notatek, wolne przy długich tekstach. Do poważniejszej lokalnej inferencji zobacz VPS dla Ollamy.
Warto wiedzieć
- Aktualizacje są częste.
docker pull ghcr.io/open-webui/open-webui:main, potem odtwórz kontener. Najpierw zrób kopię wolumenu. - Koszty API są po twojej stronie. Open WebUI domyślnie nie limituje użycia na użytkownika; pilnuj wydatków, jeśli dzielisz go z zespołem.
- To aplikacja czatu, nie model. Jakość odpowiedzi zależy wyłącznie od modelu za nią.
Limity i rozbudowa planów są opisane w dokumentacji planów.
Komentarze
Brak komentarzy. Bądź pierwszy.