−25%

auf Windows bei Jahreszahlung, bis 31.10. Zu den Tarifen

EQVPS

VPS für Open WebUI: eine private Chat-Oberfläche für LLMs

Open WebUI auf dem VPS als private Chat-Oberfläche für jede OpenAI-kompatible API oder lokale Ollama-Modelle: Docker-Setup, sicherer Zugang, Ressourcen und Abwägungen.

Sie nutzen drei verschiedene Modellanbieter, jeder mit eigenem Chatfenster, eigenem Abo und eigenem Verlauf. Open WebUI bündelt sie hinter einer Oberfläche, die Sie selbst hosten: Modell pro Unterhaltung wählen, den gesamten Verlauf auf Ihrem Server behalten, mit dem Team teilen und lokale Modelle anschließen, wenn nichts die Maschine verlassen soll.

Zwei Betriebsarten

Als Oberfläche für APIs. Open WebUI verbindet sich mit jeder OpenAI-kompatiblen API — gehosteten Anbietern, einem LiteLLM-Proxy oder Ihrem eigenen Endpunkt. Der Server arbeitet dabei kaum; ein kleiner Tarif reicht locker.

Mit lokalen Modellen. Ollama auf demselben Server installieren und offene Modelle lokal betreiben. Jetzt ist RAM die Grenze, und Inferenz auf der CPU ist langsam. Ehrlicher Kompromiss: vollständige Privatsphäre, bescheidenes Tempo.

SetupTarif
API-Oberfläche, privatMicro — 1 vCPU, 2 GB, $5/Monat (SSH-Tunnel)
API-Oberfläche, Teamzugang per HTTPSMicro-IP — 1 vCPU, 2 GB, $10/Monat
Lokale 3B-Modelle über OllamaAI-Agent — 2 vCPU, 4 GB, $10/Monat
Lokale 7–8B-ModelleMedium — 4 vCPU, 6 GB, $12/Monat, oder Pro-Tarife für größere

Installation mit Docker

Auf einem Server mit installiertem Docker:

docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Die Bindung an 127.0.0.1 hält es aus dem öffentlichen Internet, bis Sie entscheiden, wie Sie es freigeben. Chats, Benutzer und Einstellungen liegen im Volume open-webui.

Sicher zugreifen

SSH-Tunnel — funktioniert auf jedem Tarif, auch NAT:

ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10

Öffnen Sie http://localhost:3000. Bei einem NAT-Tarif nutzen Sie Ihren persönlichen SSH-Port.

HTTPS auf Ihrer Domain — für ein Team auf einem Tarif mit eigener IP. Lassen Sie eine Subdomain auf den Server zeigen (Anleitung) und leiten Sie über nginx weiter, inklusive WebSocket-Headern:

location / {
    proxy_pass http://127.0.0.1:3000;
    proxy_set_header Host $host;
    proxy_set_header Upgrade $http_upgrade;
    proxy_set_header Connection upgrade;
    proxy_read_timeout 300s;
}

Dann certbot --nginx -d chat.example.com ausführen. Das lange Lese-Timeout ist wichtig: Langsame Modelle streamen Antworten über Minuten.

Erste Schritte innerhalb

  1. Sofort registrieren. Das erste Konto wird Admin. Lassen Sie eine frische Installation nicht offen stehen — jemand anderes könnte sie übernehmen.
  2. Registrierung schließen. Admin-Einstellungen → Standardrolle neuer Benutzer auf ausstehend setzen oder Registrierung deaktivieren.
  3. Verbindung hinzufügen. Einstellungen → Verbindungen → API-Basis-URL und Schlüssel einfügen. Die Modelle dieses Anbieters erscheinen in der Modellauswahl.

Lokale Modelle hinzufügen

Installieren Sie Ollama auf dem Host (unsere Anleitung), laden Sie ein kleines Modell und starten Sie Open WebUI so, dass es darauf zugreifen kann:

ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main

Das Volume behält Ihre Chats über den Neustart. Rechnen Sie auf der CPU mit ein paar Token pro Sekunde — gut für Zusammenfassungen und private Notizen, langsam für lange Texte. Für mehr lokale Inferenz siehe VPS für Ollama.

Gut zu wissen

Tarifgrenzen und Upgrades stehen in der Tarif-Dokumentation.

Bereit zum Bereitstellen? Zahle in Krypto, ohne KYC — online in etwa einer Minute.

Bereitstellen →

FAQ

Wie viel RAM braucht Open WebUI?

Open WebUI selbst kommt mit etwa 1 GB aus. Spricht es nur mit entfernten APIs, reicht ein Tarif mit 2 GB. Speicher brauchen lokale Modelle über Ollama — 4 GB für kleine 3B-Modelle, 6 GB oder mehr für 7–8B-Modelle.

Kann ich lokale Modelle auf einem VPS ohne GPU betreiben?

Ja, aber mit realistischen Erwartungen. Kleine quantisierte Modelle antworten auf der CPU mit ein paar Token pro Sekunde. Für kurze Aufgaben und private Experimente reicht das, für einen flotten Chat mit langen Antworten nicht.

Funktioniert es auf einem NAT-Tarif?

Ja, über einen SSH-Tunnel auf Ihrem persönlichen SSH-Port. Für eine öffentliche HTTPS-Adresse, die Ihr Team im Browser öffnet, brauchen Sie einen Tarif mit eigener IP.

Wer darf Konten anlegen?

Das erste registrierte Konto wird Admin. Stellen Sie danach neue Registrierungen in den Admin-Einstellungen auf ausstehend oder deaktivieren Sie sie, sonst kann jeder, der die URL findet, ein Konto anlegen.

Wo werden meine Chats gespeichert?

In einem Docker-Volume auf Ihrem Server. An Dritte gehen nur die Prompts, die Sie an die jeweils verbundene Modell-API schicken.

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.