−25%

op Windows bij jaarbetaling, tot 31/10. Naar de pakketten

EQVPS

VPS voor Open WebUI: een privé chatinterface voor LLM's

Host Open WebUI op een VPS als privé chatfrontend voor elke OpenAI-compatibele API of lokale Ollama-modellen: Docker-installatie, veilige toegang en de juiste omvang.

Je gebruikt drie verschillende modelaanbieders, elk met een eigen chatvenster, abonnement en geschiedenis. Open WebUI zet ze achter één interface die je zelf host: kies per gesprek een model, bewaar alle geschiedenis op je eigen server, deel het met je team en koppel lokale modellen als er niets de machine mag verlaten.

Twee manieren om het te draaien

Als frontend voor API's. Open WebUI koppelt met elke OpenAI-compatibele API — gehoste aanbieders, een LiteLLM-proxy of je eigen endpoint. De server doet bijna niets; een klein plan is ruim voldoende.

Met lokale modellen. Voeg Ollama toe op dezelfde server en draai modellen met open gewichten lokaal. Nu is RAM de beperking, en inferentie op de CPU is traag. De eerlijke afweging: volledige privacy, bescheiden snelheid.

OpzetPlan
API-frontend, persoonlijk gebruikMicro — 1 vCPU, 2 GB, $5/mnd (SSH-tunnel)
API-frontend, teamtoegang via HTTPSMicro-IP — 1 vCPU, 2 GB, $10/mnd
Lokale 3B-modellen via OllamaAI-Agent — 2 vCPU, 4 GB, $10/mnd
Lokale 7–8B-modellenMedium — 4 vCPU, 6 GB, $12/mnd, of Pro-plannen voor grotere

Installatie met Docker

Op een server met Docker geïnstalleerd:

docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Door te binden aan 127.0.0.1 blijft het van het publieke internet af tot jij besluit hoe je het openstelt. Chats, gebruikers en instellingen staan in het volume open-webui.

Veilig toegang krijgen

SSH-tunnel — werkt op elk plan, ook NAT:

ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10

Open http://localhost:3000. Gebruik op een NAT-plan je persoonlijke SSH-poort.

HTTPS op je domein — voor een team op een plan met dedicated IP. Laat een subdomein naar de server wijzen (handleiding) en proxy het met nginx, inclusief WebSocket-headers:

location / {
    proxy_pass http://127.0.0.1:3000;
    proxy_set_header Host $host;
    proxy_set_header Upgrade $http_upgrade;
    proxy_set_header Connection upgrade;
    proxy_read_timeout 300s;
}

Voer daarna certbot --nginx -d chat.example.com uit. De lange read-timeout doet ertoe: trage modellen streamen antwoorden minutenlang.

Eerste stappen binnen

  1. Registreer je meteen. Het eerste account wordt beheerder. Laat een verse installatie niet openbaar staan — iemand anders kan hem claimen.
  2. Sluit aanmeldingen. Beheerinstellingen → zet de standaardrol voor nieuwe gebruikers op 'in afwachting', of schakel registratie uit.
  3. Voeg een verbinding toe. Instellingen → Verbindingen → plak een basis-URL van de API en een sleutel. Modellen van die aanbieder verschijnen in de modelkiezer.

Lokale modellen toevoegen

Installeer Ollama op de host (onze handleiding), haal een klein model op en start Open WebUI zo dat het erbij kan:

ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main

Het volume bewaart je chats bij de herstart. Reken op een paar tokens per seconde op de CPU — prima voor samenvattingen en privénotities, traag voor lange teksten. Voor zwaardere lokale inferentie, zie VPS voor Ollama.

Goed om te weten

Planlimieten en upgrades staan in de documentatie over plannen.

Klaar om te implementeren? Betaal met crypto, geen KYC — live in ongeveer een minuut.

Nu implementeren →

FAQ

Hoeveel RAM heeft Open WebUI nodig?

Open WebUI zelf draait op ongeveer 1 GB. Praat het alleen met externe API's, dan is een plan met 2 GB genoeg. Lokale modellen via Ollama vragen het geheugen — 4 GB voor kleine 3B-modellen, 6 GB of meer voor 7–8B-modellen.

Kan ik lokale modellen draaien op een VPS zonder GPU?

Ja, met realistische verwachtingen. Kleine gekwantiseerde modellen antwoorden op de CPU met een paar tokens per seconde. Dat werkt voor korte taken en privé-experimenten, niet voor vlot chatten met lange antwoorden.

Kan ik het op een NAT-plan gebruiken?

Ja, via een SSH-tunnel op je persoonlijke SSH-poort. Voor een publiek HTTPS-adres dat je team in een browser opent, heb je een plan met dedicated IP nodig.

Wie kan accounts aanmaken?

Het eerste geregistreerde account wordt beheerder. Zet daarna nieuwe aanmeldingen op 'in afwachting' of schakel ze uit in de beheerinstellingen, anders kan iedereen die de URL vindt een account aanmaken.

Waar worden mijn gesprekken opgeslagen?

In een Docker-volume op je server. Er gaat niets naar derden, behalve de prompts die je naar de gekoppelde model-API stuurt.

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.