−25%

sur Windows en paiement annuel, jusqu'au 31/10. Voir les offres

EQVPS

VPS pour Open WebUI : une interface de chat privée pour les LLM

Hébergez Open WebUI sur un VPS comme interface de chat privée pour toute API compatible OpenAI ou des modèles Ollama locaux : Docker, accès sécurisé, dimensionnement et compromis.

Vous utilisez trois fournisseurs de modèles différents, chacun avec sa fenêtre de chat, son abonnement et son historique. Open WebUI les réunit derrière une seule interface que vous hébergez : choisissez un modèle par conversation, gardez tout l'historique sur votre serveur, partagez-le avec votre équipe et branchez des modèles locaux quand rien ne doit quitter la machine.

Deux façons de l'utiliser

Comme interface pour des API. Open WebUI se connecte à toute API compatible OpenAI — fournisseurs hébergés, un proxy LiteLLM ou votre propre point d'accès. Le serveur ne fait presque rien ; une petite offre suffit largement.

Avec des modèles locaux. Ajoutez Ollama sur le même serveur et faites tourner des modèles ouverts en local. La RAM devient la contrainte, et l'inférence sur CPU est lente. Le compromis honnête : confidentialité totale, vitesse modeste.

ConfigurationOffre
Interface API, usage personnelMicro — 1 vCPU, 2 Go, $5/mois (tunnel SSH)
Interface API, accès équipe en HTTPSMicro-IP — 1 vCPU, 2 Go, $10/mois
Modèles locaux 3B via OllamaAI-Agent — 2 vCPU, 4 Go, $10/mois
Modèles locaux 7–8BMedium — 4 vCPU, 6 Go, $12/mois, ou offres Pro pour plus gros

Installation avec Docker

Sur un serveur avec Docker installé :

docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 \
  -v open-webui:/app/backend/data \
  ghcr.io/open-webui/open-webui:main

Le lier à 127.0.0.1 le garde hors d'Internet jusqu'à ce que vous décidiez comment l'exposer. Conversations, utilisateurs et réglages vivent dans le volume open-webui.

Y accéder en sécurité

Tunnel SSH — fonctionne sur toutes les offres, NAT compris :

ssh -p 22 -N -L 3000:127.0.0.1:3000 you@203.0.113.10

Ouvrez http://localhost:3000. Sur une offre NAT, utilisez votre port SSH personnel.

HTTPS sur votre domaine — pour une équipe sur une offre avec IP dédiée. Faites pointer un sous-domaine vers le serveur (guide) et relayez-le avec nginx, en-têtes WebSocket inclus :

location / {
    proxy_pass http://127.0.0.1:3000;
    proxy_set_header Host $host;
    proxy_set_header Upgrade $http_upgrade;
    proxy_set_header Connection upgrade;
    proxy_read_timeout 300s;
}

Puis lancez certbot --nginx -d chat.example.com. Le long délai de lecture compte : les modèles lents diffusent leurs réponses pendant des minutes.

Premiers pas à l'intérieur

  1. Inscrivez-vous tout de suite. Le premier compte devient administrateur. Ne laissez pas une installation neuve ouverte — quelqu'un d'autre pourrait se l'approprier.
  2. Fermez les inscriptions. Réglages d'administration → rôle par défaut des nouveaux utilisateurs en attente, ou désactivez l'inscription.
  3. Ajoutez une connexion. Réglages → Connexions → collez une URL de base d'API et une clé. Les modèles de ce fournisseur apparaissent dans le sélecteur.

Ajouter des modèles locaux

Installez Ollama sur l'hôte (notre guide), récupérez un petit modèle et lancez Open WebUI pour qu'il puisse l'atteindre :

ollama pull llama3.2:3b
docker rm -f open-webui
docker run -d --name open-webui --restart always \
  -p 127.0.0.1:3000:8080 --add-host=host.docker.internal:host-gateway \
  -e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
  -v open-webui:/app/backend/data ghcr.io/open-webui/open-webui:main

Le volume conserve vos conversations au redémarrage. Comptez quelques tokens par seconde sur CPU — bien pour des résumés et des notes privées, lent pour de longs textes. Pour une inférence locale plus sérieuse, voir VPS pour Ollama.

Bon à savoir

Limites et évolutions des offres dans la documentation des offres.

Prêt à déployer ? Payez en crypto, sans KYC — en ligne en une minute environ.

Déployer →

FAQ

Combien de RAM faut-il pour Open WebUI ?

Open WebUI lui-même tourne avec environ 1 Go. S'il ne parle qu'à des API distantes, une offre de 2 Go suffit. Ce sont les modèles locaux via Ollama qui demandent de la mémoire — 4 Go pour de petits modèles 3B, 6 Go ou plus pour des modèles 7–8B.

Puis-je faire tourner des modèles locaux sur un VPS sans GPU ?

Oui, avec des attentes réalistes. Les petits modèles quantifiés répondent sur CPU à quelques tokens par seconde. Ça convient aux tâches courtes et aux essais privés, pas à un chat réactif avec de longues réponses.

Puis-je l'utiliser sur une offre NAT ?

Oui, via un tunnel SSH sur votre port SSH personnel. Pour une adresse HTTPS publique que votre équipe ouvre dans un navigateur, il faut une offre avec IP dédiée.

Qui peut créer des comptes ?

Le premier compte inscrit devient administrateur. Ensuite, passez les nouvelles inscriptions en attente ou désactivez-les dans les réglages d'administration, sinon quiconque trouve l'URL peut créer un compte.

Où sont stockées mes conversations ?

Dans un volume Docker sur votre serveur. Rien ne part vers un tiers, sauf les prompts que vous envoyez à l'API de modèle que vous avez connectée.

Commentaires

Pas encore de commentaires. Soyez le premier.

Laisser un commentaire

Les commentaires sont modérés avant leur publication.