EQVPS

Hoe installeer je Ollama op een VPS (en roep je zijn API aan)

Installeer Ollama op een VPS, haal een klein model op en roep zijn HTTP-API aan — met de eerlijke opmerking dat dit CPU-machines zijn, dus houd het bij kleine gekwantiseerde modellen en embeddings. Copy-paste-commando's, en hoe je het veilig blootstelt.

Ollama maakt van een lokaal model draaien een installatie van één regel. Dit is de handleiding; voor het eerlijke beeld van wat CPU-inferentie wel en niet kan (en de RAG-sweetspot), zie de VPS-voor-Ollama-use-case en Ollama zelf hosten.

1. Installeer Ollama

curl -fsSL https://ollama.com/install.sh | sh

Dat installeert Ollama en start het als systemd-service die luistert op localhost:11434.

2. Haal een klein model op en draai het

Op een CPU-machine begin je klein:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B-modellen zijn echt bruikbaar op CPU; 7–8B draaien op een paar tokens/sec (prima voor batch, pijnlijk voor chat); 13B+ gaan swappen en kruipen — niet doen.

3. Roep de HTTP-API aan

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings zijn de CPU-sweetspot:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Houd het op localhost — stel veilig bloot indien nodig

Ollama bindt standaard aan 127.0.0.1:11434. Laat het daar. Als je het vanaf een andere machine moet bereiken, zet er een reverse proxy met auth voor op een plan met dedicated IP (nginx-+-HTTPS-gids) of gebruik een SSH-tunnel — stel nooit een niet-geauthenticeerd model-endpoint publiek bloot.

Het eerlijke stuk

Dit zijn CPU-only-instances (geen GPU). Kleine gekwantiseerde modellen en embeddings draaien goed; grote niet. Combineer Ollama met een vector-DB voor een privé-RAG-stack — kleine lokale embeddings plus een lokale vectoropslag is de opzet die hier echt schittert. Medium ($12/mnd, 6 GB) is het comfortabele plan. Root in ongeveer een minuut, geen KYC, betalen in crypto.

FAQ

Hoe installeer ik Ollama op een VPS?

Eén commando: curl -fsSL https://ollama.com/install.sh | sh. Doe dan ollama pull van een klein model en ollama run, of roep de HTTP-API aan op localhost:11434. De stappen staan hieronder. Op een CPU-VPS houd je het bij kleine gekwantiseerde modellen (1B–8B) en embeddings — grote modellen hebben een GPU nodig.

Zullen modellen snel zijn op een CPU-VPS?

Kleine wel, grote niet. Verwacht een paar tokens per seconde op een 7–8B-model bij 4-bit-kwantisatie, en echt vlotte prestaties op 1–3B-modellen en embedding-modellen. Prima voor achtergrondtaken, classificatie en RAG-pipelines — niet voor een snelle interactieve chat op een groot model.

Moet ik de Ollama-API blootstellen aan internet?

Nee. Houd hem op localhost:11434. Als je externe toegang nodig hebt, zet er een reverse proxy met authenticatie voor op een plan met dedicated IP, of bereik hem via een SSH-tunnel. Stel nooit een niet-geauthenticeerd model-endpoint bloot aan het open internet.

Welk plan heb ik nodig?

Onze Medium ($12/mnd, 6 GB) past comfortabel bij kleine modellen en embeddings; Small ($8) werkt om 1–3B-modellen te testen. Dit zijn CPU-only-instances — geen GPU — dus dimensioneer op de RAM-footprint van het model, niet in de hoop op snelheid.

Vragen jullie om een identiteitsbewijs of kaart?

Nee. Een e-mail om je aan te melden, betalen in USDC of USDT — geen documenten, geen kaart.

Reacties

Nog geen reacties. Wees de eerste.

Laat een reactie achter

Reacties worden gemodereerd voordat ze verschijnen.