Ollama maakt van een lokaal model draaien een installatie van één regel. Dit is de handleiding; voor het eerlijke beeld van wat CPU-inferentie wel en niet kan (en de RAG-sweetspot), zie de VPS-voor-Ollama-use-case en Ollama zelf hosten.
1. Installeer Ollama
curl -fsSL https://ollama.com/install.sh | sh
Dat installeert Ollama en start het als systemd-service die luistert op localhost:11434.
2. Haal een klein model op en draai het
Op een CPU-machine begin je klein:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B-modellen zijn echt bruikbaar op CPU; 7–8B draaien op een paar tokens/sec (prima voor batch, pijnlijk voor chat); 13B+ gaan swappen en kruipen — niet doen.
3. Roep de HTTP-API aan
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings zijn de CPU-sweetspot:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Houd het op localhost — stel veilig bloot indien nodig
Ollama bindt standaard aan 127.0.0.1:11434. Laat het daar. Als je het vanaf een andere machine moet bereiken, zet er een reverse proxy met auth voor op een plan met dedicated IP (nginx-+-HTTPS-gids) of gebruik een SSH-tunnel — stel nooit een niet-geauthenticeerd model-endpoint publiek bloot.
Het eerlijke stuk
Dit zijn CPU-only-instances (geen GPU). Kleine gekwantiseerde modellen en embeddings draaien goed; grote niet. Combineer Ollama met een vector-DB voor een privé-RAG-stack — kleine lokale embeddings plus een lokale vectoropslag is de opzet die hier echt schittert. Medium ($12/mnd, 6 GB) is het comfortabele plan. Root in ongeveer een minuut, geen KYC, betalen in crypto.
Reacties
Nog geen reacties. Wees de eerste.