Ollama gør det at køre en lokal model til en installation på én linje. Dette er guiden; for det ærlige billede af, hvad CPU-inferens kan og ikke kan (og RAG-sweetspottet), se brugsscenariet VPS til Ollama og self-host Ollama.
1. Installér Ollama
curl -fsSL https://ollama.com/install.sh | sh
Det installerer Ollama og starter det som en systemd-tjeneste, der lytter på localhost:11434.
2. Hent og kør en lille model
På en CPU-maskine, start småt:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B-modeller er virkelig brugbare på CPU; 7–8B kører på et par tokens/sek (fint til batch, smertefuldt til chat); 13B+ vil swappe og kravle — lad være.
3. Kald HTTP-API'et
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings er CPU'ens sweetspot:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Hold det på localhost — eksponér sikkert om nødvendigt
Ollama binder til 127.0.0.1:11434 som standard. Lad det blive der. Hvis du skal nå det fra en anden maskine, sæt en reverse proxy med auth foran på et plan med dedikeret IP (nginx + HTTPS-guide) eller brug en SSH-tunnel — eksponér aldrig et ikke-autentificeret model-endpoint offentligt.
Den ærlige del
Det er instanser med kun CPU (ingen GPU). Små kvantiserede modeller og embeddings kører godt; store gør ikke. Par Ollama med en vektor-DB til en privat RAG-stak — små lokale embeddings plus et lokalt vektorlager er opsætningen, der virkelig skinner her. Medium (12 $/md., 6 GB) er det behagelige plan. Root på cirka et minut, ingen KYC, betal i krypto.
Kommentarer
Ingen kommentarer endnu. Vær den første.