Ollama gör att köra en lokal modell blir en installation på en rad. Detta är guiden; för den ärliga bilden av vad CPU-inferens kan och inte kan (och RAG-sweetspotten), se användningsfallet VPS för Ollama och självhosta Ollama.
1. Installera Ollama
curl -fsSL https://ollama.com/install.sh | sh
Det installerar Ollama och startar den som en systemd-tjänst som lyssnar på localhost:11434.
2. Hämta och kör en liten modell
På en CPU-maskin, börja litet:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B-modeller är verkligen användbara på CPU; 7–8B kör på några tokens/sek (bra för batch, plågsamt för chatt); 13B+ kommer swappa och krypa — låt bli.
3. Anropa HTTP-API:et
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings är CPU:ns sweetspot:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Håll det på localhost — exponera säkert vid behov
Ollama binder till 127.0.0.1:11434 som standard. Låt det vara där. Om du behöver nå det från en annan maskin, sätt en reverse proxy med auth framför på ett plan med dedikerad IP (nginx + HTTPS-guide) eller använd en SSH-tunnel — exponera aldrig en oautentiserad modell-endpoint offentligt.
Den ärliga biten
Detta är instanser med enbart CPU (ingen GPU). Små kvantiserade modeller och embeddings kör bra; stora inte. Para Ollama med en vektor-DB för en privat RAG-stack — små lokala embeddings plus ett lokalt vektorlager är uppsättningen som verkligen glänser här. Medium ($12/mån, 6 GB) är det bekväma planet. Root på ungefär en minut, ingen KYC, betala i krypto.
Kommentarer
Inga kommentarer än. Bli först.