Ollama macht das Ausführen eines lokalen Modells zu einer Ein-Zeilen-Installation. Das ist die Anleitung; für das ehrliche Bild, was CPU-Inferenz kann und nicht kann (und den RAG-Sweetspot), siehe den Anwendungsfall VPS für Ollama und Ollama selbst hosten.
1. Ollama installieren
curl -fsSL https://ollama.com/install.sh | sh
Das installiert Ollama und startet es als systemd-Dienst, der auf localhost:11434 lauscht.
2. Ein kleines Modell holen und ausführen
Auf einer CPU-Maschine fang klein an:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B-Modelle sind auf CPU wirklich nutzbar; 7–8B laufen mit ein paar Token/Sek (okay für Batch, quälend für Chat); 13B+ swappen und kriechen — lass es.
3. Die HTTP-API aufrufen
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings sind der CPU-Sweetspot:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Auf localhost halten — bei Bedarf sicher freigeben
Ollama bindet standardmäßig an 127.0.0.1:11434. Lass es dort. Wenn du es von einer anderen Maschine erreichen musst, setze einen Reverse Proxy mit Auth davor auf einem Tarif mit dedizierter IP (nginx-+-HTTPS-Anleitung) oder nutze einen SSH-Tunnel — gib niemals einen nicht authentifizierten Modell-Endpunkt öffentlich frei.
Der ehrliche Teil
Das sind reine CPU-Instanzen (keine GPU). Kleine quantisierte Modelle und Embeddings laufen gut; große nicht. Kombiniere Ollama mit einer Vektor-DB für einen privaten RAG-Stack — kleine lokale Embeddings plus ein lokaler Vektorspeicher ist das Setup, das hier wirklich glänzt. Medium ($12/Monat, 6 GB) ist der bequeme Tarif. Root in etwa einer Minute, kein KYC, Zahlung in Krypto.
Kommentare
Noch keine Kommentare. Sei der Erste.