EQVPS

Wie man Ollama auf einem VPS installiert (und seine API aufruft)

Installiere Ollama auf einem VPS, hole ein kleines Modell und rufe seine HTTP-API auf — mit dem ehrlichen Hinweis, dass dies CPU-Maschinen sind, also bleib bei kleinen quantisierten Modellen und Embeddings. Copy-paste-Befehle und wie man es sicher freigibt.

Ollama macht das Ausführen eines lokalen Modells zu einer Ein-Zeilen-Installation. Das ist die Anleitung; für das ehrliche Bild, was CPU-Inferenz kann und nicht kann (und den RAG-Sweetspot), siehe den Anwendungsfall VPS für Ollama und Ollama selbst hosten.

1. Ollama installieren

curl -fsSL https://ollama.com/install.sh | sh

Das installiert Ollama und startet es als systemd-Dienst, der auf localhost:11434 lauscht.

2. Ein kleines Modell holen und ausführen

Auf einer CPU-Maschine fang klein an:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B-Modelle sind auf CPU wirklich nutzbar; 7–8B laufen mit ein paar Token/Sek (okay für Batch, quälend für Chat); 13B+ swappen und kriechen — lass es.

3. Die HTTP-API aufrufen

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings sind der CPU-Sweetspot:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Auf localhost halten — bei Bedarf sicher freigeben

Ollama bindet standardmäßig an 127.0.0.1:11434. Lass es dort. Wenn du es von einer anderen Maschine erreichen musst, setze einen Reverse Proxy mit Auth davor auf einem Tarif mit dedizierter IP (nginx-+-HTTPS-Anleitung) oder nutze einen SSH-Tunnel — gib niemals einen nicht authentifizierten Modell-Endpunkt öffentlich frei.

Der ehrliche Teil

Das sind reine CPU-Instanzen (keine GPU). Kleine quantisierte Modelle und Embeddings laufen gut; große nicht. Kombiniere Ollama mit einer Vektor-DB für einen privaten RAG-Stack — kleine lokale Embeddings plus ein lokaler Vektorspeicher ist das Setup, das hier wirklich glänzt. Medium ($12/Monat, 6 GB) ist der bequeme Tarif. Root in etwa einer Minute, kein KYC, Zahlung in Krypto.

FAQ

Wie installiere ich Ollama auf einem VPS?

Ein Befehl: curl -fsSL https://ollama.com/install.sh | sh. Dann ollama pull ein kleines Modell und ollama run es, oder rufe die HTTP-API auf localhost:11434 auf. Die Schritte stehen unten. Auf einem CPU-VPS bleib bei kleinen quantisierten Modellen (1B–8B) und Embeddings — große Modelle brauchen eine GPU.

Werden Modelle auf einem CPU-VPS schnell sein?

Kleine ja, große nein. Erwarte ein paar Token pro Sekunde bei einem 7–8B-Modell mit 4-Bit-Quantisierung und wirklich flotte Leistung bei 1–3B-Modellen und Embedding-Modellen. Ideal für Hintergrundjobs, Klassifikation und RAG-Pipelines — nicht für einen schnellen interaktiven Chat auf einem großen Modell.

Sollte ich die Ollama-API ins Internet freigeben?

Nein. Halte sie auf localhost:11434. Wenn du Fernzugriff brauchst, setze sie hinter einen Reverse Proxy mit Authentifizierung auf einem Tarif mit dedizierter IP, oder erreiche sie über einen SSH-Tunnel. Gib niemals einen nicht authentifizierten Modell-Endpunkt ins offene Internet frei.

Welchen Tarif brauche ich?

Unser Medium ($12/Monat, 6 GB) passt bequem zu kleinen Modellen und Embeddings; Small ($8) reicht zum Testen von 1–3B-Modellen. Das sind reine CPU-Instanzen — keine GPU — dimensioniere also nach dem RAM-Bedarf des Modells, nicht in der Hoffnung auf Geschwindigkeit.

Verlangt ihr Ausweis oder Karte?

Nein. E-Mail zum Registrieren, Zahlung in USDC oder USDT — keine Dokumente, keine Karte.

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.