Bringen wir den enttäuschenden Teil aus dem Weg, denn das Internet ist voller Seiten, die das nicht tun.
Unsere Server sind nur CPU. Wir bieten keine GPUs an. Das bedeutet, lokale LLM-Arbeit hat hier eine harte Obergrenze, und etwas anderes vorzugeben würde nur dein Geld verschwenden.
Was tatsächlich auf CPU funktioniert
Mit bis zu 6 vCPU und 6 GB RAM (unser Medium-Plan — 12 $/Mon.) bist du im Bereich kleiner quantisierter Modelle:
- 1B–3B-Modelle (Q4): wirklich nutzbar. Schnell genug für Klassifizierung, Tagging, Routing und einfache strukturierte Extraktion.
- 7B–8B-Modelle (Q4): laufen, aber erwarte ein paar Tokens pro Sekunde. Gut für eine Warteschlange, die über Nacht Dokumente durchkaut. Schmerzhaft als Chat-Fenster.
- Embedding-Modelle: ausgezeichneter Sitz. Sie sind klein, schnell auf CPU, und das ist wahrscheinlich der einzelne beste Grund, Ollama auf einer Maschine wie unserer zu betreiben.
- 13B und aufwärts: lass es. Du wirst swappen und warten.
Wenn du einen schnellen, interaktiven 70B-Chat brauchst, brauchst du einen GPU-Host — das ist ein anderes Produkt von einem anderen Anbieter, und wir sagen es dir lieber, als deine 12 $ zu nehmen.
Wo eine CPU-Maschine wirklich gewinnt
Privatsphäre. Deine Dokumente, deine Prompts, deine Embeddings — verlassen nie eine Maschine, die du kontrollierst, werden nie jemandes Trainingsdaten. Für viele ist das der ganze Punkt, und ein paar Tokens pro Sekunde sind ein akzeptabler Tausch.
Kostenvorhersehbarkeit. Keine Pro-Token-Rechnung. Eine Pipeline, die fünfzigtausend Datensätze klassifiziert, kostet dasselbe wie eine, die fünfzig klassifiziert: 12 $.
Asynchrone Arbeit. Die meiste nützliche LLM-Arbeit ist kein Chat-Fenster. Es ist eine Warteschlange: fasse diese zusammen, tagge jene, embette diesen Korpus. Eine CPU-Maschine, die über Nacht einen Rückstand durchmahlt, ist darin perfekt gut.
Einrichtung
# Ubuntu 24.04 — Medium-Plan empfohlen
curl -fsSL https://ollama.com/install.sh | sh
# Beginne mit etwas Kleinem und sieh selbst
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — der Sweetspot für CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama bedient eine HTTP-API auf localhost:11434. Halte sie dort. Wenn du sie von anderswo erreichen musst, stell sie hinter einen Reverse-Proxy mit Authentifizierung auf einem Plan mit dedizierter IP — lege nie einen unauthentifizierten Modell-Endpunkt ins offene Internet.
Kombiniere sie mit einer Vektordatenbank (Qdrant oder pgvector in Docker) und du hast einen kompletten privaten RAG-Stack auf einer 12-$-Maschine. Diese Kombination — kleine lokale Embeddings, lokaler Vektorspeicher, externe API nur für den schweren Generierungsschritt — ist das Setup, das auf Hardware wie dieser tatsächlich Sinn ergibt.
Einen Plan wählen
| Nutzung | Plan | Preis |
|---|---|---|
| Embeddings, 1–3B-Modelle, RAG-Pipeline | Medium | 12 $/Mon. |
| Dasselbe, plus ein öffentlicher Endpunkt hinter Auth | Medium-IP | 20 $/Mon. |
| Nur kleine Modelle testen | Small | 8 $/Mon. |
Nur CPU, bis zu 6 vCPU und 6 GB RAM. NVMe-Speicher, ungemessener Traffic, Deutschland oder Finnland. Krypto-Zahlung, kein KYC. Jährliche Abrechnung ist ein Transfer statt zwölf.
Verwandte Lektüre
- Eine Vektor-DB für KI-Gedächtnis hosten — die andere Hälfte eines privaten RAG-Stacks
- VPS für KI-Agenten — Orchestrierung auf derselben Maschine
Bereit? Stelle einen Server bereit → — live in etwa einer Minute, in Krypto bezahlt, kein Ausweis nötig.
Kommentare
Noch keine Kommentare. Sei der Erste.