Lad os få den skuffende del af vejen, for internettet er fuldt af sider, der ikke gør det.
Vores servere er kun-CPU. Vi tilbyder ikke GPU'er. Det betyder, at lokalt LLM-arbejde her har et hårdt loft, og at lade som om andet ville bare spilde dine penge.
Hvad der faktisk virker på CPU
Med op til 6 vCPU og 6 GB RAM (vores Medium-plan — $12/md) er du i rækkevidden af små kvantiserede modeller:
- 1B–3B-modeller (Q4): genuint brugbare. Hurtige nok til klassificering, tagging, routing og simpel struktureret udtrækning.
- 7B–8B-modeller (Q4): kører, men forvent et par tokens i sekundet. Fint til en kø, der tygger gennem dokumenter natten over. Smertefuldt som et chatvindue.
- Embedding-modeller: fremragende pasform. De er små, hurtige på CPU, og dette er sandsynligvis den enkeltvis bedste grund til at køre Ollama på en boks som vores.
- 13B og op: lad være. Du vil swappe og vente.
Hvis du har brug for en hurtig, interaktiv 70B-chat, har du brug for en GPU-vært — det er et andet produkt fra en anden udbyder, og det vil vi hellere fortælle dig end tage dine $12.
Hvor en CPU-boks for alvor vinder
Privatliv. Dine dokumenter, dine prompts, dine embeddings — forlader aldrig en maskine, du kontrollerer, bliver aldrig nogens træningsdata. For mange mennesker er det hele pointen, og et par tokens i sekundet er en acceptabel handel.
Omkostningsforudsigelighed. Ingen per-token-regning. En pipeline, der klassificerer halvtreds tusinde poster, koster det samme som en, der klassificerer halvtreds: $12.
Async-arbejde. Det meste nyttige LLM-arbejde er ikke et chatvindue. Det er en kø: opsummér disse, tag de der, embed dette korpus. En CPU-boks, der maler gennem en backlog natten over, er helt god til det.
Opsætning
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama betjener et HTTP-API på localhost:11434. Hold det der. Hvis du har brug for at nå det andetsteds fra, så sæt det bag en reverse proxy med autentificering på en dedikeret-IP-plan — eksponer aldrig et uautentificeret model-endpoint til det åbne internet.
Kombinér det med en vektordatabase (Qdrant eller pgvector i Docker), og du har en komplet privat RAG-stak på én $12-boks. Den kombination — små lokale embeddings, lokalt vektor-store, eksternt API kun til det tunge genereringstrin — er opsætningen, der faktisk giver mening på hardware som denne.
At vælge en plan
| Brug | Plan | Pris |
|---|---|---|
| Embeddings, 1–3B-modeller, RAG-pipeline | Medium | $12/md |
| Samme, plus et offentligt endpoint bag auth | Medium-IP | $20/md |
| Bare test af små modeller | Small | $8/md |
Kun-CPU, op til 6 vCPU og 6 GB RAM. NVMe-lagring, unmetered trafik, Tyskland eller Finland. Kryptobetaling, ingen KYC. Årlig fakturering er én overførsel i stedet for tolv.
Relateret læsning
- Host en vektor-DB til AI-hukommelse — den anden halvdel af en privat RAG-stak
- VPS til AI-agenter — orkestrering på samme boks
Klar? Deploy en server → — live på cirka et minut, betalt i krypto, intet ID påkrævet.
Kommentarer
Ingen kommentarer endnu. Vær den første.