Låt oss få den tråkiga delen ur vägen, för internet är fullt av sidor som inte gör det.
Våra servrar är CPU-only. Vi erbjuder inga GPU:er. Det betyder att lokalt LLM-arbete här har ett hårt tak, och att låtsas annat skulle bara slösa dina pengar.
Vad som faktiskt fungerar på CPU
Med upp till 6 vCPU och 6 GB RAM (vårt Medium-plan — $12/mån) är du i intervallet för små kvantiserade modeller:
- 1B–3B-modeller (Q4): verkligt användbara. Snabba nog för klassificering, taggning, routing och enkel strukturerad extraktion.
- 7B–8B-modeller (Q4): kör, men förvänta dig ett par tokens i sekunden. Bra för en kö som tuggar igenom dokument över natten. Smärtsam som chattfönster.
- Embedding-modeller: utmärkt passform. De är små, snabba på CPU, och detta är förmodligen det enskilt bästa skälet att köra Ollama på en box som vår.
- 13B och uppåt: låt bli. Du kommer att swappa och vänta.
Om du behöver en snabb, interaktiv 70B-chatt behöver du en GPU-host — det är en annan produkt från en annan leverantör, och vi berättar det hellre än tar dina $12.
Var en CPU-box verkligen vinner
Integritet. Dina dokument, dina prompter, dina embeddings — lämnar aldrig en maskin du kontrollerar, blir aldrig någons träningsdata. För många är det hela poängen, och ett par tokens i sekunden är en acceptabel avvägning.
Kostnadsförutsägbarhet. Ingen räkning per token. En pipeline som klassificerar femtiotusen poster kostar samma som en som klassificerar femtio: $12.
Asynkront arbete. Det mesta användbara LLM-arbetet är inte ett chattfönster. Det är en kö: sammanfatta dessa, tagga de där, embedda detta korpus. En CPU-box som maler igenom en backlog över natten är perfekt bra på det.
Uppsättning
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama betjänar en HTTP-API på localhost:11434. Håll den där. Om du behöver nå den från annat håll, sätt den bakom en reverse proxy med autentisering på ett dedikerat-IP-plan — exponera aldrig en oautentiserad model-endpoint för det öppna internet.
Para ihop den med en vektordatabas (Qdrant eller pgvector i Docker) och du har en komplett privat RAG-stack på en $12-box. Den kombinationen — små lokala embeddings, lokal vektorlagring, externt API bara för det tunga genereringssteget — är uppsättningen som faktiskt är meningsfull på hårdvara som denna.
Att välja en plan
| Användning | Plan | Pris |
|---|---|---|
| Embeddings, 1–3B-modeller, RAG-pipeline | Medium | $12/mån |
| Samma, plus en publik endpoint bakom auth | Medium-IP | $20/mån |
| Bara testa små modeller | Small | $8/mån |
CPU-only, upp till 6 vCPU och 6 GB RAM. NVMe-lagring, omätt trafik, Tyskland eller Finland. Kryptobetalning, ingen KYC. Årlig fakturering är en överföring istället för tolv.
Relaterad läsning
- Hosta en vektor-DB för AI-minne — den andra halvan av en privat RAG-stack
- VPS för AI-agenter — orkestrering på samma box
Redo? Distribuera en server → — live på ungefär en minut, betald i krypto, inget ID krävs.
Kommentarer
Inga kommentarer än. Bli först.