Att skicka varje prompt till någons API är fint — tills det inte är det. Kanske är datan känslig och du skulle hellre aldrig låta den lämna din server. Kanske är du trött på rate limits, eller på en modell-version som ändras under dina fötter, eller på en per-token-mätare som tickar medan du experimenterar. Vid någon punkt slutar "tänk om jag bara körde min egen?" vara ett tankeexperiment.
Ollama gör det genuint enkelt. Den svårare frågan är vad som ryms på en VPS — och här spelar det ärliga svaret större roll än hypen.
Vad du faktiskt kan köra på CPU
Ingen GPU? Då gör du CPU-inferens, och modellstorlek är allt. Kvantisering (att pressa ner vikterna till 4-bit) är vad som gör detta praktiskt — du förlorar en gnutta kvalitet och sparar en hög minne.
Grova siffror, de som spelar roll:
- 3B-modell, 4-bit — ~3 GB RAM. Snärtig nog för chatt och enkla uppgifter.
- 7B-modell, 4-bit — ~5 GB RAM. Sweet spot: märkbart smartare, körs fortfarande i ett läsbart tempo.
- 13B och uppåt — 8-10 GB+ och långsamt på CPU. Tekniskt möjligt, praktiskt irriterande.
Hastighet, ärligt: på ett par vCPU:er ser du en handfull tokens per sekund. Helt fint för en chatbot eller en coding-assistent där du läser medan den skriver. Inte fint för att batch-processa en miljon dokument — det är ett GPU-jobb, och vi låtsas inte annat. Vi erbjuder inga GPU-instanser. Om ditt plan behöver en 70B-modell eller tung throughput, är en CPU-VPS — vår eller någons — fel verktyg, och det bör du veta innan du spenderar ett öre.
Men en privat 7B som svarar på dina frågor och aldrig ringer hem? Den körs bekvämt på en 6 GB-box.
Installationen — tre kommandon
Starta servern, SSH:a in, och:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
Det är det — du chattar i terminalen. För att använda det från din egen kod serverar Ollama redan ett HTTP-API på port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
En gotcha värd att veta i förväg: som standard binder det API:et till localhost. Håll det så och tunnla över SSH, annars är det exponerat mot internet. Om du vill ha det nåbart, sätt det bakom auth — lämna inte en öppen model-endpoint på en publik IP.
Att välja boxen
Matcha planet till modellen, inte tvärtom:
| Du vill köra | RAM du behöver | Vettigt plan |
|---|---|---|
| 3B-modell, lätt användning | ~3 GB | Small (4 GB) |
| 7B-modell, bekvämt | ~5-6 GB | Medium (6 GB) |
| Större / hög throughput | GPU-territorium | inte en CPU-VPS |
För de flesta self-hosters är Medium (6 GB) den ärliga rekommendationen — tillräckligt utrymme för en 7B-modell plus din app och OS:et. Small (4 GB) fungerar om du håller dig till 3B. Något under det är för trångt när OS:et och kontext äter in.
Varför göra det här
Om du self-hostar en LLM är integritet oftast halva anledningen — så det vore konstigt att lämna över ditt ID för att hyra boxen. Det behöver du inte: du kan betala i USDC eller USDT (eller ett kort via on-rampen), ingen KYC, och servern är din på ungefär en minut. Krypto-native, agent-vänlig, och datan förblir på en maskin du kontrollerar.
Avvägningen är den vi har varit ärliga om: bara CPU, ett 6 GB-tak, små modeller. Inom det är self-hosting utmärkt. Utanför det, låt ingen sälja dig en CPU-box för ett jobb som behöver en GPU.
Redo att prova? Välj ett plan, betala, och du har root på ungefär 60 sekunder — sedan är det tre kommandon till din egen privata modell.
Kommentarer
Inga kommentarer än. Bli först.