EQVPS

Self-hosta en lokal LLM på en VPS med Ollama — vad som faktiskt fungerar

14 juni 2026 · 3 min läsning · EQVPS Team

Att skicka varje prompt till någons API är fint — tills det inte är det. Kanske är datan känslig och du skulle hellre aldrig låta den lämna din server. Kanske är du trött på rate limits, eller på en modell-version som ändras under dina fötter, eller på en per-token-mätare som tickar medan du experimenterar. Vid någon punkt slutar "tänk om jag bara körde min egen?" vara ett tankeexperiment.

Ollama gör det genuint enkelt. Den svårare frågan är vad som ryms på en VPS — och här spelar det ärliga svaret större roll än hypen.

Vad du faktiskt kan köra på CPU

Ingen GPU? Då gör du CPU-inferens, och modellstorlek är allt. Kvantisering (att pressa ner vikterna till 4-bit) är vad som gör detta praktiskt — du förlorar en gnutta kvalitet och sparar en hög minne.

Grova siffror, de som spelar roll:

Hastighet, ärligt: på ett par vCPU:er ser du en handfull tokens per sekund. Helt fint för en chatbot eller en coding-assistent där du läser medan den skriver. Inte fint för att batch-processa en miljon dokument — det är ett GPU-jobb, och vi låtsas inte annat. Vi erbjuder inga GPU-instanser. Om ditt plan behöver en 70B-modell eller tung throughput, är en CPU-VPS — vår eller någons — fel verktyg, och det bör du veta innan du spenderar ett öre.

Men en privat 7B som svarar på dina frågor och aldrig ringer hem? Den körs bekvämt på en 6 GB-box.

Installationen — tre kommandon

Starta servern, SSH:a in, och:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

Det är det — du chattar i terminalen. För att använda det från din egen kod serverar Ollama redan ett HTTP-API på port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

En gotcha värd att veta i förväg: som standard binder det API:et till localhost. Håll det så och tunnla över SSH, annars är det exponerat mot internet. Om du vill ha det nåbart, sätt det bakom auth — lämna inte en öppen model-endpoint på en publik IP.

Att välja boxen

Matcha planet till modellen, inte tvärtom:

Du vill köraRAM du behöverVettigt plan
3B-modell, lätt användning~3 GBSmall (4 GB)
7B-modell, bekvämt~5-6 GBMedium (6 GB)
Större / hög throughputGPU-territoriuminte en CPU-VPS

För de flesta self-hosters är Medium (6 GB) den ärliga rekommendationen — tillräckligt utrymme för en 7B-modell plus din app och OS:et. Small (4 GB) fungerar om du håller dig till 3B. Något under det är för trångt när OS:et och kontext äter in.

Varför göra det här

Om du self-hostar en LLM är integritet oftast halva anledningen — så det vore konstigt att lämna över ditt ID för att hyra boxen. Det behöver du inte: du kan betala i USDC eller USDT (eller ett kort via on-rampen), ingen KYC, och servern är din på ungefär en minut. Krypto-native, agent-vänlig, och datan förblir på en maskin du kontrollerar.

Avvägningen är den vi har varit ärliga om: bara CPU, ett 6 GB-tak, små modeller. Inom det är self-hosting utmärkt. Utanför det, låt ingen sälja dig en CPU-box för ett jobb som behöver en GPU.

Redo att prova? Välj ett plan, betala, och du har root på ungefär 60 sekunder — sedan är det tre kommandon till din egen privata modell.

FAQ

Kan jag köra en LLM utan en GPU?

Ja, för små modeller. En 3B- eller 7B-modell i 4-bit kvantisering körs på CPU och svarar i ett läsbart tempo — fint för en chatbot, en coding-helper, eller bakgrundsuppgifter där du inte tittar på markören. Vad du inte kan på CPU är att servera en stor modell (13B och uppåt) eller pusha hög throughput; där slutar en GPU vara valfri.

Hur mycket RAM behöver jag för Llama 7B?

Runt 5 GB för en 4-bit 7B-modell när du lägger till kontextfönstret och OS:et — så en 6 GB-box är det bekväma golvet. En 3B-modell ryms i ungefär 3 GB. Mindre quant (Q4) byter lite kvalitet mot mycket mindre minne, vilket är rätt byte på en VPS.

Är att self-hosta en LLM billigare än ett API?

Det beror på volym. Ett hostat API tar betalt per token och kostar inget vid inaktivitet; en VPS är en platt månadsräkning oavsett om du använder den eller inte. Om du kör en stadig ström av förfrågningar, eller du främst bryr dig om integritet och inga rate limits, vinner self-hosting. För enstaka one-off-prompter är ett mätt API billigare.

Varför self-hosta istället för att använda ett cloud-API?

Tre skäl folk faktiskt gör det: datan lämnar aldrig din server (verkligt för juridisk, medicinsk, eller bara privata anteckningar), det finns inga rate limits eller per-token-mätare, och modellen ändras inte eller blir inte föråldrad under dig. Kostnaden är att du hanterar boxen och lever inom dess hårdvara.

Vad är den största modellen jag realistiskt kan köra på en CPU-VPS?

En 7B-modell i 4-bit är sweet spot på en 6 GB-box. Du kan tekniskt ladda en 13B med tillräckligt RAM, men på CPU blir det långsamt nog att du känner det. Därutöver vill du ha en GPU, vilket är en annan sorts värd.

← Tillbaka till bloggenSe planer & priser →

Kommentarer

Inga kommentarer än. Bli först.

Lämna en kommentar

Kommentarer modereras innan de visas.