EQVPS

Hosta lokal LLM-inferens privat: vad en CPU-VPS kan och inte kan

9 aug. 2026 · 2 min läsning · EQVPS Team

Låt oss vara ärliga från början: om du vill ha snabb, billig, högkvalitativ generering, anropa ett API. En CPU-VPS kommer inte att slå ett datacenter fullt av GPU:er, och den som säger något annat säljer något.

Så varför self-hosta inferens överhuvudtaget? En anledning, och det är en bra: modellen på din server skickar aldrig dina prompter någonstans.

Hur CPU-inferens faktiskt ser ut

Du kan köra riktiga modeller på CPU med tillräckligt RAM. En 7–8B-modell kvantiserad till 4-bit fungerar. En 13B fungerar. Du kan till och med trycka en 30B-klass-modell om du har minnet. Vad du inte kan är att göra den snabb — output kommer med några tokens per sekund, inte den omedelbara strömmen ett API ger.

Det är den ärliga avvägningen. För interaktiv chatt är det frustrerande. För bakgrundsarbete — sammanfatta dokument över natten, klassificera en kö, berika data på schema — är några tokens per sekund helt okej, och ingen tittar på klockan.

RAM-matten

Modellen måste sitta i minnet, kvantiserad eller inte, plus overhead för kontext och runtime:

Detta är varför "kör en lokal modell" tyst blir en high-memory-fråga. Modellen är minnes-footprinten. Lägg till ett RAG-index eller agenter på samma box och siffrorna staplas.

Ollama vs vLLM, kort

Ollama är den lätta dörren in — installera, ollama run, klart. Det är rätt verktyg för en privat single-user-setup där du bara vill ha modellen tillgänglig. vLLM är byggt för serving-throughput: mer setup, bättre under samtidig belastning, värt det när du faktiskt hanterar volym. Börja med Ollama; sträck dig efter vLLM när du serverar riktig trafik.

Var privacy-först genuint vinner

Argumentet för self-hosted inferens är inte hastighet eller kostnad — det är att viss data inte får lämna. Juridiska dokument. Journaler. Proprietär kod. Allt där det är uteslutet att skicka prompten till ett tredjeparts-API av policy- eller förtroendeskäl. En långsammare modell som körs helt på din maskin slår en snabb som loggar allt du skickar den.

Och om datan är så känslig bör betalningen förmodligen också vara privat. Att hyra boxen med krypto och no KYC håller hela kedjan — server, modell, prompter, fakturering — borta från allas identitetsregister. Det är den faktiska pitchen: inte "billigare inferens," utan "inferens ingen annan kan se."

Slutsats

För hastighet och kvalitet, använd ett API — ingen skam i det. Self-host när integritet är kravet och långsammare är acceptabelt. Dimensionera för modellen plus dess kontext plus allt annat som delar boxen, och förvänta dig inte GPU-hastighet från CPU.

När modellen behöver riktigt minne kör Pro-linjen 32 till 80 GB med en dedikerad IP och nattliga säkerhetskopior — tillräckligt för att hålla en seriös kvantiserad modell med utrymme för kontext runt den.

FAQ

Kan jag köra en LLM utan en GPU?

Små kvantiserade modeller, ja — och långsamt. En 7–8B-modell kvantiserad till 4-bit körs på CPU med tillräckligt RAM, men du mäter output i några tokens per sekund, inte den snärtiga strömmen du får från ett API. Bra för batch-jobb och bakgrundsuppgifter, plågsamt för interaktiv chatt.

Hur mycket RAM för lokal inferens?

Modellen måste rymmas i minnet plus overhead. En 7–8B 4-bit-modell vill ha ~6–8 GB; 13B runt 10–16 GB; 30B-klass-modeller trycker 24–48 GB kvantiserat. Lägg till utrymme för kontext och allt annat på boxen. Detta är varför lokal inferens landar i high-memory-territorium snabbt.

Ollama eller vLLM?

Ollama är den enkla ingången — ett kommando, modell hämtad, körande. vLLM är för throughput och serving, mer setup, bättre under belastning. För en privat single-user-box är Ollama oftast rätt val; vLLM när du faktiskt serverar förfrågningar i volym.

Varför self-hosta inferens överhuvudtaget om det är långsammare?

Integritet. Dina prompter och outputs rör aldrig en leverantörs servrar eller loggar. För känslig data — juridisk, medicinsk, intern kod, allt du inte kan skicka till en tredje part — slår en långsammare privat modell en snabb som ser allt. Para ihop det med no-KYC krypto-betalning och hela kedjan förblir din.

← Tillbaka till bloggenSe planer & priser →

Kommentarer

Inga kommentarer än. Bli först.

Lämna en kommentar

Kommentarer modereras innan de visas.