Låt oss vara ärliga från början: om du vill ha snabb, billig, högkvalitativ generering, anropa ett API. En CPU-VPS kommer inte att slå ett datacenter fullt av GPU:er, och den som säger något annat säljer något.
Så varför self-hosta inferens överhuvudtaget? En anledning, och det är en bra: modellen på din server skickar aldrig dina prompter någonstans.
Hur CPU-inferens faktiskt ser ut
Du kan köra riktiga modeller på CPU med tillräckligt RAM. En 7–8B-modell kvantiserad till 4-bit fungerar. En 13B fungerar. Du kan till och med trycka en 30B-klass-modell om du har minnet. Vad du inte kan är att göra den snabb — output kommer med några tokens per sekund, inte den omedelbara strömmen ett API ger.
Det är den ärliga avvägningen. För interaktiv chatt är det frustrerande. För bakgrundsarbete — sammanfatta dokument över natten, klassificera en kö, berika data på schema — är några tokens per sekund helt okej, och ingen tittar på klockan.
RAM-matten
Modellen måste sitta i minnet, kvantiserad eller inte, plus overhead för kontext och runtime:
- 7–8B, 4-bit — runt 6–8 GB. Körs på ett mid-plan.
- 13B, 4-bit — grovt 10–16 GB.
- 30B-klass, kvantiserad — 24–48 GB, beroende på kvantisering.
- Större, eller högre precision — du är på 64–80 GB snabbt — och förbi 80 GB ryms ingen enskild Pro-box, fortfarande CPU-långsam.
Detta är varför "kör en lokal modell" tyst blir en high-memory-fråga. Modellen är minnes-footprinten. Lägg till ett RAG-index eller agenter på samma box och siffrorna staplas.
Ollama vs vLLM, kort
Ollama är den lätta dörren in — installera, ollama run, klart. Det är rätt verktyg för en privat single-user-setup där du bara vill ha modellen tillgänglig. vLLM är byggt för serving-throughput: mer setup, bättre under samtidig belastning, värt det när du faktiskt hanterar volym. Börja med Ollama; sträck dig efter vLLM när du serverar riktig trafik.
Var privacy-först genuint vinner
Argumentet för self-hosted inferens är inte hastighet eller kostnad — det är att viss data inte får lämna. Juridiska dokument. Journaler. Proprietär kod. Allt där det är uteslutet att skicka prompten till ett tredjeparts-API av policy- eller förtroendeskäl. En långsammare modell som körs helt på din maskin slår en snabb som loggar allt du skickar den.
Och om datan är så känslig bör betalningen förmodligen också vara privat. Att hyra boxen med krypto och no KYC håller hela kedjan — server, modell, prompter, fakturering — borta från allas identitetsregister. Det är den faktiska pitchen: inte "billigare inferens," utan "inferens ingen annan kan se."
Slutsats
För hastighet och kvalitet, använd ett API — ingen skam i det. Self-host när integritet är kravet och långsammare är acceptabelt. Dimensionera för modellen plus dess kontext plus allt annat som delar boxen, och förvänta dig inte GPU-hastighet från CPU.
När modellen behöver riktigt minne kör Pro-linjen 32 till 80 GB med en dedikerad IP och nattliga säkerhetskopior — tillräckligt för att hålla en seriös kvantiserad modell med utrymme för kontext runt den.
Kommentarer
Inga kommentarer än. Bli först.