EQVPS

Hosting af lokal LLM-inferens privat: hvad en CPU-VPS kan og ikke kan

9. aug. 2026 · 3 min. læsning · EQVPS Team

Lad os være ærlige fra start: hvis du vil have hurtig, billig generering af høj kvalitet, så kald et API. En CPU-VPS vil ikke slå et datacenter fuldt af GPU'er, og enhver, der siger noget andet, sælger noget.

Så hvorfor overhovedet self-hoste inferens? Én grund, og den er god: modellen på din server sender aldrig dine prompts nogen steder hen.

Hvordan CPU-inferens faktisk ser ud

Du kan køre rigtige modeller på CPU med nok RAM. En 7–8B-model kvantiseret til 4-bit virker. En 13B virker. Du kan endda presse en 30B-klasse-model, hvis du har hukommelsen. Det, du ikke kan, er at gøre den hurtig — output kommer med et par tokens per sekund, ikke den øjeblikkelige strøm et API giver.

Det er den ærlige afvejning. Til interaktiv chat er det frustrerende. Til baggrundsarbejde — opsummering af dokumenter om natten, klassificering af en kø, berigelse af data efter en tidsplan — er et par tokens per sekund fuldstændig fint, og ingen holder øje med uret.

RAM-regnestykket

Modellen skal sidde i hukommelsen, kvantiseret eller ej, plus overhead til kontekst og runtime:

Det er derfor, "kør en lokal model" stille bliver et højhukommelses-spørgsmål. Modellen er hukommelsesaftrykket. Læg et RAG-indeks eller agenter på samme boks, og tallene stabler sig.

Ollama kontra vLLM, kort

Ollama er den lette dør ind — installér, ollama run, færdig. Det er det rigtige værktøj til en privat enkeltbruger-opsætning, hvor du bare vil have modellen tilgængelig. vLLM er bygget til serverings-gennemløb: mere opsætning, bedre under samtidig belastning, det værd når du faktisk håndterer mængde. Start med Ollama; grib til vLLM, når du serverer rigtig trafik.

Hvor privacy-first genuint vinder

Argumentet for self-hostet inferens er ikke hastighed eller pris — det er, at nogle data ikke kan forlade huset. Juridiske dokumenter. Journaler. Proprietær kode. Alt hvor at sende prompten til et tredjeparts-API er udelukket af politik- eller tillidsgrunde. En langsommere model, der kører helt på din maskine, slår en hurtig, der logger alt, du sender den.

Og hvis dataene er så følsomme, bør betalingen sandsynligvis også være privat. At leje boksen med krypto og uden KYC holder hele kæden — server, model, prompts, fakturering — væk fra nogens identitetsregistre. Det er den faktiske pitch: ikke "billigere inferens", men "inferens ingen andre kan se".

Bundlinje

Til hastighed og kvalitet, brug et API — ingen skam i det. Self-host, når privatliv er kravet, og langsommere er acceptabelt. Dimensionér efter modellen plus dens kontekst plus alt andet, der deler boksen, og forvent ikke GPU-hastighed fra CPU.

Når modellen har brug for rigtig hukommelse, kører Pro-linjen 32 til 80 GB med en dedikeret IP og natlige backups — nok til at holde en seriøs kvantiseret model med plads til kontekst omkring den.

FAQ

Kan jeg køre en LLM uden en GPU?

Små kvantiserede modeller, ja — og langsomt. En 7–8B-model kvantiseret til 4-bit kører på CPU med nok RAM, men du måler output i et par tokens per sekund, ikke den friske strøm du får fra et API. Fint til batch-job og baggrundsopgaver, smertefuldt til interaktiv chat.

Hvor meget RAM til lokal inferens?

Modellen skal passe i hukommelsen plus overhead. En 7–8B 4-bit-model vil have ~6–8 GB; 13B omkring 10–16 GB; 30B-klasse-modeller presser 24–48 GB kvantiseret. Læg plads til kontekst og alt andet på boksen. Det er derfor, lokal inferens hurtigt lander i højhukommelses-terræn.

Ollama eller vLLM?

Ollama er den lette indgang — én kommando, model hentet, kørende. vLLM er til gennemløb og servering, mere opsætning, bedre under belastning. Til en privat enkeltbruger-boks er Ollama som regel det rigtige valg; vLLM når du faktisk serverer forespørgsler i mængde.

Hvorfor overhovedet self-hoste inferens, hvis det er langsommere?

Privatliv. Dine prompts og outputs rører aldrig en udbyders servere eller logs. Til følsomme data — juridisk, medicinsk, intern kode, alt du ikke kan sende til tredjepart — slår en langsommere privat model en hurtig, der ser alt. Parr den med no-KYC-kryptobetaling, og hele kæden forbliver din.

← Tilbage til blogSe planer & priser →

Kommentarer

Ingen kommentarer endnu. Vær den første.

Skriv en kommentar

Kommentarer modereres, før de vises.