Lad os være ærlige fra start: hvis du vil have hurtig, billig generering af høj kvalitet, så kald et API. En CPU-VPS vil ikke slå et datacenter fuldt af GPU'er, og enhver, der siger noget andet, sælger noget.
Så hvorfor overhovedet self-hoste inferens? Én grund, og den er god: modellen på din server sender aldrig dine prompts nogen steder hen.
Hvordan CPU-inferens faktisk ser ud
Du kan køre rigtige modeller på CPU med nok RAM. En 7–8B-model kvantiseret til 4-bit virker. En 13B virker. Du kan endda presse en 30B-klasse-model, hvis du har hukommelsen. Det, du ikke kan, er at gøre den hurtig — output kommer med et par tokens per sekund, ikke den øjeblikkelige strøm et API giver.
Det er den ærlige afvejning. Til interaktiv chat er det frustrerende. Til baggrundsarbejde — opsummering af dokumenter om natten, klassificering af en kø, berigelse af data efter en tidsplan — er et par tokens per sekund fuldstændig fint, og ingen holder øje med uret.
RAM-regnestykket
Modellen skal sidde i hukommelsen, kvantiseret eller ej, plus overhead til kontekst og runtime:
- 7–8B, 4-bit — omkring 6–8 GB. Kører på et mellemabonnement.
- 13B, 4-bit — cirka 10–16 GB.
- 30B-klasse, kvantiseret — 24–48 GB, afhængigt af kvantisering.
- Større, eller højere præcision — du er hurtigt oppe på 64–80 GB — og forbi 80 GB passer ingen enkelt Pro-boks, stadig CPU-langsomt.
Det er derfor, "kør en lokal model" stille bliver et højhukommelses-spørgsmål. Modellen er hukommelsesaftrykket. Læg et RAG-indeks eller agenter på samme boks, og tallene stabler sig.
Ollama kontra vLLM, kort
Ollama er den lette dør ind — installér, ollama run, færdig. Det er det rigtige værktøj til en privat enkeltbruger-opsætning, hvor du bare vil have modellen tilgængelig. vLLM er bygget til serverings-gennemløb: mere opsætning, bedre under samtidig belastning, det værd når du faktisk håndterer mængde. Start med Ollama; grib til vLLM, når du serverer rigtig trafik.
Hvor privacy-first genuint vinder
Argumentet for self-hostet inferens er ikke hastighed eller pris — det er, at nogle data ikke kan forlade huset. Juridiske dokumenter. Journaler. Proprietær kode. Alt hvor at sende prompten til et tredjeparts-API er udelukket af politik- eller tillidsgrunde. En langsommere model, der kører helt på din maskine, slår en hurtig, der logger alt, du sender den.
Og hvis dataene er så følsomme, bør betalingen sandsynligvis også være privat. At leje boksen med krypto og uden KYC holder hele kæden — server, model, prompts, fakturering — væk fra nogens identitetsregistre. Det er den faktiske pitch: ikke "billigere inferens", men "inferens ingen andre kan se".
Bundlinje
Til hastighed og kvalitet, brug et API — ingen skam i det. Self-host, når privatliv er kravet, og langsommere er acceptabelt. Dimensionér efter modellen plus dens kontekst plus alt andet, der deler boksen, og forvent ikke GPU-hastighed fra CPU.
Når modellen har brug for rigtig hukommelse, kører Pro-linjen 32 til 80 GB med en dedikeret IP og natlige backups — nok til at holde en seriøs kvantiseret model med plads til kontekst omkring den.
Kommentarer
Ingen kommentarer endnu. Vær den første.