EQVPS

Self-hosting af en lokal LLM på en VPS med Ollama — hvad der faktisk virker

14. jun. 2026 · 3 min. læsning · EQVPS Team

At sende hver prompt til en andens API er fint — indtil det ikke er. Måske er dataene følsomme, og du vil helst have, de aldrig forlader din server. Måske er du træt af rate limits, eller af at en modelversion ændrer sig under dine fødder, eller af en per-token-måler, der tikker, mens du eksperimenterer. På et tidspunkt holder "hvad nu hvis jeg bare kørte min egen?" op med at være et tankeeksperiment.

Ollama gør det genuint let. Det sværere spørgsmål er hvad der passer på en VPS — og her betyder det ærlige svar mere end hypen.

Hvad du faktisk kan køre på CPU

Ingen GPU? Så laver du CPU-inferens, og modelstørrelse er alt. Kvantisering (at presse vægtene ned til 4-bit) er, hvad der gør dette praktisk — du mister en splint af kvalitet og sparer en bunke hukommelse.

Grove tal, dem der betyder noget:

Hastighed, ærligt: på nogle få vCPU'er vil du se en håndfuld tokens per sekund. Helt fint til en chatbot eller en kodningsassistent, hvor du læser, mens den skriver. Ikke fint til batch-behandling af en million dokumenter — det er et GPU-job, og vi lader ikke som om andet. Vi tilbyder ikke GPU-instanser. Hvis dit projekt har brug for en 70B-model eller tungt gennemløb, er en CPU-VPS — vores eller nogen andens — det forkerte værktøj, og du bør vide det, før du bruger en cent.

Men en privat 7B, der svarer på dine spørgsmål og aldrig ringer hjem? Den kører komfortabelt på en 6 GB-boks.

Installationen — tre kommandoer

Start serveren op, SSH ind, og:

curl -fsSL https://ollama.com/install.sh | sh   # installerer Ollama
ollama run llama3.2:3b                            # trækker + kører en 3B-model

Det er det — du chatter i terminalen. For at bruge den fra din egen kode serverer Ollama allerede et HTTP-API på port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Én faldgrube værd at kende på forhånd: som standard binder det API til localhost. Behold det sådan, og tunnelér over SSH, ellers er det eksponeret mod internettet. Hvis du vil have det tilgængeligt, sæt det bag auth — efterlad ikke et åbent model-endpoint på en offentlig IP.

At vælge boksen

Match abonnementet til modellen, ikke omvendt:

Du vil køreRAM du har brug forFornuftigt abonnement
3B-model, let brug~3 GBSmall (4 GB)
7B-model, komfortabelt~5-6 GBMedium (6 GB)
Større / højt gennemløbGPU-territoriumikke en CPU-VPS

For de fleste self-hostere er Medium (6 GB) den ærlige anbefaling — nok hovedrum til en 7B-model plus din app og OS'et. Small (4 GB) virker, hvis du holder dig til 3B. Noget under det er for stramt, når OS'et og konteksten æder ind.

Hvorfor gøre det her

Hvis du self-hoster en LLM, er privatliv som regel halvdelen af grunden — så det ville være mærkeligt at aflevere dit ID for at leje boksen. Det behøver du ikke: du kan betale i USDC eller USDT (eller et kort via on-rampen), ingen KYC, og serveren er din på omkring et minut. Krypto-native, agent-venlig, og dataene forbliver på en maskine, du kontrollerer.

Afvejningen er den, vi har været ærlige om: kun CPU, et 6 GB-loft, små modeller. Inden for det er self-hosting fantastisk. Uden for det, lad ingen sælge dig en CPU-boks til et job, der har brug for en GPU.

Klar til at prøve? Vælg et abonnement, betal, og du vil have root på omkring 60 sekunder — så er det tre kommandoer til din egen private model.

FAQ

Kan jeg køre en LLM uden en GPU?

Ja, til små modeller. En 3B- eller 7B-model i 4-bit-kvantisering kører på CPU og svarer i et læsbart tempo — fint til en chatbot, en kodehjælper eller baggrundsopgaver, hvor du ikke stirrer på markøren. Hvad du ikke kan gøre på CPU er at servere en stor model (13B og op) eller presse højt gennemløb; det er der, en GPU holder op med at være valgfri.

Hvor meget RAM har jeg brug for til Llama 7B?

Omkring 5 GB til en 4-bit 7B-model, når du lægger kontekstvinduet og OS'et til — så en 6 GB-boks er det komfortable gulv. En 3B-model passer i omkring 3 GB. Mindre kvant (Q4) bytter lidt kvalitet for meget mindre hukommelse, hvilket er den rigtige byttehandel på en VPS.

Er self-hosting af en LLM billigere end et API?

Det afhænger af volumen. Et hostet API opkræver per token og koster intet, når det er inaktivt; en VPS er en fast månedlig regning, uanset om du bruger den eller ej. Hvis du kører en jævn strøm af forespørgsler, eller du hovedsageligt bekymrer dig om privatliv og ingen rate limits, vinder self-hosting. Til lejlighedsvise engangs-prompts er et målt API billigere.

Hvorfor self-hoste i stedet for at bruge et sky-API?

Tre grunde, folk faktisk gør det: dataene forlader aldrig din server (reelt for juridisk, medicinsk eller bare private noter), der er ingen rate limits eller per-token-måler, og modellen ændrer sig ikke eller bliver udfaset under dig. Omkostningen er, at du håndterer boksen og lever inden for dens hardware.

Hvad er den største model, jeg realistisk kan køre på en CPU-VPS?

En 7B-model i 4-bit er det søde punkt på en 6 GB-boks. Du kan teknisk indlæse en 13B med nok RAM, men på CPU bliver den langsom nok til, at du vil mærke det. Forbi det vil du have en GPU, hvilket er en anden slags vært.

← Tilbage til blogSe planer & priser →

Kommentarer

Ingen kommentarer endnu. Vær den første.

Skriv en kommentar

Kommentarer modereres, før de vises.