At sende hver prompt til en andens API er fint — indtil det ikke er. Måske er dataene følsomme, og du vil helst have, de aldrig forlader din server. Måske er du træt af rate limits, eller af at en modelversion ændrer sig under dine fødder, eller af en per-token-måler, der tikker, mens du eksperimenterer. På et tidspunkt holder "hvad nu hvis jeg bare kørte min egen?" op med at være et tankeeksperiment.
Ollama gør det genuint let. Det sværere spørgsmål er hvad der passer på en VPS — og her betyder det ærlige svar mere end hypen.
Hvad du faktisk kan køre på CPU
Ingen GPU? Så laver du CPU-inferens, og modelstørrelse er alt. Kvantisering (at presse vægtene ned til 4-bit) er, hvad der gør dette praktisk — du mister en splint af kvalitet og sparer en bunke hukommelse.
Grove tal, dem der betyder noget:
- 3B-model, 4-bit — ~3 GB RAM. Frisk nok til chat og simple opgaver.
- 7B-model, 4-bit — ~5 GB RAM. Det søde punkt: mærkbart klogere, kører stadig i et læsbart tempo.
- 13B og op — 8-10 GB+ og langsomt på CPU. Teknisk muligt, praktisk irriterende.
Hastighed, ærligt: på nogle få vCPU'er vil du se en håndfuld tokens per sekund. Helt fint til en chatbot eller en kodningsassistent, hvor du læser, mens den skriver. Ikke fint til batch-behandling af en million dokumenter — det er et GPU-job, og vi lader ikke som om andet. Vi tilbyder ikke GPU-instanser. Hvis dit projekt har brug for en 70B-model eller tungt gennemløb, er en CPU-VPS — vores eller nogen andens — det forkerte værktøj, og du bør vide det, før du bruger en cent.
Men en privat 7B, der svarer på dine spørgsmål og aldrig ringer hjem? Den kører komfortabelt på en 6 GB-boks.
Installationen — tre kommandoer
Start serveren op, SSH ind, og:
curl -fsSL https://ollama.com/install.sh | sh # installerer Ollama
ollama run llama3.2:3b # trækker + kører en 3B-model
Det er det — du chatter i terminalen. For at bruge den fra din egen kode serverer Ollama allerede et HTTP-API på port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Én faldgrube værd at kende på forhånd: som standard binder det API til localhost. Behold det sådan, og tunnelér over SSH, ellers er det eksponeret mod internettet. Hvis du vil have det tilgængeligt, sæt det bag auth — efterlad ikke et åbent model-endpoint på en offentlig IP.
At vælge boksen
Match abonnementet til modellen, ikke omvendt:
| Du vil køre | RAM du har brug for | Fornuftigt abonnement |
|---|---|---|
| 3B-model, let brug | ~3 GB | Small (4 GB) |
| 7B-model, komfortabelt | ~5-6 GB | Medium (6 GB) |
| Større / højt gennemløb | GPU-territorium | ikke en CPU-VPS |
For de fleste self-hostere er Medium (6 GB) den ærlige anbefaling — nok hovedrum til en 7B-model plus din app og OS'et. Small (4 GB) virker, hvis du holder dig til 3B. Noget under det er for stramt, når OS'et og konteksten æder ind.
Hvorfor gøre det her
Hvis du self-hoster en LLM, er privatliv som regel halvdelen af grunden — så det ville være mærkeligt at aflevere dit ID for at leje boksen. Det behøver du ikke: du kan betale i USDC eller USDT (eller et kort via on-rampen), ingen KYC, og serveren er din på omkring et minut. Krypto-native, agent-venlig, og dataene forbliver på en maskine, du kontrollerer.
Afvejningen er den, vi har været ærlige om: kun CPU, et 6 GB-loft, små modeller. Inden for det er self-hosting fantastisk. Uden for det, lad ingen sælge dig en CPU-boks til et job, der har brug for en GPU.
Klar til at prøve? Vælg et abonnement, betal, og du vil have root på omkring 60 sekunder — så er det tre kommandoer til din egen private model.
Kommentarer
Ingen kommentarer endnu. Vær den første.