EQVPS

Sådan installerer du Ollama på en VPS (og kalder dens API)

Installér Ollama på en VPS, hent en lille model, og kald dens HTTP-API — med den ærlige note, at det er CPU-maskiner, så hold dig til små kvantiserede modeller og embeddings. Copy-paste-kommandoer, og hvordan du eksponerer det sikkert.

Ollama gør det at køre en lokal model til en installation på én linje. Dette er guiden; for det ærlige billede af, hvad CPU-inferens kan og ikke kan (og RAG-sweetspottet), se brugsscenariet VPS til Ollama og self-host Ollama.

1. Installér Ollama

curl -fsSL https://ollama.com/install.sh | sh

Det installerer Ollama og starter det som en systemd-tjeneste, der lytter på localhost:11434.

2. Hent og kør en lille model

På en CPU-maskine, start småt:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B-modeller er virkelig brugbare på CPU; 7–8B kører på et par tokens/sek (fint til batch, smertefuldt til chat); 13B+ vil swappe og kravle — lad være.

3. Kald HTTP-API'et

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings er CPU'ens sweetspot:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Hold det på localhost — eksponér sikkert om nødvendigt

Ollama binder til 127.0.0.1:11434 som standard. Lad det blive der. Hvis du skal nå det fra en anden maskine, sæt en reverse proxy med auth foran på et plan med dedikeret IP (nginx + HTTPS-guide) eller brug en SSH-tunnel — eksponér aldrig et ikke-autentificeret model-endpoint offentligt.

Den ærlige del

Det er instanser med kun CPU (ingen GPU). Små kvantiserede modeller og embeddings kører godt; store gør ikke. Par Ollama med en vektor-DB til en privat RAG-stak — små lokale embeddings plus et lokalt vektorlager er opsætningen, der virkelig skinner her. Medium (12 $/md., 6 GB) er det behagelige plan. Root på cirka et minut, ingen KYC, betal i krypto.

FAQ

Hvordan installerer jeg Ollama på en VPS?

Én kommando: curl -fsSL https://ollama.com/install.sh | sh. Så ollama pull en lille model og ollama run, eller kald HTTP-API'et på localhost:11434. Trinene er nedenfor. På en CPU-VPS hold dig til små kvantiserede modeller (1B–8B) og embeddings — store modeller kræver en GPU.

Vil modeller være hurtige på en CPU-VPS?

De små ja, de store nej. Forvent et par tokens i sekundet på en 7–8B-model ved 4-bit kvantisering, og virkelig kvik ydelse på 1–3B-modeller og embedding-modeller. Fremragende til baggrundsjobs, klassificering og RAG-pipelines — ikke til en hurtig interaktiv chat på en stor model.

Bør jeg eksponere Ollamas API mod internettet?

Nej. Hold det på localhost:11434. Hvis du har brug for fjernadgang, sæt en reverse proxy med autentificering foran på et plan med dedikeret IP, eller nå det via en SSH-tunnel. Eksponér aldrig et ikke-autentificeret model-endpoint mod det åbne internet.

Hvilket plan har jeg brug for?

Vores Medium (12 $/md., 6 GB) passer bekvemt til små modeller og embeddings; Small (8 $) virker til at teste 1–3B-modeller. Det er instanser med kun CPU — ingen GPU — så dimensionér efter modellens RAM-aftryk, ikke i håb om hastighed.

Beder I om ID eller kort?

Nej. En e-mail for at tilmelde dig, betaling i USDC eller USDT — ingen dokumenter, intet kort.

Kommentarer

Ingen kommentarer endnu. Vær den første.

Skriv en kommentar

Kommentarer modereres, før de vises.