EQVPS

Hur man installerar Ollama på en VPS (och anropar dess API)

Installera Ollama på en VPS, hämta en liten modell och anropa dess HTTP-API — med den ärliga noteringen att detta är CPU-maskiner, så håll dig till små kvantiserade modeller och embeddings. Kopiera-och-klistra-kommandon, och hur du exponerar det säkert.

Ollama gör att köra en lokal modell blir en installation på en rad. Detta är guiden; för den ärliga bilden av vad CPU-inferens kan och inte kan (och RAG-sweetspotten), se användningsfallet VPS för Ollama och självhosta Ollama.

1. Installera Ollama

curl -fsSL https://ollama.com/install.sh | sh

Det installerar Ollama och startar den som en systemd-tjänst som lyssnar på localhost:11434.

2. Hämta och kör en liten modell

På en CPU-maskin, börja litet:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B-modeller är verkligen användbara på CPU; 7–8B kör på några tokens/sek (bra för batch, plågsamt för chatt); 13B+ kommer swappa och krypa — låt bli.

3. Anropa HTTP-API:et

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings är CPU:ns sweetspot:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Håll det på localhost — exponera säkert vid behov

Ollama binder till 127.0.0.1:11434 som standard. Låt det vara där. Om du behöver nå det från en annan maskin, sätt en reverse proxy med auth framför på ett plan med dedikerad IP (nginx + HTTPS-guide) eller använd en SSH-tunnel — exponera aldrig en oautentiserad modell-endpoint offentligt.

Den ärliga biten

Detta är instanser med enbart CPU (ingen GPU). Små kvantiserade modeller och embeddings kör bra; stora inte. Para Ollama med en vektor-DB för en privat RAG-stack — små lokala embeddings plus ett lokalt vektorlager är uppsättningen som verkligen glänser här. Medium ($12/mån, 6 GB) är det bekväma planet. Root på ungefär en minut, ingen KYC, betala i krypto.

FAQ

Hur installerar jag Ollama på en VPS?

Ett kommando: curl -fsSL https://ollama.com/install.sh | sh. Kör sedan ollama pull av en liten modell och ollama run, eller anropa HTTP-API:et på localhost:11434. Stegen finns nedan. På en CPU-VPS håll dig till små kvantiserade modeller (1B–8B) och embeddings — stora modeller kräver en GPU.

Kommer modeller att vara snabba på en CPU-VPS?

Små ja, stora nej. Räkna med några tokens per sekund på en 7–8B-modell med 4-bitars kvantisering, och riktigt kvick prestanda på 1–3B-modeller och embedding-modeller. Utmärkt för bakgrundsjobb, klassificering och RAG-pipelines — inte för en snabb interaktiv chatt på en stor modell.

Bör jag exponera Ollamas API mot internet?

Nej. Håll det på localhost:11434. Om du behöver fjärråtkomst, sätt en reverse proxy med autentisering framför på ett plan med dedikerad IP, eller nå det via en SSH-tunnel. Exponera aldrig en oautentiserad modell-endpoint mot det öppna internet.

Vilket plan behöver jag?

Vår Medium ($12/mån, 6 GB) passar bekvämt små modeller och embeddings; Small ($8) fungerar för att testa 1–3B-modeller. Detta är instanser med enbart CPU — ingen GPU — så dimensionera efter modellens RAM-avtryck, inte i hopp om fart.

Kräver ni ID eller kort?

Nej. En e-post för att registrera dig, betalning i USDC eller USDT — inga dokument, inget kort.

Kommentarer

Inga kommentarer än. Bli först.

Lämna en kommentar

Kommentarer modereras innan de visas.