EQVPS
Anza

Jinsi ya kusakinisha Ollama kwenye VPS (na kuita API yake)

Sakinisha Ollama kwenye VPS, vuta modeli ndogo, na uite API yake ya HTTP — na dokezo la ukweli kwamba hizi ni mashine za CPU, hivyo shikilia modeli ndogo zilizopimwa na embeddings. Amri za kunakili-bandika, na jinsi ya kuiweka wazi kwa usalama.

Ollama hufanya kuendesha modeli ya ndani kuwa usakinishaji wa mstari mmoja. Huu ni mwongozo; kwa picha ya kweli ya kile ambacho utambuzi wa CPU unaweza na hauwezi kufanya (na mahali pazuri pa RAG), angalia matumizi ya VPS kwa Ollama na jipangishie Ollama.

1. Sakinisha Ollama

curl -fsSL https://ollama.com/install.sh | sh

Hilo husakinisha Ollama na kuianzisha kama huduma ya systemd inayosikiliza kwenye localhost:11434.

2. Vuta na uendeshe modeli ndogo

Kwenye mashine ya CPU, anza ndogo:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Modeli za 3B zinatumika kweli kwenye CPU; 7–8B huendesha kwa tokeni chache/sekunde (sawa kwa kundi, chungu kwa gumzo); 13B+ zitafanya swap na kutambaa — usifanye.

3. Ita API ya HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings ndio mahali pazuri pa CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Iweke kwenye localhost — iweke wazi kwa usalama ikihitajika

Ollama hufungamana na 127.0.0.1:11434 kwa chaguo-msingi. Iache hapo. Ukihitaji kuifikia kutoka mashine nyingine, weka reverse proxy yenye uthibitishaji mbele yake kwenye mpango wa IP maalum (mwongozo wa nginx + HTTPS) au tumia handaki ya SSH — kamwe usiweke wazi hadharani mwisho wa modeli usio na uthibitishaji.

Sehemu ya ukweli

Hizi ni nakala za CPU pekee (hakuna GPU). Modeli ndogo zilizopimwa na embeddings huendesha vizuri; kubwa hazifanyi. Unganisha Ollama na hifadhidata ya vekta kwa rafu ya RAG ya faragha — embeddings ndogo za ndani pamoja na hifadhi ya vekta ya ndani ndio usanidi unaong'aa kweli hapa. Medium ($12/mwezi, 6 GB) ndio mpango wa raha. Root kwa takribani dakika moja, bila KYC, malipo kwa crypto.

Maswali

Nasakinishaje Ollama kwenye VPS?

Amri moja: curl -fsSL https://ollama.com/install.sh | sh. Kisha ollama pull modeli ndogo na ollama run, au uite API ya HTTP kwenye localhost:11434. Hatua ziko chini. Kwenye VPS ya CPU shikilia modeli ndogo zilizopimwa (1B–8B) na embeddings — modeli kubwa zinahitaji GPU.

Je, modeli zitakuwa haraka kwenye VPS ya CPU?

Ndogo ndiyo, kubwa hapana. Tarajia tokeni chache kwa sekunde kwenye modeli ya 7–8B kwa upimaji wa biti 4, na utendaji wa haraka kweli kwenye modeli za 1–3B na modeli za embedding. Bora kwa kazi za nyuma, uainishaji na mabomba ya RAG — si kwa gumzo la mwingiliano wa haraka kwenye modeli kubwa.

Je, niweke wazi API ya Ollama kwenye intaneti?

Hapana. Iweke kwenye localhost:11434. Ukihitaji ufikiaji wa mbali, iweke nyuma ya reverse proxy yenye uthibitishaji kwenye mpango wa IP maalum, au ifikie kupitia handaki ya SSH. Kamwe usiweke wazi mwisho wa modeli usio na uthibitishaji kwenye intaneti wazi.

Ninahitaji mpango gani?

Medium yetu ($12/mwezi, 6 GB) inafaa kwa raha modeli ndogo na embeddings; Small ($8) inafanya kazi kwa kupima modeli za 1–3B. Hizi ni nakala za CPU pekee — hakuna GPU — hivyo pima kwa alama ya RAM ya modeli, si kwa kutumaini kasi.

Mnahitaji kitambulisho au kadi?

Hapana. Barua pepe ya kujisajili, malipo kwa USDC au USDT — hakuna nyaraka, hakuna kadi.

Maoni

Bado hakuna maoni. Kuwa wa kwanza.

Acha maoni

Maoni yanakaguliwa kabla ya kuonekana.