Ollama hufanya kuendesha modeli ya ndani kuwa usakinishaji wa mstari mmoja. Huu ni mwongozo; kwa picha ya kweli ya kile ambacho utambuzi wa CPU unaweza na hauwezi kufanya (na mahali pazuri pa RAG), angalia matumizi ya VPS kwa Ollama na jipangishie Ollama.
1. Sakinisha Ollama
curl -fsSL https://ollama.com/install.sh | sh
Hilo husakinisha Ollama na kuianzisha kama huduma ya systemd inayosikiliza kwenye localhost:11434.
2. Vuta na uendeshe modeli ndogo
Kwenye mashine ya CPU, anza ndogo:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Modeli za 3B zinatumika kweli kwenye CPU; 7–8B huendesha kwa tokeni chache/sekunde (sawa kwa kundi, chungu kwa gumzo); 13B+ zitafanya swap na kutambaa — usifanye.
3. Ita API ya HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings ndio mahali pazuri pa CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Iweke kwenye localhost — iweke wazi kwa usalama ikihitajika
Ollama hufungamana na 127.0.0.1:11434 kwa chaguo-msingi. Iache hapo. Ukihitaji kuifikia kutoka mashine nyingine, weka reverse proxy yenye uthibitishaji mbele yake kwenye mpango wa IP maalum (mwongozo wa nginx + HTTPS) au tumia handaki ya SSH — kamwe usiweke wazi hadharani mwisho wa modeli usio na uthibitishaji.
Sehemu ya ukweli
Hizi ni nakala za CPU pekee (hakuna GPU). Modeli ndogo zilizopimwa na embeddings huendesha vizuri; kubwa hazifanyi. Unganisha Ollama na hifadhidata ya vekta kwa rafu ya RAG ya faragha — embeddings ndogo za ndani pamoja na hifadhi ya vekta ya ndani ndio usanidi unaong'aa kweli hapa. Medium ($12/mwezi, 6 GB) ndio mpango wa raha. Root kwa takribani dakika moja, bila KYC, malipo kwa crypto.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.