Ollama የቦታ ሞዴል ማሄድን ባለ አንድ-መስመር መጫኛ ያደርገዋል። ይህ how-to ነው፤ የCPU መተንተን ምን ማድረግ እንደሚችልና እንደማይችል (እና የRAG ጣፋጭ ቦታ) ግልፅ ምስል ለማግኘት ለOllama VPS አጠቃቀም እና Ollama ራስ-ማስተናገድ ተመልከት።
1. Ollama ጫን
curl -fsSL https://ollama.com/install.sh | sh
ይህ Ollama ን ይጭናል እና በlocalhost:11434 ላይ የሚያዳምጥ የsystemd አገልግሎት ሆኖ ያስጀምረዋል።
2. ትንሽ ሞዴል ሳብና አሂድ
በCPU ማሽን ላይ ትንሽ ጀምር፦
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B ሞዴሎች በCPU ላይ በእውነት ጥቅም ላይ ይውላሉ፤ 7–8B በሰከንድ ጥቂት ቶከን ይሄዳሉ (ለbatch ጥሩ፣ ለውይይት አሳማሚ)፤ 13B+ swap ያደርጋሉ እና ይሳባሉ — አታድርግ።
3. HTTP API ጥራ
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
embeddings የCPU ጣፋጭ ቦታ ናቸው፦
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. በlocalhost አቆየው — ካስፈለገ በደህና አጋልጠው
Ollama በነባሪ ወደ 127.0.0.1:11434 ይተሳሰራል። እዚያ ተወው። ከሌላ ማሽን ልትደርሰው ካስፈለገ፣ በተወሰነ-IP እቅድ ላይ ማረጋገጫ ካለው reverse proxy ፊት አስቀምጥ (nginx + HTTPS መመሪያ) ወይም SSH ዋሻ ተጠቀም — ማረጋገጫ የሌለው የሞዴል endpoint በጭራሽ በይፋ አታጋልጥ።
ግልፅ ክፍል
እነዚህ የCPU-ብቻ ናሙናዎች ናቸው (GPU የለም)። ትናንሽ የተከፋፈሉ ሞዴሎችና embeddings በደንብ ይሄዳሉ፤ ትላልቆቹ አይሄዱም። Ollama ን ከለግል RAG ክምችት vector DB ጋር አጣምረው — ትናንሽ የቦታ embeddings ከቦታ vector store ጋር እዚህ በእውነት የሚያበራው ማዋቀር ነው። Medium ($12/ወር፣ 6 GB) ምቹው እቅድ ነው። በአንድ ደቂቃ ገደማ root፣ ያለ KYC፣ በክሪፕቶ የሚከፈል።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።