Ollama د ځایي ماډل چلول په یو-کرښیز نصب بدلوي. دا how-to دی؛ د دې ریښتیني انځور لپاره چې د CPU انفرنس څه کولی شي او څه نه شي (او د RAG خوندور ټکی) د Ollama لپاره د VPS کارونې قضیه او Ollama پخپله کوربه توب وګورئ.
۱. Ollama نصب کړئ
curl -fsSL https://ollama.com/install.sh | sh
دا Ollama نصبوي او د یوه systemd خدمت په توګه یې پیلوي چې په localhost:11434 کې اوري.
۲. یو کوچنی ماډل راکش کړئ او یې وچلوئ
په CPU ماشین کې له کوچني پیل وکړئ:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
د 3B ماډلونه په CPU کې واقعاً د کارونې وړ دي؛ 7–8B په هره ثانیه څو ټوکنه چلیږي (د batch لپاره سم، د چیټ لپاره دردناک)؛ 13B+ به swap وکړي او وخوځیږي — مه یې کوئ.
۳. HTTP API ته زنګ ووهئ
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
embeddings د CPU خوندور ټکی دی:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
۴. دا په localhost کې وساتئ — که اړتیا وي په خوندي توګه یې څرګند کړئ
Ollama په ډیفالټ سره له 127.0.0.1:11434 سره تړل کیږي. هلته یې پریږدئ. که تاسو له بل ماشین څخه ورته د رسیدو اړتیا لرئ، د دې مخې ته د تصدیق سره یو reverse proxy په ځانګړي-IP پلان کې کیږدئ (د nginx + HTTPS لارښود) یا د SSH تونل وکاروئ — د تصدیق پرته د ماډل endpoint هیڅکله په عامه توګه مه څرګندوئ.
ریښتینی برخه
دا یوازې-CPU مثالونه دي (GPU نشته). کوچني کوانټایز شوي ماډلونه او embeddings ښه چلیږي؛ لوی نه. Ollama د د خصوصي RAG سټیک لپاره vector DB سره جوړه کړئ — کوچني ځایي embeddings سره یو ځایي vector store هغه ترتیب دی چې دلته واقعاً ځلیږي. Medium ($12/میاشت، 6 GB) آرام پلان دی. نږدې په یوه دقیقه کې root، بې له KYC، په کریپټو تادیه.
تبصرې
لا تبصرې نشته. لومړی اوسئ.