EQVPS

د Ollama سره یو محلي LLM په یوه VPS ځان-کوربه کول — څه واقعاً کار کوي

Jun 14, 2026 · 4 دقیقې لوستل · EQVPS Team

هره پرامپټ د بل چا API ته لیږل سم دي — تر هغه چې نه وي. شاید ډیټا حساسه وي او تاسو غواړئ چې هیڅکله ستاسو سرور ونه پریږدي. شاید تاسو د rate limitونو ستړي یاست، یا د دې چې د یوه مودل نسخه ستاسو لاندې بدلیږي، یا د یوه د-هر-token میټر چې tick کوي پداسې حال کې چې تاسو تجربه کوئ. په کوم ټکي «څه که زه یوازې خپل وچلوم؟» د یوه فکري تجربې کیدل درولوي.

Ollama دا په ریښتیا اسانه کوي. سخته پوښتنه دا ده چې څه په یوه VPS سمون لري — او دلته ریښتینی ځواب د هیاهو څخه ډیر مهم دی.

په CPU واقعاً څه چلولی شئ

هیڅ GPU نشته؟ نو تاسو CPU inference کوئ، او د مودل اندازه هر څه دي. Quantization (د وزنونو 4-bit ته کمول) هغه څه دي چې دا عملي کوي — تاسو یو ټوټه کیفیت بایلئ او یو ډیر حافظه سپموئ.

نږدې شمیرې، هغه چې مهمې دي:

سرعت، په ریښتیا: په یو څو vCPUونو تاسو به په ثانیه کې یو څو tokenونه وګورئ. د یوه چټ‌بوټ یا یوه د کوډ مرستندوی لپاره بشپړ سم چیرته چې تاسو یې د لیکلو په حال کې لولئ. د یوه میلیون سندونو د batch-پروسس کولو لپاره سم نه دی — دا د GPU job دی، او موږ بل ډول نه پروو. موږ GPU مثالونه نه وړاندې کوو. که ستاسو پلان یو 70B مودل یا درنه throughput ته اړتیا ولري، یو CPU VPS — زموږ یا د هرچا — ناسمه وسیله ده، او تاسو باید دا مخکې له دې چې یو سنټ ولګوئ پوه شئ.

خو یو خصوصي 7B چې ستاسو پوښتنو ته ځواب ورکوي او هیڅکله کور ته تلیفون نه کوي؟ هغه په یوه 6 GB box آرام چلیږي.

نصب — درې کمانډونه

سرور پیل کړئ، SSH ورننوځئ، او:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

همدا دی — تاسو په terminal کې چټ کوئ. د خپل کوډ څخه یې د کارولو لپاره، Ollama لا دمخه په پورټ 11434 یو HTTP API خدمت کوي:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

یو خنډ چې د له‌مخکې پوهیدو ارزښت لري: په ډیفالټ هغه API localhost ته تړل کیږي. هغه داسې وساتئ او د SSH له لارې tunnel یې کړئ، یا دا انټرنیټ ته څرګند دی. که تاسو غواړئ دا د رسیدو وړ وي، دا د auth تر شا کیږدئ — یو خلاص مودل endpoint په یوه عامه IP مه پریږدئ.

box ټاکل

پلان مودل ته سم کړئ، نه برعکس:

تاسو څه چلول غواړئRAM چې اړتیا یې لرئمعقول پلان
3B مودل، سپکه کارونه~3 GBSmall (4 GB)
7B مودل، په آرامۍ~5-6 GBMedium (6 GB)
لوی / لوړ throughputد GPU سیمهیو CPU VPS نه

د ډیری ځان-کوربه کوونکو لپاره، Medium (6 GB) ریښتینې سپارښتنه ده — د یوه 7B مودل سربیره ستاسو د اپلیکیشن او OS لپاره کافي ځای. Small (4 GB) کار کوي که تاسو 3B ته پاتې شئ. له هغه لاندې هر څه ډیر تنګ دی کله چې OS او context ورننوځي.

ولې دلته یې وکړئ

که تاسو یو LLM ځان-کوربه کوئ، محرمیت معمولاً نیمه دلیل دی — نو دا به عجیب وي چې د box کرایه کولو لپاره خپل ID وسپارئ. تاسو نه یاست اړ: تاسو کولی شئ په USDC یا USDT (یا د on-ramp له لارې یو کارت) تادیه وکړئ، بې KYC، او سرور شاوخوا یوه دقیقه کې ستاسو دی. Crypto-native، اجنټ-دوستانه، او ډیټا په یوه ماشین پاتې کیږي چې تاسو یې کنټرولوئ.

تجارت هغه یو دی چې موږ ورباندې ریښتيني یو: یوازې CPU، یو 6 GB سقف، کوچني مودلونه. د هغه دننه، ځان-کوربه‌توب عالي دی. له هغه بهر، پریږدئ چې څوک تاسو ته یو CPU box د یوه job لپاره وپلوري چې یو GPU ته اړتیا لري.

د ازموینې لپاره چمتو یاست؟ یو پلان وټاکئ، تادیه وکړئ، او تاسو به شاوخوا ۶۰ ثانیو کې root ولرئ — بیا دا درې کمانډونه ستاسو خپل خصوصي مودل ته دي.

پوښتنې

ایا زه کولی شم یو LLM بې GPU وچلوم؟

هو، د کوچنیو مودلونو لپاره. یو 3B یا 7B مودل په 4-bit quantization په CPU چلیږي او په یوه د لوستلو وړ ګړندیوالي ځواب ورکوي — د یوه چټ‌بوټ، یوه د کوډ مرستندوی، یا شاليد دندو لپاره سم چیرته چې تاسو cursor نه ګورئ. هغه څه چې تاسو یې په CPU نشئ کولی یو لوی مودل (13B او پورته) خدمت کول یا لوړ throughput وهل دي؛ هغه ځای دی چیرته چې یو GPU اختیاري کیدل درولوي.

زه د Llama 7B لپاره څومره RAM ته اړتیا لرم؟

شاوخوا 5 GB د یوه 4-bit 7B مودل لپاره کله چې تاسو د context کړکۍ او OS اضافه کړئ — نو یو 6 GB box آرام فرش دی. یو 3B مودل شاوخوا 3 GB کې سمون لري. کوچنی quant (Q4) یو لږ کیفیت د ډیر لږ حافظې لپاره تجارت کوي، چې په یوه VPS سم تجارت دی.

ایا د یوه LLM ځان-کوربه‌توب د یوه API څخه ارزانه دی؟

دا د حجم پورې اړه لري. یو کوربه شوی API د هر token بل کوي او کله چې بې‌کاره وي هیڅ لګښت نلري؛ یو VPS یو فلیټ میاشتنی بل دی که تاسو یې کاروئ که نه. که تاسو د غوښتنو یو ثابت جریان چلوئ، یا تاسو ډیری د محرمیت او هیڅ rate limitونو پرواه کوئ، ځان-کوربه‌توب ګټي. د کله ناکله یو-ځلي پرامپټونو لپاره، یو میټر شوی API ارزانه دی.

ولې د یوه cloud API کارولو پر ځای ځان-کوربه کول؟

درې دلایل چې خلک یې واقعاً کوي: ډیټا هیڅکله ستاسو سرور نه پریږدي (د قانوني، طبي، یا یوازې خصوصي یادښتونو لپاره ریښتینی)، هیڅ rate limitونه یا د-هر-token میټر نشته، او مودل به ستاسو لاندې ونه بدلیږي یا deprecate نشي. لګښت دا دی چې تاسو box اداره کوئ او د هغه د هارډویر دننه اوسیږئ.

هغه ترټولو لوی مودل چې زه یې په واقع‌بین ډول په یوه CPU VPS چلولی شم کوم دی؟

یو 7B مودل په 4-bit په یوه 6 GB box خوندور ځای دی. تاسو کولی شئ په تخنیکي توګه یو 13B د کافي RAM سره بار کړئ، خو په CPU دا دومره ورو کیږي چې تاسو به یې احساس کړئ. له هغه پورته تاسو یو GPU غواړئ، چې یو مختلف ډول کوربه دی.

← بلاګ ته بیرتهپلانونه او بیې وګورئ →

تبصرې

لا تبصرې نشته. لومړی اوسئ.

یوه تبصره پریږدئ

تبصرې د ښکاره کیدو مخکې اعتدال کیږي.