هره پرامپټ د بل چا API ته لیږل سم دي — تر هغه چې نه وي. شاید ډیټا حساسه وي او تاسو غواړئ چې هیڅکله ستاسو سرور ونه پریږدي. شاید تاسو د rate limitونو ستړي یاست، یا د دې چې د یوه مودل نسخه ستاسو لاندې بدلیږي، یا د یوه د-هر-token میټر چې tick کوي پداسې حال کې چې تاسو تجربه کوئ. په کوم ټکي «څه که زه یوازې خپل وچلوم؟» د یوه فکري تجربې کیدل درولوي.
Ollama دا په ریښتیا اسانه کوي. سخته پوښتنه دا ده چې څه په یوه VPS سمون لري — او دلته ریښتینی ځواب د هیاهو څخه ډیر مهم دی.
په CPU واقعاً څه چلولی شئ
هیڅ GPU نشته؟ نو تاسو CPU inference کوئ، او د مودل اندازه هر څه دي. Quantization (د وزنونو 4-bit ته کمول) هغه څه دي چې دا عملي کوي — تاسو یو ټوټه کیفیت بایلئ او یو ډیر حافظه سپموئ.
نږدې شمیرې، هغه چې مهمې دي:
- 3B مودل، 4-bit — ~3 GB RAM. د چټ او ساده دندو لپاره کافي ژر.
- 7B مودل، 4-bit — ~5 GB RAM. خوندور ځای: د پام وړ هوښیار، لا هم په یوه د لوستلو وړ ګړندیوالي چلیږي.
- 13B او پورته — 8-10 GB+ او په CPU ورو. په تخنیکي توګه ممکن، په عملي ډول ځورونکی.
سرعت، په ریښتیا: په یو څو vCPUونو تاسو به په ثانیه کې یو څو tokenونه وګورئ. د یوه چټبوټ یا یوه د کوډ مرستندوی لپاره بشپړ سم چیرته چې تاسو یې د لیکلو په حال کې لولئ. د یوه میلیون سندونو د batch-پروسس کولو لپاره سم نه دی — دا د GPU job دی، او موږ بل ډول نه پروو. موږ GPU مثالونه نه وړاندې کوو. که ستاسو پلان یو 70B مودل یا درنه throughput ته اړتیا ولري، یو CPU VPS — زموږ یا د هرچا — ناسمه وسیله ده، او تاسو باید دا مخکې له دې چې یو سنټ ولګوئ پوه شئ.
خو یو خصوصي 7B چې ستاسو پوښتنو ته ځواب ورکوي او هیڅکله کور ته تلیفون نه کوي؟ هغه په یوه 6 GB box آرام چلیږي.
نصب — درې کمانډونه
سرور پیل کړئ، SSH ورننوځئ، او:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
همدا دی — تاسو په terminal کې چټ کوئ. د خپل کوډ څخه یې د کارولو لپاره، Ollama لا دمخه په پورټ 11434 یو HTTP API خدمت کوي:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
یو خنډ چې د لهمخکې پوهیدو ارزښت لري: په ډیفالټ هغه API localhost ته تړل کیږي. هغه داسې وساتئ او د SSH له لارې tunnel یې کړئ، یا دا انټرنیټ ته څرګند دی. که تاسو غواړئ دا د رسیدو وړ وي، دا د auth تر شا کیږدئ — یو خلاص مودل endpoint په یوه عامه IP مه پریږدئ.
box ټاکل
پلان مودل ته سم کړئ، نه برعکس:
| تاسو څه چلول غواړئ | RAM چې اړتیا یې لرئ | معقول پلان |
|---|---|---|
| 3B مودل، سپکه کارونه | ~3 GB | Small (4 GB) |
| 7B مودل، په آرامۍ | ~5-6 GB | Medium (6 GB) |
| لوی / لوړ throughput | د GPU سیمه | یو CPU VPS نه |
د ډیری ځان-کوربه کوونکو لپاره، Medium (6 GB) ریښتینې سپارښتنه ده — د یوه 7B مودل سربیره ستاسو د اپلیکیشن او OS لپاره کافي ځای. Small (4 GB) کار کوي که تاسو 3B ته پاتې شئ. له هغه لاندې هر څه ډیر تنګ دی کله چې OS او context ورننوځي.
ولې دلته یې وکړئ
که تاسو یو LLM ځان-کوربه کوئ، محرمیت معمولاً نیمه دلیل دی — نو دا به عجیب وي چې د box کرایه کولو لپاره خپل ID وسپارئ. تاسو نه یاست اړ: تاسو کولی شئ په USDC یا USDT (یا د on-ramp له لارې یو کارت) تادیه وکړئ، بې KYC، او سرور شاوخوا یوه دقیقه کې ستاسو دی. Crypto-native، اجنټ-دوستانه، او ډیټا په یوه ماشین پاتې کیږي چې تاسو یې کنټرولوئ.
تجارت هغه یو دی چې موږ ورباندې ریښتيني یو: یوازې CPU، یو 6 GB سقف، کوچني مودلونه. د هغه دننه، ځان-کوربهتوب عالي دی. له هغه بهر، پریږدئ چې څوک تاسو ته یو CPU box د یوه job لپاره وپلوري چې یو GPU ته اړتیا لري.
د ازموینې لپاره چمتو یاست؟ یو پلان وټاکئ، تادیه وکړئ، او تاسو به شاوخوا ۶۰ ثانیو کې root ولرئ — بیا دا درې کمانډونه ستاسو خپل خصوصي مودل ته دي.
تبصرې
لا تبصرې نشته. لومړی اوسئ.