EQVPS

محلي LLM inference په خصوصي توګه کوربه کول: یو CPU VPS څه کولی شي او څه نه

Aug 9, 2026 · 3 دقیقې لوستل · EQVPS Team

راځئ چې له سره ریښتيني اوسو: که تاسو ګړندی، ارزانه، لوړ-کیفیت تولید غواړئ، یو API وبلئ. یو CPU VPS به د GPUونو د یوه datacenter ډک ونه ماتوي، او هرڅوک چې تاسو ته بل ډول وايي یو څه درپلوري.

نو ولې اصلاً inference ځان-کوربه کړم؟ یو دلیل، او دا یو ښه دی: ستاسو په سرور مودل ستاسو پرامپټونه هیڅ ځای نه لیږي.

CPU inference واقعاً څنګه ښکاري

تاسو کولی شئ په CPU د کافي RAM سره ریښتيني مودلونه وچلوئ. یو 7–8B مودل چې 4-bit ته quantized شوی کار کوي. یو 13B کار کوي. تاسو کولی شئ حتی یو 30B-درجې مودل ولوړوئ که تاسو حافظه ولرئ. هغه څه چې تاسو یې نشئ کولی دا دی چې ګړندی یې کړئ — output په یوه ثانیه کې یو څو tokenونه راځي، نه هغه سمدستي stream چې یو API یې درکوي.

دا ریښتینی تجارت دی. د تعاملي چټ لپاره دا ستونزمن دی. د شاليد کار لپاره — د شپې د سندونو لنډیز، یوه قطار طبقه‌بندي کول، د ډیټا په یوه مهال‌ویش بډایه کول — یو څو tokenونه په ثانیه کې په بشپړه توګه سم دي، او هیڅوک ساعت نه ګوري.

د RAM ریاضي

مودل باید په حافظه کې ناست وي، quantized که نه، سربیره د context او runtime لپاره اضافه بار:

دا دلیل دی چې «یو محلي مودل وچلوه» په ارامۍ یوه لوړه-حافظه پوښتنه کیږي. مودل همدا د حافظې نښه ده. په همدې box یو RAG index یا اجنټان اضافه کړئ او شمیرې پرمخ‌ولاړ کیږي.

Ollama vs vLLM، په لنډه توګه

Ollama اسانه دروازه ده — نصب کړئ، ollama run، بشپړ. دا د یوه خصوصي یو-کاروونکي تنظیم لپاره سمه وسیله ده چیرته چې تاسو یوازې غواړئ مودل شتون ولري. vLLM د خدمت throughput لپاره جوړ شوی: ډیر تنظیم، تر هممهاله بار لاندې غوره، ارزښت لري کله چې تاسو واقعاً حجم اداره کوئ. په Ollama پیل وکړئ؛ vLLM ته لاس ورسوئ کله چې تاسو ریښتینی ترافیک خدمت کوئ.

چیرته خصوصي-لومړی واقعاً ګټي

د ځان-کوربه شوي inference قضیه سرعت یا لګښت نه دی — دا دا ده چې ځینې ډیټا نشي وتلی. قانوني اسناد. طبي ریکارډونه. اختصاصي کوډ. هر څه چیرته چې پرامپټ یوې دریمې-ډلې API ته لیږل د پالیسي یا باور دلایلو لپاره له میز څخه بهر دي. یو ورو مودل چې په بشپړه توګه ستاسو په ماشین چلیږي د یوه ګړندي څخه غوره دی چې هر څه یې چې تاسو یې لیږئ log کوي.

او که ډیټا دومره حساسه وي، تادیه هم احتمالاً باید خصوصي وي. د box کرایه کول د crypto او no KYC سره ټوله حلقه — سرور، مودل، پرامپټونه، بلینګ — د هرچا د هویت ریکارډونو څخه لرې ساتي. دا اصلي وړاندیز دی: نه «ارزانه inference»، بلکې «هغه inference چې بل هیڅوک یې نشي لیدلی».

کتاکلی

د سرعت او کیفیت لپاره، یو API وکاروئ — پکې هیڅ شرم نشته. هغه وخت ځان-کوربه کړئ چې محرمیت اړتیا وي او ورو د منلو وړ وي. د مودل سربیره د هغه context سربیره د هر بل شي لپاره چې box شریکوي اندازه کړئ، او له CPU څخه د GPU سرعت تمه مه کوئ.

کله چې مودل ریښتینې حافظې ته اړتیا ولري، د Pro کرښه ۳۲ تر ۸۰ GB د یوه dedicated IP او شپنیو بیک‌اپونو سره چلوي — کافي چې یو جدي quantized مودل د context لپاره ځای سره وساتي.

پوښتنې

ایا زه کولی شم یو LLM بې GPU وچلوم؟

کوچني quantized مودلونه، هو — او ورو. یو 7–8B مودل چې 4-bit ته quantized شوی په CPU د کافي RAM سره چلیږي، خو تاسو به output په یوه ثانیه کې یو څو tokenونه اندازه کړئ، نه هغه ژر stream چې له یوه API څخه یې ترلاسه کوئ. د batch دندو او شاليد دندو لپاره سم، د تعاملي چټ لپاره دردناک.

د محلي inference لپاره څومره RAM؟

مودل باید په حافظه کې سربیره اضافه بار ځای ونیسي. یو 7–8B 4-bit مودل ~6–8 GB غواړي؛ 13B شاوخوا 10–16 GB؛ 30B-درجې مودلونه quantized 24–48 GB ته رسیږي. د context او د box د هر بل شي لپاره ځای اضافه کړئ. دا دلیل دی چې محلي inference ژر لوړه-حافظه سیمه ته ښکته کیږي.

Ollama یا vLLM؟

Ollama اسانه ننوتنه ده — یو کمانډ، مودل راکش شوی، روان. vLLM د throughput او خدمت لپاره دی، ډیر تنظیم، تر بار لاندې غوره. د یوه خصوصي یو-کاروونکي box لپاره، Ollama معمولاً سمه پریکړه ده؛ vLLM کله چې تاسو واقعاً غوښتنې په حجم خدمت کوئ.

ولې اصلاً inference ځان-کوربه کړم که ورو دی؟

محرمیت. ستاسو پرامپټونه او پایلې هیڅکله د یوه چمتوکوونکي سرورونه یا logونه نه لمسوي. د حساسو ډیټا لپاره — قانوني، طبي، داخلي کوډ، هر څه چې تاسو یې یوې دریمې ډلې ته نشئ لیږلی — یو ورو خصوصي مودل د یوه ګړندي څخه غوره دی چې هر څه ویني. دا د no-KYC crypto تادیې سره جوړ کړئ او ټوله حلقه ستاسو پاتې کیږي.

← بلاګ ته بیرتهپلانونه او بیې وګورئ →

تبصرې

لا تبصرې نشته. لومړی اوسئ.

یوه تبصره پریږدئ

تبصرې د ښکاره کیدو مخکې اعتدال کیږي.