راځئ چې له سره ریښتيني اوسو: که تاسو ګړندی، ارزانه، لوړ-کیفیت تولید غواړئ، یو API وبلئ. یو CPU VPS به د GPUونو د یوه datacenter ډک ونه ماتوي، او هرڅوک چې تاسو ته بل ډول وايي یو څه درپلوري.
نو ولې اصلاً inference ځان-کوربه کړم؟ یو دلیل، او دا یو ښه دی: ستاسو په سرور مودل ستاسو پرامپټونه هیڅ ځای نه لیږي.
CPU inference واقعاً څنګه ښکاري
تاسو کولی شئ په CPU د کافي RAM سره ریښتيني مودلونه وچلوئ. یو 7–8B مودل چې 4-bit ته quantized شوی کار کوي. یو 13B کار کوي. تاسو کولی شئ حتی یو 30B-درجې مودل ولوړوئ که تاسو حافظه ولرئ. هغه څه چې تاسو یې نشئ کولی دا دی چې ګړندی یې کړئ — output په یوه ثانیه کې یو څو tokenونه راځي، نه هغه سمدستي stream چې یو API یې درکوي.
دا ریښتینی تجارت دی. د تعاملي چټ لپاره دا ستونزمن دی. د شاليد کار لپاره — د شپې د سندونو لنډیز، یوه قطار طبقهبندي کول، د ډیټا په یوه مهالویش بډایه کول — یو څو tokenونه په ثانیه کې په بشپړه توګه سم دي، او هیڅوک ساعت نه ګوري.
د RAM ریاضي
مودل باید په حافظه کې ناست وي، quantized که نه، سربیره د context او runtime لپاره اضافه بار:
- 7–8B، 4-bit — شاوخوا 6–8 GB. په یوه منځنۍ پلان چلیږي.
- 13B، 4-bit — نږدې 10–16 GB.
- 30B-درجې، quantized — 24–48 GB، د quantization پورې اړه لري.
- لوی، یا لوړ دقت — تاسو ژر په 64–80 GB کې یاست — او له 80 GB پورته هیڅ واحد Pro box نه سمون لري، لا هم CPU-ورو.
دا دلیل دی چې «یو محلي مودل وچلوه» په ارامۍ یوه لوړه-حافظه پوښتنه کیږي. مودل همدا د حافظې نښه ده. په همدې box یو RAG index یا اجنټان اضافه کړئ او شمیرې پرمخولاړ کیږي.
Ollama vs vLLM، په لنډه توګه
Ollama اسانه دروازه ده — نصب کړئ، ollama run، بشپړ. دا د یوه خصوصي یو-کاروونکي تنظیم لپاره سمه وسیله ده چیرته چې تاسو یوازې غواړئ مودل شتون ولري. vLLM د خدمت throughput لپاره جوړ شوی: ډیر تنظیم، تر هممهاله بار لاندې غوره، ارزښت لري کله چې تاسو واقعاً حجم اداره کوئ. په Ollama پیل وکړئ؛ vLLM ته لاس ورسوئ کله چې تاسو ریښتینی ترافیک خدمت کوئ.
چیرته خصوصي-لومړی واقعاً ګټي
د ځان-کوربه شوي inference قضیه سرعت یا لګښت نه دی — دا دا ده چې ځینې ډیټا نشي وتلی. قانوني اسناد. طبي ریکارډونه. اختصاصي کوډ. هر څه چیرته چې پرامپټ یوې دریمې-ډلې API ته لیږل د پالیسي یا باور دلایلو لپاره له میز څخه بهر دي. یو ورو مودل چې په بشپړه توګه ستاسو په ماشین چلیږي د یوه ګړندي څخه غوره دی چې هر څه یې چې تاسو یې لیږئ log کوي.
او که ډیټا دومره حساسه وي، تادیه هم احتمالاً باید خصوصي وي. د box کرایه کول د crypto او no KYC سره ټوله حلقه — سرور، مودل، پرامپټونه، بلینګ — د هرچا د هویت ریکارډونو څخه لرې ساتي. دا اصلي وړاندیز دی: نه «ارزانه inference»، بلکې «هغه inference چې بل هیڅوک یې نشي لیدلی».
کتاکلی
د سرعت او کیفیت لپاره، یو API وکاروئ — پکې هیڅ شرم نشته. هغه وخت ځان-کوربه کړئ چې محرمیت اړتیا وي او ورو د منلو وړ وي. د مودل سربیره د هغه context سربیره د هر بل شي لپاره چې box شریکوي اندازه کړئ، او له CPU څخه د GPU سرعت تمه مه کوئ.
کله چې مودل ریښتینې حافظې ته اړتیا ولري، د Pro کرښه ۳۲ تر ۸۰ GB د یوه dedicated IP او شپنیو بیکاپونو سره چلوي — کافي چې یو جدي quantized مودل د context لپاره ځای سره وساتي.
تبصرې
لا تبصرې نشته. لومړی اوسئ.