موږ د Ollama او کوچنیو مودلونو لپاره یوه جلا پاڼه لرو — دا هغه $12 CPU box دی چې 1B–8B او embeddingونه چلوي. دا پاڼه بل پای دی: هغه مودلونه چې دومره لوی دي چې RAM، نه CPU، هغه څه دي چې تاسو درولوي.
راځئ چې له سره ریښتيني اوسو، لکه هر ځای: زموږ سرورونه یوازې-CPU دي، هیڅ GPU نشته. یو لوی مودل دلته ورو چلیږي. که تاسو په یوه 30B مودل ګړندی تعاملي چټ غواړئ، تاسو یو GPU کوربه ته اړتیا لرئ — مختلف محصول، مختلف چمتوکوونکی. هغه څه چې یو لوړه-حافظه CPU box ښه کوي یو لوی quantized مودل په خصوصي توګه د هغه کار لپاره چلول دي چې د چټ کړکۍ نه ده.
د RAM ریاضي
مودل په حافظه کې ناست وي، quantized که نه، سربیره د context او runtime لپاره اضافه بار:
- 13B، 4-bit — نږدې ۱۰–۱۶ GB. لا دمخه په یوه منځنۍ پلان چلیږي.
- 30B-درجې، quantized — ۲۴–۴۸ GB د quantization پورې اړه لري. دا Pro-32 تر Pro-64 سیمه ده.
- لوی یا لوړ دقت — ۶۴–۸۰ GB، او له ۸۰ GB پورته زموږ هیڅ واحد box نه سمون لري. Pro-80 دلته سقف دی.
دا دلیل دی چې «یو لوی محلي مودل وچلوه» واقعاً یوه لوړه-حافظه پوښتنه ده. مودل همدا د حافظې نښه ده. په همدې کوربه یو RAG index اضافه کړئ او شمیرې پرمخولاړ کیږي.
چیرته خصوصي-لومړی په ریښتیا ګټي
قضیه سرعت نه ده او لګښت نه دی — دا دا ده چې ځینې ډیټا نشي وتلی. قانوني اسناد. طبي ریکارډونه. اختصاصي کوډ. هر څه چیرته چې پرامپټ یوې دریمې-ډلې API ته لیږل له میز څخه بهر دي. یو ورو مودل چې په بشپړه توګه ستاسو په ماشین چلیږي د یوه ګړندي څخه غوره دی چې هر څه یې چې تاسو یې لیږئ log کوي. موږ بشپړ انځور دلته ولیکه.
او که ډیټا دومره حساسه وي، تادیه هم احتمالاً باید خصوصي وي. د box کرایه کول د crypto او no KYC سره ټوله حلقه — سرور، مودل، پرامپټونه، بلینګ — د هرچا د هویت ریکارډونو څخه لرې ساتي. دا وړاندیز دی: نه ارزانه inference، بلکې هغه inference چې بل هیڅوک یې نشي لیدلی.
څه وټاکئ
د context لپاره ځای سره د یوه 30B-درجې مودل لپاره، Pro-64 (۶۴ GB) آرام انتخاب دی؛ یو تنګ quantization Pro-32 یا Pro-48 سره سمون لري، یو لوی Pro-80 ته ځي. لومړی مودل بار کړئ، اوسیدونکې حافظه وګورئ، له هغه څه اندازه کړئ چې مو اندازه کړل. او تمې تنظیم کړئ: دا خصوصي batch inference ده، نه یوه ګړندۍ چټ کړکۍ.
تبصرې
لا تبصرې نشته. لومړی اوسئ.