EQVPS

VPS د خصوصي لوړه-حافظه LLM inference لپاره

لوی quantized مودلونه ریښتیني RAM ته اړتیا لري، نه یو GPU چې تاسو یې نلرئ. چیرته یو لوړه-حافظه CPU box د 30B-درجې مودلونه په خصوصي توګه چلوي، څه واقع‌بین دي، او چیرته نه دي. له $70/میاشت.

موږ د Ollama او کوچنیو مودلونو لپاره یوه جلا پاڼه لرو — دا هغه $12 CPU box دی چې 1B–8B او embeddingونه چلوي. دا پاڼه بل پای دی: هغه مودلونه چې دومره لوی دي چې RAM، نه CPU، هغه څه دي چې تاسو درولوي.

راځئ چې له سره ریښتيني اوسو، لکه هر ځای: زموږ سرورونه یوازې-CPU دي، هیڅ GPU نشته. یو لوی مودل دلته ورو چلیږي. که تاسو په یوه 30B مودل ګړندی تعاملي چټ غواړئ، تاسو یو GPU کوربه ته اړتیا لرئ — مختلف محصول، مختلف چمتوکوونکی. هغه څه چې یو لوړه-حافظه CPU box ښه کوي یو لوی quantized مودل په خصوصي توګه د هغه کار لپاره چلول دي چې د چټ کړکۍ نه ده.

د RAM ریاضي

مودل په حافظه کې ناست وي، quantized که نه، سربیره د context او runtime لپاره اضافه بار:

دا دلیل دی چې «یو لوی محلي مودل وچلوه» واقعاً یوه لوړه-حافظه پوښتنه ده. مودل همدا د حافظې نښه ده. په همدې کوربه یو RAG index اضافه کړئ او شمیرې پرمخ‌ولاړ کیږي.

چیرته خصوصي-لومړی په ریښتیا ګټي

قضیه سرعت نه ده او لګښت نه دی — دا دا ده چې ځینې ډیټا نشي وتلی. قانوني اسناد. طبي ریکارډونه. اختصاصي کوډ. هر څه چیرته چې پرامپټ یوې دریمې-ډلې API ته لیږل له میز څخه بهر دي. یو ورو مودل چې په بشپړه توګه ستاسو په ماشین چلیږي د یوه ګړندي څخه غوره دی چې هر څه یې چې تاسو یې لیږئ log کوي. موږ بشپړ انځور دلته ولیکه.

او که ډیټا دومره حساسه وي، تادیه هم احتمالاً باید خصوصي وي. د box کرایه کول د crypto او no KYC سره ټوله حلقه — سرور، مودل، پرامپټونه، بلینګ — د هرچا د هویت ریکارډونو څخه لرې ساتي. دا وړاندیز دی: نه ارزانه inference، بلکې هغه inference چې بل هیڅوک یې نشي لیدلی.

څه وټاکئ

د context لپاره ځای سره د یوه 30B-درجې مودل لپاره، Pro-64 (۶۴ GB) آرام انتخاب دی؛ یو تنګ quantization Pro-32 یا Pro-48 سره سمون لري، یو لوی Pro-80 ته ځي. لومړی مودل بار کړئ، اوسیدونکې حافظه وګورئ، له هغه څه اندازه کړئ چې مو اندازه کړل. او تمې تنظیم کړئ: دا خصوصي batch inference ده، نه یوه ګړندۍ چټ کړکۍ.

د ځای پرځای کولو لپاره چمتو یاست؟ په crypto تادیه، بې KYC — شاوخوا یوه دقیقه کې چمتو.

اوس ځای پرځای کړئ →

پوښتنې

دا ستاسو د Ollama د کارونې بېلګې څخه څنګه توپیر لري؟

د Ollama پاڼه د یوه $12 CPU box کوچنیو مودلونو په اړه ده — 1B–8B، embeddingونه، سپک کار. دا لوړه-حافظه پای دی: 13B تر 30B-درجې quantized مودلونه چې د بارولو لپاره هم ۲۴–۴۸ GB یا ډیرو ته اړتیا لري. همدا یوازې-CPU واقعیت، ډیره لویه د حافظې نښه، مختلف پلان.

د یوه ورکړل شوي مودل لپاره څومره RAM؟

مودل باید په حافظه کې سربیره اضافه بار ځای ونیسي. یو 13B 4-bit مودل ~۱۰–۱۶ GB غواړي؛ 30B-درجې quantized ۲۴–۴۸ GB ته رسیږي؛ لوی یا لوړ-دقت ته لاړ شئ او تاسو په ۶۴–۸۰ GB کې یاست — له هغه پورته، زموږ هیڅ واحد box نه سمون لري. د context لپاره پر سر ځای اضافه کړئ.

ایا دا به ګړندی وي؟

نه — دلته له ځان سره ریښتینی اوسئ. په یوه لوی مودل باندې CPU inference په یوه ثانیه کې یو څو tokenونه دي، نه یو تعاملي stream. دا د batch او شاليد کار لپاره سم دی (د شپې لنډیز، یوه قطار طبقه‌بندي کول). د یوه لوی مودل باندې د ریښتیني-وخت چټ لپاره تاسو یو GPU ته اړتیا لرئ، چې موږ یې نه وړاندې کوو.

ولې دلته یې پر ځای د یوه API وچلوم؟

محرمیت. ستاسو پرامپټونه او پایلې هیڅکله د یوه چمتوکوونکي سرورونه یا logونه نه لمس کوي. د حساسو ډیټا لپاره — قانوني، طبي، داخلي کوډ — یو ورو خصوصي مودل د یوه ګړندي څخه غوره دی چې هر څه ویني. دا د no-KYC crypto تادیې سره جوړ کړئ او ټوله حلقه ستاسو پاتې کیږي.

تبصرې

لا تبصرې نشته. لومړی اوسئ.

یوه تبصره پریږدئ

تبصرې د ښکاره کیدو مخکې اعتدال کیږي.