EQVPS

VPS د ځان-کوربه شوي RAG لپاره په مقیاس

Retrieval-augmented generation د یوه laptop ډیمو کیدل درولوي کله چې corpus ریښتینی شي. یو vector index RAM غواړي، او ستاسو embeddingونه ستاسو خصوصي ډیټا دي. دلته د اندازه‌کولو ریاضي ده او ولې لوړه-حافظه، no-KYC کوربه‌توب سمون لري. له $55/میاشت.

د یوه laptop باندې د دوه سوه سندونو سره یو RAG ډیمو بې زحمته احساس کیږي. بیا تاسو یې یوه ریښتیني corpus ته اشاره کوئ — د یوه شرکت اسناد، د کلونو ټکټونه، یو ریښتینی د پوهې بنسټ — او ټول شی یوه د حافظې ستونزه کیږي. نه یوه د CPU ستونزه. یوه د حافظې.

دلته هغه برخه ده چې ډیری کوربه‌توب پاڼې یې پریږدي: ګړندۍ retrieval index په RAM کې غواړي. د متن هره ټوټه یو embedding کیږي — یو vector چې د یو څو سوو تر یو څو زرو شمیرو پورې سور دی — او پلټنه پدې معنی چې خپله پوښتنه د دوی ټولو سره پرتله کول، ژر. په ديسک کار کوي، خو هره پوښتنه یو د latency مالیه تادیه کوي، او د-ټیټ-latency retrieval هغه دلیل و چې تاسو په لومړي سر کې ځان-کوربه وکړ.

د اندازه‌کولو ریاضي، په ریښتیا

خپله corpus اندازه کړئ — سور او د index ډول دا ډیر بدلوي — خو د یوه د پیل احساس په توګه:

موږ بشپړ د RAM کرښه دلته ولیکه که تاسو جزئیات غواړئ.

ولې لوړه-حافظه او no-KYC یوځای

د ۴۸ GB RAM کرایه کول اسانه دي. د crypto او د هویت کتنې پرته یې کرایه کول نه دي — ډیری هوسټان چې جدي حافظه ارزانه پلوري یې د یوه کارت او یوه KYC فورمې تر شا کوي. ستاسو embeddingونه انتزاعي شمیرې نه دي؛ دوی هغه متن کوډ کوي چې ترې راغلي. ستاسو اسناد، ستاسو د پیرودونکو منځپانګه، vectorونو ته بدل شوي. که هغه ډیټا دومره حساسه وي چې تاسو یې په خصوصي توګه تادیه کوئ، یو اداره شوی vector cloud ټوله موخه ړنګوي — او همدارنګه یو هوسټ چې سرور ستاسو هویت سره تړي.

هغه ترکیب — لوړه حافظه، dedicated IP، crypto، no KYC، شپني بیک‌اپونه — هغه څه دي چې د Pro کرښه ورته ده. دا د هرې ګیګابایټ ترټولو ارزانه نه ده، او که تاسو محرمیت ته اړتیا نلرئ تاسو کولی شئ RAM بل ځای ارزانه ومومئ. خو که index ستاسو محصول وي او نشي وتلی، دا هغه بڼه ده چې سمون لري.

چیرته پیل وکړئ

یو پلان وټاکئ چې د index سربیره هر څه چې شاوخوا یې دي — اپلیکیشن، مودل client، د ودې ځای — لپاره یې ځای وي. د ډیری ریښتیني corpusونو لپاره دا Pro-48 (۴۸ GB) دی؛ یو لوی Pro-64 یا Pro-80 ته ځي. لومړی یو نمونه بار کړئ، حافظه وګورئ، له هغه شمیرې اندازه کړئ چې مو اندازه کړ — نه هغه چې ترې ویریدلئ.

که ستاسو retrieval د یوه لوی اجنټ سیسټم برخه وي، همدا box ډیری وخت د اجنټ فلیټ هم ساتي — دا هغه څنګه دی چې یو ۴۸ GB پلان په ارامۍ یو ۶۴ GB کیږي.

د ځای پرځای کولو لپاره چمتو یاست؟ په crypto تادیه، بې KYC — شاوخوا یوه دقیقه کې چمتو.

اوس ځای پرځای کړئ →

پوښتنې

زما د RAG تنظیم واقعاً څومره RAM ته اړتیا لري؟

دا د embedding شمیر او د vector سور سره اندازه کیږي. یو څو سوه زره chunkونه په ۲–۴ GB کې سمون لري؛ ټیټ میلیونونه، د اپلیکیشن او OS سره چې شاوخوا یې دي، په ۱۶–۳۲ GB کې ښکته کیږي؛ لسګونه میلیونونه ۴۸ GB او هاخوا ته رسیږي. یو نمونه اندازه کړئ، اوسیدونکې حافظه وګورئ، برون‌یابي وکړئ — لوړ اټکل مه کوئ، تاسو به یوازې ډیر تادیه کړئ.

ولې یو اداره شوی vector خدمت ونه کاروم؟

دوه دلایل چې خلک واقعاً ځان-کوربه کوي: ستاسو embeddingونه خصوصي ډیټا کوډ کوي (اسناد، یادښتونه، د پیرودونکي منځپانګه)، نو په یوه ماشین چې تاسو یې کنټرولوئ ساتل یې مهم دي؛ او لګښت فلیټ دی — یو اداره شوی خدمت د vectorونو او پوښتنو له مخې میټر کوي، یو VPS یو میاشتنی شمیر دی چې تاسو یې هرومرو کولی شئ.

pgvector یا یو dedicated engine؟

که تاسو لا دمخه Postgres چلوئ، pgvector د-لږترلږه-هڅې لاره ده — یو توسیع. د میلیونونو vectorونو لپاره د درنه فلټر کولو سره، یو د-موخې-جوړ شوی engine لکه Qdrant خپل ځان خدمت ګټي. له هغه څه پیل وکړئ چې تاسو یې چلوئ؛ کله چې پلټنه ورو شي جلا یې کړئ، نه مخکې.

ایا زه د RAG لپاره GPU ته اړتیا لرم؟

نه. Retrieval د CPU + RAM کار دی — د vectorونو پرتله کول، نه د متن تولید. د تولید ګام ستاسو LLM بولي (یو API، یا یو جلا مودل کوربه). یو لوړه-حافظه CPU box دقیقاً د retrieval نیمایي لپاره سمه بڼه ده.

تبصرې

لا تبصرې نشته. لومړی اوسئ.

یوه تبصره پریږدئ

تبصرې د ښکاره کیدو مخکې اعتدال کیږي.