دو سو دستاویزات والے ایک لیپ ٹاپ پر RAG ڈیمو بے محنت لگتا ہے۔ پھر آپ اسے ایک حقیقی corpus کی طرف موڑتے ہیں — ایک کمپنی کی دستاویزات، برسوں کے ٹکٹ، ایک حقیقی knowledge base — اور پوری چیز ایک memory مسئلہ بن جاتی ہے۔ ایک CPU مسئلہ نہیں۔ ایک memory والا۔
یہ رہا وہ حصہ جو زیادہ تر ہوسٹنگ صفحات چھوڑ دیتے ہیں: تیز retrieval index کو RAM میں چاہتا ہے۔ ٹیکسٹ کا ہر chunk ایک embedding بنتا ہے — چند سو سے چند ہزار نمبر-چوڑا ایک vector — اور search کا مطلب آپ کی query کا ان سب سے تیزی سے موازنہ کرنا ہے۔ ڈسک پر کام کرتا ہے، لیکن ہر query ایک latency-محصول ادا کرتی ہے، اور کم-latency retrieval پہلے سیلف-ہوسٹ کرنے کی وجہ تھی۔
sizing کا حساب، ایمانداری سے
اپنا corpus ناپیں — dimension اور index-قسم اسے کافی جھلاتے ہیں — لیکن ایک ابتدائی احساس کے طور پر:
- چند لاکھ embeddings — 2–4 GB۔ ایک ذاتی knowledge base۔ اس کے لیے Pro کی ضرورت نہیں؛ ایک چھوٹا پلان ٹھیک۔
- چند ملین — ارد گرد ایپ، model client اور OS کے ساتھ، 16–32 GB کا منصوبہ بنائیں۔ ایک سنجیدہ کمپنی knowledge base۔ یہاں Pro-32 یا Pro-48 معنی رکھنا شروع کرتا ہے۔
- کروڑوں، یا high-dimension vectors — 48 GB اور اوپر، اور ~80 GB سے آگے آپ index کو کئی سرورز میں تقسیم کر رہے ہیں۔ بڑے دستاویز-ذخائر، multi-tenant retrieval، ایک ساتھ کئی indexes گرم۔
اگر آپ تفصیل چاہیں تو ہم نے مکمل RAM curve یہاں لکھا۔
کیوں high-memory اور no-KYC ایک ساتھ
48 GB RAM کرائے پر لینا آسان ہے۔ اسے کرپٹو اور کسی شناختی جانچ کے بغیر کرائے پر لینا نہیں — جو ہوسٹس سنجیدہ memory سستے میں بیچتے ہیں ان میں سے زیادہ تر ایک کارڈ اور ایک KYC فارم کے پیچھے کرتے ہیں۔ آپ کے embeddings تجریدی نمبر نہیں؛ وہ اُس ٹیکسٹ کو encode کرتے ہیں جہاں سے وہ آئے۔ آپ کی دستاویزات، آپ کے گاہکوں کا مواد، vectors میں تبدیل۔ اگر وہ ڈیٹا اتنا حساس ہے کہ آپ نجی طور پر ادا کر رہے ہیں، تو ایک managed vector cloud پورا مقصد ختم کر دیتا ہے — اور ویسا ہی وہ ہوسٹ کرتا ہے جو سرور کو آپ کی شناخت سے باندھتا ہے۔
وہ امتزاج — high memory، dedicated IP، کرپٹو، no KYC، رات کے بیک اپس — اسی کے لیے Pro لائن ہے۔ یہ فی گیگابائٹ سب سے سستا نہیں، اور اگر آپ کو پرائیویسی نہ چاہیے تو آپ کہیں اور سستی RAM پا سکتے ہیں۔ لیکن اگر index ہی آپ کا پروڈکٹ ہے اور یہ نکل نہیں سکتا، تو یہی وہ شکل ہے جو موزوں ہے۔
کہاں شروع کریں
index plus ارد گرد ہر چیز کے لیے headroom والا ایک پلان چنیں — ایپ، model client، بڑھنے کی جگہ۔ زیادہ تر حقیقی corpora کے لیے وہ Pro-48 (48 GB) ہے؛ ایک بڑا Pro-64 یا Pro-80 پر جاتا ہے۔ پہلے ایک نمونہ load کریں، memory دیکھیں، جو نمبر آپ نے ناپا اس سے size چنیں — اُس سے نہیں جس سے آپ ڈرے۔
اگر آپ کا retrieval ایک بڑے agent سسٹم کا حصہ ہے، تو وہی باکس اکثر agent fleet بھی رکھتا ہے — اسی طرح ایک 48 GB پلان خاموشی سے ایک 64 GB بن جاتا ہے۔
تبصرے
ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔