ہمارے پاس Ollama اور چھوٹے ماڈلز کے لیے ایک الگ صفحہ ہے — وہ $12 CPU باکس ہے جو 1B–8B اور embeddings چلاتا ہے۔ یہ صفحہ دوسرا سرا ہے: وہ ماڈلز اتنے بڑے کہ CPU نہیں، RAM آپ کو روکتی ہے۔
شروع میں ایماندار رہیں، ہر جگہ کی طرح: ہمارے سرورز CPU-only ہیں، کوئی GPU نہیں۔ یہاں ایک بڑا ماڈل آہستہ چلتا ہے۔ اگر آپ ایک 30B ماڈل پر تیز interactive chat چاہتے ہیں، تو آپ کو ایک GPU ہوسٹ درکار ہے — مختلف پروڈکٹ، مختلف پرووائیڈر۔ ایک high-memory CPU باکس جو اچھا کرتا ہے وہ ایک بڑا quantized ماڈل نجی طور پر ایسے کام کے لیے چلانا ہے جو ایک chat window نہیں۔
RAM کا حساب
ماڈل memory میں بیٹھتا ہے، quantized ہو یا نہ، plus context اور runtime کا overhead:
- 13B، 4-bit — تقریباً 10–16 GB۔ ایک درمیانے پلان پر پہلے ہی چلتا ہے۔
- 30B-کلاس، quantized — quantization کے مطابق 24–48 GB۔ یہ Pro-32 سے Pro-64 کا علاقہ ہے۔
- بڑا یا زیادہ درستگی — 64–80 GB، اور 80 GB سے آگے ہمارا کوئی واحد باکس نہیں مانتا۔ یہاں Pro-80 حد ہے۔
اسی لیے "ایک بڑا local ماڈل چلائیں" دراصل ایک high-memory سوال ہے۔ ماڈل ہی memory footprint ہے۔ اسی ہوسٹ پر ایک RAG index شامل کریں اور نمبر جمع ہو جاتے ہیں۔
کہاں private-first واقعی جیتتا ہے
معاملہ رفتار نہیں اور لاگت نہیں — یہ کہ کچھ ڈیٹا نکل نہیں سکتا۔ قانونی دستاویزات۔ طبی ریکارڈ۔ ملکیتی کوڈ۔ کوئی بھی چیز جہاں prompt کو ایک تیسرے فریق کے API کو بھیجنا ناممکن ہے۔ ایک آہستہ ماڈل جو مکمل طور پر آپ کی مشین پر چلتا ہے اُس تیز کو ہراتا ہے جو آپ کے بھیجے سب کچھ کو log کرتا ہے۔ ہم نے پوری تصویر یہاں لکھی۔
اور اگر ڈیٹا اتنا حساس ہے، تو ادائیگی بھی شاید نجی ہونی چاہیے۔ باکس کو کرپٹو اور no KYC کے ساتھ کرائے پر لینا پوری چین — سرور، ماڈل، prompts، بلنگ — کو کسی کے شناختی ریکارڈ سے باہر رکھتا ہے۔ یہی پیشکش ہے: سستا inference نہیں، بلکہ ایسا inference جو کوئی اور نہیں دیکھ سکتا۔
کیا چنیں
context کی جگہ کے ساتھ ایک 30B-کلاس ماڈل کے لیے، Pro-64 (64 GB) آرام دہ انتخاب ہے؛ ایک تنگ quantization Pro-32 یا Pro-48 میں مانتا ہے، ایک بڑا Pro-80 پر جاتا ہے۔ پہلے ماڈل load کریں، resident memory دیکھیں، جو آپ نے ناپا اس سے size چنیں۔ اور توقعات درست رکھیں: یہ نجی batch inference ہے، ایک تیز chat window نہیں۔
تبصرے
ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔