EQVPS

نجی high-memory LLM inference کے لیے VPS

بڑے quantized ماڈلز کو حقیقی RAM درکار ہے، ایسا GPU نہیں جو آپ کے پاس نہیں۔ ایک high-memory CPU باکس کہاں 30B-کلاس ماڈلز نجی طور پر چلاتا ہے، حقیقت میں کیا ممکن ہے، اور کہاں نہیں۔ $70/ماہ سے۔

ہمارے پاس Ollama اور چھوٹے ماڈلز کے لیے ایک الگ صفحہ ہے — وہ $12 CPU باکس ہے جو 1B–8B اور embeddings چلاتا ہے۔ یہ صفحہ دوسرا سرا ہے: وہ ماڈلز اتنے بڑے کہ CPU نہیں، RAM آپ کو روکتی ہے۔

شروع میں ایماندار رہیں، ہر جگہ کی طرح: ہمارے سرورز CPU-only ہیں، کوئی GPU نہیں۔ یہاں ایک بڑا ماڈل آہستہ چلتا ہے۔ اگر آپ ایک 30B ماڈل پر تیز interactive chat چاہتے ہیں، تو آپ کو ایک GPU ہوسٹ درکار ہے — مختلف پروڈکٹ، مختلف پرووائیڈر۔ ایک high-memory CPU باکس جو اچھا کرتا ہے وہ ایک بڑا quantized ماڈل نجی طور پر ایسے کام کے لیے چلانا ہے جو ایک chat window نہیں۔

RAM کا حساب

ماڈل memory میں بیٹھتا ہے، quantized ہو یا نہ، plus context اور runtime کا overhead:

اسی لیے "ایک بڑا local ماڈل چلائیں" دراصل ایک high-memory سوال ہے۔ ماڈل ہی memory footprint ہے۔ اسی ہوسٹ پر ایک RAG index شامل کریں اور نمبر جمع ہو جاتے ہیں۔

کہاں private-first واقعی جیتتا ہے

معاملہ رفتار نہیں اور لاگت نہیں — یہ کہ کچھ ڈیٹا نکل نہیں سکتا۔ قانونی دستاویزات۔ طبی ریکارڈ۔ ملکیتی کوڈ۔ کوئی بھی چیز جہاں prompt کو ایک تیسرے فریق کے API کو بھیجنا ناممکن ہے۔ ایک آہستہ ماڈل جو مکمل طور پر آپ کی مشین پر چلتا ہے اُس تیز کو ہراتا ہے جو آپ کے بھیجے سب کچھ کو log کرتا ہے۔ ہم نے پوری تصویر یہاں لکھی۔

اور اگر ڈیٹا اتنا حساس ہے، تو ادائیگی بھی شاید نجی ہونی چاہیے۔ باکس کو کرپٹو اور no KYC کے ساتھ کرائے پر لینا پوری چین — سرور، ماڈل، prompts، بلنگ — کو کسی کے شناختی ریکارڈ سے باہر رکھتا ہے۔ یہی پیشکش ہے: سستا inference نہیں، بلکہ ایسا inference جو کوئی اور نہیں دیکھ سکتا۔

کیا چنیں

context کی جگہ کے ساتھ ایک 30B-کلاس ماڈل کے لیے، Pro-64 (64 GB) آرام دہ انتخاب ہے؛ ایک تنگ quantization Pro-32 یا Pro-48 میں مانتا ہے، ایک بڑا Pro-80 پر جاتا ہے۔ پہلے ماڈل load کریں، resident memory دیکھیں، جو آپ نے ناپا اس سے size چنیں۔ اور توقعات درست رکھیں: یہ نجی batch inference ہے، ایک تیز chat window نہیں۔

تعینات کے لیے تیار؟ کرپٹو میں ادائیگی کریں، بغیر KYC — تقریباً ایک منٹ میں لائیو۔

ابھی ڈیپلائے کریں →

عمومی سوالات

یہ آپ کے Ollama use-case سے کیسے مختلف ہے؟

Ollama صفحہ ایک $12 CPU باکس پر چھوٹے ماڈلز کے بارے میں ہے — 1B–8B، embeddings، ہلکا کام۔ یہ high-memory سرا ہے: 13B سے 30B-کلاس quantized ماڈلز جنہیں صرف load ہونے کے لیے 24–48 GB یا زیادہ درکار ہے۔ وہی CPU-only حقیقت، بہت بڑا memory footprint، مختلف پلان۔

ایک مخصوص ماڈل کے لیے کتنی RAM؟

ماڈل کو memory میں آنا چاہیے، plus overhead۔ ایک 13B 4-bit ماڈل ~10–16 GB چاہتا ہے؛ 30B-کلاس quantized 24–48 GB تک دھکیلتا ہے؛ بڑا یا زیادہ-درستگی پر جائیں اور آپ 64–80 GB میں ہیں — اس سے آگے، ہمارا کوئی واحد باکس نہیں مانتا۔ اوپر context کے لیے جگہ شامل کریں۔

کیا یہ تیز ہوگا؟

نہیں — یہاں اپنے آپ سے ایماندار رہیں۔ ایک بڑے ماڈل پر CPU inference فی سیکنڈ چند tokens ہے، ایک interactive stream نہیں۔ یہ batch اور background کام کے لیے ٹھیک ہے (رات بھر summarize کریں، ایک queue classify کریں)۔ ایک بڑے ماڈل پر real-time chat کے لیے آپ کو ایک GPU درکار ہے، جو ہم نہیں دیتے۔

ایک API کے بجائے اسے یہاں کیوں چلائیں؟

پرائیویسی۔ آپ کے prompts اور outputs کبھی کسی پرووائیڈر کے سرورز یا logs کو نہیں چھوتے۔ حساس ڈیٹا کے لیے — قانونی، طبی، اندرونی کوڈ — ایک آہستہ نجی ماڈل اُس تیز ماڈل کو ہراتا ہے جو سب کچھ دیکھتا ہے۔ اسے no-KYC کرپٹو ادائیگی کے ساتھ جوڑیں اور پوری چین آپ کی رہتی ہے۔

تبصرے

ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔

ایک تبصرہ چھوڑیں

تبصرے ظاہر ہونے سے پہلے moderate کیے جاتے ہیں۔