"میرے AI agent کو کتنا سرور چاہیے؟" کا ایماندار جواب ہے: آپ کے سوچ سے کم — بالکل اُس وقت تک جب یہ اچانک نہیں ہوتا۔ trick یہ جاننا ہے کہ آپ کا ورک لوڈ اُس لکیر کی کس طرف بیٹھتا ہے۔ تو اندازہ لگانے کے بجائے، یہ رہا کہ ہر قسم کا agent دراصل کیا استعمال کرتا ہے۔
وہ ایک سوال جو سب کچھ فیصلہ کرتا ہے
کیا ماڈل آپ کے سرور پر چلتا ہے، یا آپ کا agent ایک API پر ایک ماڈل کال کرتا ہے؟
اگر آپ کا agent ایک hosted LLM سے بات کرے (عام صورت)، تو ہوشیار، مہنگا حصہ کسی اور کے hardware پر ہوتا ہے۔ آپ کا باکس بس ایک orchestration loop چلاتا ہے: input لو، API کال کرو، نتیجہ parse کرو، شاید ایک database مارو، دہراؤ۔ یہ ہلکا ہے۔ حقیقتاً ہلکا — ایک 1 GB باکس اسے بغیر پسینہ بہائے کرتا ہے۔
اگر آپ ماڈل locally چلائیں، تو سب کچھ بدل جاتا ہے: اب RAM ماڈل weights سے غالب ہے، اور آپ ہر core چاہیں گے جو آپ کو مل سکے۔ زیادہ تر لوگوں کو یہ نہیں چاہیے۔ جنہیں چاہیے وہ عموماً بالکل جانتے ہیں کیوں (نجی پن، کوئی rate limits نہیں، offline)۔ اگر یہ آپ ہیں، تو ہم نے ایک local LLM self-host کرنے پر الگ گائیڈ لکھی۔
ورک لوڈ کے حساب سے sizing
حقیقی نمبر، اُس قسم کے جن پر آپ عمل کر سکیں:
| ورک لوڈ | RAM | vCPU | ڈسک | نوٹ |
|---|---|---|---|---|
| Chat / assistant agent (API-backed) | 1 GB | 2 | 15 GB | loop چھوٹا ہے؛ ماڈل remote |
| Scraper / data agent | 2 GB | 2 | 25 GB | parsing + scraped ڈیٹا کے لیے headroom |
| Trading bot | 1–2 GB | 2 | 15–25 GB | Latency size سے زیادہ اہم — trading bot گائیڈ دیکھیں |
| متوازی کئی agents | 4 GB | 4 | 35 GB | ہر agent سستا ہے؛ concurrency جمع ہوتی ہے |
| Local LLM، 3B–7B (quantized) | 4–6 GB | 4–6 | 25–45 GB | CPU-only، ایک پڑھنے کے قابل رفتار پر چلتا، bulk نہیں |
پیٹرن: API-backed agents چھوٹے ہیں؛ local ماڈل واحد چیز ہیں جو بھاری ہیں۔
کہاں ایک CPU باکس رکتا ہے
چھت پر سیدھا رہتے: ہمارے پلانز 6 GB RAM اور 6 cores، CPU-only — کوئی GPU نہیں پر ختم ہوتے ہیں۔ یہ اوپر کی جدول میں سب کچھ کور کرتا ہے، بشمول ذاتی استعمال کے لیے ایک 7B local ماڈل۔ جو یہ کور نہیں کرتا: 13B+ ماڈل، زیادہ-throughput local inference، یا کچھ بھی جسے حقیقتاً ایک GPU چاہیے۔ اگر یہ آپ کا ورک لوڈ ہے، تو ایک CPU VPS — ہمارا یا کسی کا — غلط اوزار ہے، اور یہ deploy کرنے کے بعد سے اب جاننا بہتر ہے۔
اُن 95% agents کے لیے جو ایک API کال کرتے ہیں، اس میں سے کچھ ایک مسئلہ نہیں۔ وہ سب سے چھوٹے باکس پر خوش ہیں۔
ایک عملی قاعدہ
- بس ایک agent جو ایک API کال کرے؟ 1 GB / 2 cores سے شروع کریں۔ آپ بعد میں resize کر سکتے ہیں۔
- Scraping یا ڈیٹا ذخیرہ؟ 2 GB اور ایک بڑا ڈسک۔
- کئی agents، یا ایک چھوٹا local ماڈل چلا رہے ہیں؟ 4–6 GB اور 4+ cores۔
- ایک GPU چاہیے؟ مختلف قسم — اسے CPU پر مجبور نہ کریں۔
گھبراہٹ سے زیادہ فراہم نہ کریں۔ Agents فطرتاً ہلکے ہیں؛ ایک بہت-چھوٹے باکس کی لاگت ایک resize ہے، جبکہ ایک بہت-بڑے باکس کی لاگت ہر ماہ idle RAM کے لیے ادا کرنا ہے۔
جب آپ ایک size چن لیں، تو ایک agent باکس خود MCP پر کرائے پر لے سکتا ہے، یا آپ اسے سائٹ پر ایک منٹ میں آرڈر کر سکتے ہیں۔ کسی بھی طرح، چھوٹا شروع کریں — آپ کو تقریباً یقیناً اپنی توقع سے کم چاہیے ہوگا۔
تبصرے
ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔