एजेंट होस्टिंग के साथ मैं सबसे अक्सर जो ग़लती देखता हूँ वह ग़लत चीज़ के लिए साइज़िंग है। कोई एक एजेंट चलाता है, यह 400 MB इस्तेमाल करता है, और वे निष्कर्ष निकालते हैं कि एजेंट होस्ट करने में सस्ते हैं। फिर वे एक असली दल तक स्केल करते हैं और बॉक्स सुबह 3 बजे स्वैपिंग शुरू कर देता है।
एक एजेंट सचमुच सस्ता है। वह दिलचस्प मामला नहीं है।
मेमोरी असल में कहाँ जाती है
एक एजेंट जो सिर्फ़ एक मॉडल को API कॉल दागता है, हल्का है — यह ज़्यादातर नेटवर्क का इंतज़ार कर रहा है। आप ऐसे एक दर्जन को एक छोटे प्लान पर चला सकते हैं और कभी नोटिस न करें।
RAM तब ग़ायब होती है जब एजेंट स्टेट थामना शुरू करते हैं। बातचीत का इतिहास जो हर बारी बढ़ता है। एक वर्किंग सेट जिसे कई एजेंट पढ़ते और लिखते हैं। दीर्घकालिक मेमोरी के लिए एक वेक्टर स्टोर उसी प्रोसेस में बैठा। जिस पल आपकी आर्किटेक्चर "API कॉल करो, भूल जाओ" होना बंद होकर "याद रखो, समन्वय करो, सौंपो" बन जाती है, मेमोरी बाधा बन जाती है, CPU नहीं।
CrewAI, LangGraph, AutoGPT-शैली लूप — जैसे-जैसे वे गंभीर होते हैं, सब इसी ओर झुकते हैं। फ़्रेमवर्क RAM नहीं खाता; स्टेट खाता है।
मोटी साइज़िंग, ईमानदारी से
मैं दिखावा नहीं करूँगा कि कोई फ़ॉर्मूला है, क्योंकि नहीं है — यह पूरी तरह इस पर निर्भर है कि हर एजेंट कितना आस-पास रखता है। पर इन्हें चलाने से एक व्यावहारिक एहसास:
- हल्के, API-बद्ध एजेंट — यहाँ आपको Pro बिलकुल नहीं चाहिए; एक NAT या डेडिकेटेड-IP प्लान ($3–20) इसे संभालता है। Pro अपनी जगह तब कमाता है जब साझा स्टेट आपको ~32 GB से आगे धकेलता है।
- 32 GB — एक असली मल्टी-एजेंट सिस्टम के लिए स्वीट स्पॉट: साझा मेमोरी वाले 5–10 एजेंट प्लस एक वेक्टर डेटाबेस जो सच में उपयोगी है। ज़्यादातर लोग यहीं उतरते हैं।
- 64 GB — बड़े बेड़े, लंबे इतिहास, लाखों वेक्टर का मेमोरी इंडेक्स, या कई सह-स्थित सेवाएँ। यहीं एक बॉक्स उन तीन छोटे को बदल देता है जिन्हें आप अन्यथा जुगल करते।
- 80 GB — भारी, मेमोरी-बद्ध काम: बड़े इन-मेमोरी डेटासेट, कई समवर्ती एजेंट, या एजेंट प्लस उसी होस्ट पर स्थानीय मॉडल इन्फ़रेंस।
जहाँ आपको लगता है कि आपको होना चाहिए उससे नीचे शुरू करें। एक दिन htop देखें। जब स्वैप दिखे तब आकार बढ़ाएँ, पहले नहीं — ऊँचा अंदाज़ा बस पैसा बर्बाद करता है।
वह हिस्सा जो ख़रीदना मुश्किल है
यहाँ वह चीज़ है जो इसे अजीब बनाती है: 64 GB RAM किराए पर लेना आसान है। 64 GB क्रिप्टो से और बिना पहचान जाँच के किराए पर लेना नहीं। ज़्यादातर होस्ट जो गंभीर मेमोरी सस्ते में बेचते हैं, वे इसे एक कार्ड और एक KYC फ़ॉर्म के पीछे करते हैं।
अगर आपका एजेंट अपना ख़ुद का सर्वर प्रोविज़न करता है, या कार्यभार ऐसा डेटा छूता है जिसे आप एक नाम से न बाँधना चाहें, तो वह संयोजन — हाई मेमोरी, क्रिप्टो, बिना KYC, और ख़ुद एजेंट द्वारा MCP पर ऑर्डर-योग्य — असली उत्पाद है। यह प्रति गीगाबाइट सस्ता नहीं है, और मैंने अलग से लिखा है कि वह तुलना क्यों गुमराह करती है। यह ऐसी शर्तों पर उपलब्ध है जो लगभग कोई नहीं देता।
तो आप क्या करते हैं
अगर आपके एजेंट हल्के और API-बद्ध हैं, ज़्यादा न सोचें — एक छोटा NAT या डेडिकेटेड-IP प्लान बहुत है, पूरा हाई-मेमोरी सवाल छोड़ दें। अगर आप एक असली बेड़ा चला रहे हैं जो स्टेट थामता है, तो उससे साइज़ करें जो असल में मेमोरी में है, 32 GB पर शुरू करें, और जब ग्राफ़ आपको कहे तब ऊपर बढ़ें।
जब आप वहाँ हों, Pro लाइन एक डेडिकेटेड IP और रात्रिकालीन बैकअप के साथ 32 से 80 GB कवर करती है। वह टियर चुनें जो आपके वर्किंग सेट से मेल खाए, आपकी महत्वाकांक्षाओं से नहीं।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।