"मेरे AI एजेंट को कितना सर्वर चाहिए?" का ईमानदार जवाब है: आपकी सोच से कम — ठीक उस पल तक जब यह अचानक नहीं होता। तरक़ीब यह जानना है कि आपका कार्यभार उस रेखा के किस ओर बैठता है। तो अंदाज़ा लगाने के बजाय, यहाँ है कि हर तरह का एजेंट असल में क्या इस्तेमाल करता है।
वह एक सवाल जो सब कुछ तय करता है
मॉडल आपके सर्वर पर चलता है, या आपका एजेंट एक मॉडल को एक API पर कॉल करता है?
अगर आपका एजेंट एक होस्टेड LLM से बात करता है (आम मामला), होशियार, महँगा हिस्सा किसी और के हार्डवेयर पर होता है। आपका बॉक्स बस एक ऑर्केस्ट्रेशन लूप चलाता है: इनपुट लें, API कॉल करें, नतीजा पार्स करें, शायद एक डेटाबेस पर पहुँचें, दोहराएँ। यह हल्का है। सचमुच हल्का — एक 1 GB बॉक्स इसे बिना पसीना बहाए करता है।
अगर आप मॉडल स्थानीय रूप से चलाते हैं, सब कुछ बदल जाता है: अब RAM पर मॉडल वज़न हावी हैं, और आप हर कोर चाहेंगे जो पा सकें। ज़्यादातर लोगों को इसकी ज़रूरत नहीं। जिन्हें है वे आमतौर पर ठीक जानते हैं क्यों (निजता, कोई दर सीमा नहीं, ऑफ़लाइन)। अगर वह आप हैं, हमने एक स्थानीय LLM स्व-होस्ट करने पर एक अलग गाइड लिखा है।
कार्यभार के अनुसार साइज़िंग
असली आँकड़े, वह तरह जिस पर आप कार्रवाई कर सकें:
| कार्यभार | RAM | vCPU | डिस्क | नोट्स |
|---|---|---|---|---|
| चैट / असिस्टेंट एजेंट (API-समर्थित) | 1 GB | 2 | 15 GB | लूप नन्हा है; मॉडल रिमोट है |
| स्क्रैपर / डेटा एजेंट | 2 GB | 2 | 25 GB | पार्सिंग + स्क्रैप किए डेटा के लिए गुंजाइश |
| ट्रेडिंग बॉट | 1–2 GB | 2 | 15–25 GB | लेटेंसी आकार से ज़्यादा मायने रखती है — ट्रेडिंग बॉट गाइड देखें |
| कई एजेंट समानांतर | 4 GB | 4 | 35 GB | हर एजेंट सस्ता है; समवर्तीता जुड़ती है |
| स्थानीय LLM, 3B–7B (क्वांटाइज़्ड) | 4–6 GB | 4–6 | 25–45 GB | सिर्फ़-CPU, पठनीय गति से चलता है, थोक नहीं |
पैटर्न: API-समर्थित एजेंट नन्हे हैं; स्थानीय मॉडल ही एकमात्र चीज़ है जो भारी है।
एक CPU बॉक्स कहाँ रुकता है
छत के बारे में सीधे रहना: हमारे प्लान 6 GB RAM और 6 कोर पर, सिर्फ़-CPU — कोई GPU नहीं पर ख़त्म होते हैं। वह ऊपर की तालिका में सब कुछ कवर करता है, निजी उपयोग के लिए एक 7B स्थानीय मॉडल समेत। जो यह नहीं कवर करता: 13B+ मॉडल, उच्च-थ्रूपुट स्थानीय इन्फ़रेंस, या कुछ भी जिसे सच में एक GPU चाहिए। अगर वह आपका कार्यभार है, एक CPU VPS — हमारा या किसी का — ग़लत टूल है, और डिप्लॉय करने के बाद के बजाय यह अभी जानना बेहतर है।
उन 95% एजेंट्स के लिए जो एक API कॉल करते हैं, इसमें से कुछ भी एक समस्या नहीं। वे सबसे छोटे बॉक्स पर ख़ुश हैं।
एक व्यावहारिक अंगूठे का नियम
- बस एक एजेंट जो एक API कॉल करता है? 1 GB / 2 कोर पर शुरू करें। आप बाद में आकार बदल सकते हैं।
- स्क्रैपिंग या डेटा स्टोर करना? 2 GB और एक बड़ी डिस्क।
- कई एजेंट, या एक छोटा स्थानीय मॉडल चला रहे हैं? 4–6 GB और 4+ कोर।
- एक GPU चाहिए? अलग श्रेणी — इसे CPU पर ज़बरदस्ती न डालें।
घबराहट में ओवर-प्रोविज़न न करें। एजेंट स्वभाव से हल्के हैं; एक बहुत-छोटे बॉक्स की लागत एक आकार-बदलाव है, जबकि एक बहुत-बड़े बॉक्स की लागत हर महीने बेकार पड़ी RAM के लिए चुकाना है।
जब आपने एक आकार चुन लिया, एक एजेंट MCP पर बॉक्स ख़ुद किराए पर ले सकता है, या आप इसे साइट पर एक मिनट में ऑर्डर कर सकते हैं। दोनों तरफ़, छोटे से शुरू करें — आपको लगभग निश्चित रूप से उम्मीद से कम चाहिए होगा।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।