−25%

Windows के सालाना भुगतान पर, 31 अक्टूबर तक। प्लान देखें

EQVPS
शुरू करें

बड़े पैमाने पर स्व-होस्टेड RAG: एक वेक्टर इंडेक्स असल में कितनी RAM खाता है

9 अग॰ 2026 · 3 मिनट पढ़ने में · EQVPS Team

हर RAG ट्यूटोरियल कुछ सौ दस्तावेज़ों वाले एक लैपटॉप पर चलता है, और यह अनायास लगता है। फिर आप इसे एक असली कॉर्पस की ओर इंगित करते हैं — एक कंपनी के दस्तावेज़, सालों के टिकट, एक नॉलेज बेस — और अचानक मेमोरी ही पूरी बातचीत है।

RAG CPU से स्केल नहीं करता। यह RAM से स्केल करता है।

इंडेक्स को मेमोरी क्यों चाहिए

पुनर्प्राप्ति हर टेक्स्ट चंक को एक एम्बेडिंग में बदलकर काम करती है — एक वेक्टर, कुछ सौ से एक-दो हज़ार संख्याएँ लंबा। खोज का मतलब आपके क्वेरी वेक्टर की उन सबसे तुलना करना, तेज़। "तेज़" प्रमुख शब्द है: कम लेटेंसी के लिए इंडेक्स को RAM में रहना होता है। डिस्क पर यह काम करता है, पर हर क्वेरी एक जुर्माना चुकाती है, और कम-लेटेंसी पुनर्प्राप्ति ही पहले स्व-होस्ट करने का मक़सद थी।

तो मेमोरी बिल दो चीज़ों से स्केल करता है: आपके पास कितने चंक हैं, और हर वेक्टर कितना चौड़ा है।

असली आँकड़े, मोटे तौर पर

अपना नापें — आयाम और इंडेक्स प्रकार इसे ख़ूब हिलाते हैं — पर एक शुरुआती एहसास के रूप में:

  • कुछ लाख एम्बेडिंग — 2–4 GB में आरामदेह। एक निजी नॉलेज बेस, एक अकेले उत्पाद के दस्तावेज़।
  • निचले लाखों — ऐप, मॉडल क्लाइंट, और उसके आस-पास OS के साथ, 16–32 GB की योजना बनाएँ। यह एक गंभीर कंपनी नॉलेज बेस या एक बहु-स्रोत RAG है।
  • करोड़ों, या उच्च-आयाम वेक्टर — अब आप 48–80 GB पर हैं, और उसके आगे कई बॉक्सों में। बड़ी दस्तावेज़ संपदाएँ, बहु-किरायेदार पुनर्प्राप्ति, या आप एक साथ कई इंडेक्स गर्म रख रहे हैं।

एक मल्टी-एजेंट सिस्टम जो एक बड़ा इंडेक्स भी थामता है, दोनों लागतों को उसी बॉक्स पर जमा करता है — यही है कैसे एक 32 GB प्लान चुपचाप एक 64 GB वाला बन जाता है।

इंजन चुनाव, संक्षेप में

अगर आप पहले से Postgres चलाते हैं, pgvector सबसे कम-मेहनत विकल्प है — यह एक एक्सटेंशन है, निगरानी के लिए एक नई सेवा नहीं। जब आपके पास लाखों वेक्टर हों और तेज़ फ़िल्टर की गई खोज चाहें, Qdrant या Weaviate जैसा एक समर्पित इंजन अलग प्रोसेस कमाता है। पहले दिन इसे ओवर-इंजीनियर न करें; जो आप पहले से चलाते हैं चलाएँ और तभी अलग करें जब खोज असल में धीमी हो।

स्व-होस्ट क्यों करें

दो वजहें जिनसे लोग असल में यह करते हैं, और कोई भी "कुछ डॉलर बचाने" नहीं है:

निजता। एम्बेडिंग अमूर्त नहीं — वे उस टेक्स्ट को एन्कोड करते हैं जिससे वे आए। आपके दस्तावेज़, आपके ग्राहकों की सामग्री, आपके आंतरिक नोट्स, वेक्टर में बदले और एक तीसरे-पक्ष के सर्वरों को भेजे। स्व-होस्टिंग उसे एक मशीन पर रखती है जिसे आप नियंत्रित करते हैं। अगर डेटा इतना संवेदनशील है कि आप बिना KYC क्रिप्टो में भी चुका रहे हैं, एक प्रबंधित वेक्टर क्लाउड पूरा मक़सद पलट देता है।

फ़्लैट लागत। प्रबंधित वेक्टर सेवाएँ संग्रहीत वेक्टर और चलाई क्वेरी के हिसाब से बिल करती हैं। एक VPS एक मासिक संख्या है और आप इसे जितना चाहें हथौड़े मार सकते हैं। पैमाने पर, अनुमेय मीटर को हराता है।

साइज़िंग के लिए इसका क्या मतलब है

अपने कॉर्पस को नापकर शुरू करें, अनुमान लगाकर नहीं। अपनी एम्बेडिंग गिनती और आयाम पाएँ, एक नमूना लोड करें, रहती मेमोरी देखें, बहिर्वेशन करें। फिर इंडेक्स प्लस उसके आस-पास सब कुछ — ऐप, मॉडल क्लाइंट, बढ़ने की जगह — के लिए गुंजाइश वाला एक प्लान चुनें।

निजी रूप से रखे एक-दो मिलियन वेक्टर से आगे किसी भी चीज़ के लिए, Pro लाइन एक डेडिकेटेड IP और रात्रिकालीन बैकअप के साथ 32 से 80 GB चलाती है, जो तब मायने रखता है जब इंडेक्स ही उत्पाद हो और इसे खोना दुखे।

FAQ

RAG को इतनी RAM क्यों चाहिए?

तेज़ वेक्टर खोज इंडेक्स को मेमोरी में रहते चाहती है। हर दस्तावेज़ चंक एक एम्बेडिंग बन जाता है — कुछ सौ से एक-दो हज़ार फ़्लोट का एक वेक्टर — और लाखों चंक पर यह जुड़ता है। इंडेक्स को डिस्क पर धकेलें और खोज लेटेंसी उछलती है; पूरी वजह जिससे आपने स्व-होस्ट किया (रफ़्तार + नियंत्रण) रखने का मतलब इसे RAM में रखना है।

एक दिए गए कॉर्पस के लिए कितनी RAM?

मोटा अंदाज़ा: कुछ लाख एम्बेडिंग 2–4 GB में ठीक बैठते हैं। निचले लाखों, उनके आस-पास ऐप और OS के साथ, और आप 16–32 GB पर हैं। करोड़ों या उच्च-आयाम वेक्टर और आप 48–80 GB में हैं, और उसके आगे आप सर्वरों में बाँटते हैं। आयाम और इंडेक्स प्रकार इसे ख़ूब हिलाते हैं, तो अपना नापें।

pgvector या Qdrant जैसा एक समर्पित इंजन?

अगर आप पहले से Postgres चलाते हैं, pgvector सबसे कम-मेहनत का रास्ता है — एक एक्सटेंशन, एक डेटाबेस। भारी फ़िल्टरिंग वाले लाखों वेक्टर के लिए, एक उद्देश्य-निर्मित इंजन अपनी अलग सेवा कमाता है। जो आप पहले से चलाते हैं उससे शुरू करें; तभी बढ़ें जब खोज धीमी हो।

एक प्रबंधित वेक्टर सेवा के बजाय स्व-होस्ट क्यों?

दो असली वजहें: आपके एम्बेडिंग अक्सर निजी डेटा एन्कोड करते हैं (दस्तावेज़, नोट्स, ग्राहक सामग्री), और स्व-होस्टिंग उसे एक ऐसे सर्वर पर रखती है जिसे आप नियंत्रित करते हैं। और यह फ़्लैट लागत है — प्रबंधित सेवाएँ वेक्टर और क्वेरी के हिसाब से मीटर करती हैं, एक VPS बिना प्रति-क्वेरी बिल के एक मासिक संख्या है।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।