हर RAG ट्यूटोरियल कुछ सौ दस्तावेज़ों वाले एक लैपटॉप पर चलता है, और यह अनायास लगता है। फिर आप इसे एक असली कॉर्पस की ओर इंगित करते हैं — एक कंपनी के दस्तावेज़, सालों के टिकट, एक नॉलेज बेस — और अचानक मेमोरी ही पूरी बातचीत है।
RAG CPU से स्केल नहीं करता। यह RAM से स्केल करता है।
इंडेक्स को मेमोरी क्यों चाहिए
पुनर्प्राप्ति हर टेक्स्ट चंक को एक एम्बेडिंग में बदलकर काम करती है — एक वेक्टर, कुछ सौ से एक-दो हज़ार संख्याएँ लंबा। खोज का मतलब आपके क्वेरी वेक्टर की उन सबसे तुलना करना, तेज़। "तेज़" प्रमुख शब्द है: कम लेटेंसी के लिए इंडेक्स को RAM में रहना होता है। डिस्क पर यह काम करता है, पर हर क्वेरी एक जुर्माना चुकाती है, और कम-लेटेंसी पुनर्प्राप्ति ही पहले स्व-होस्ट करने का मक़सद थी।
तो मेमोरी बिल दो चीज़ों से स्केल करता है: आपके पास कितने चंक हैं, और हर वेक्टर कितना चौड़ा है।
असली आँकड़े, मोटे तौर पर
अपना नापें — आयाम और इंडेक्स प्रकार इसे ख़ूब हिलाते हैं — पर एक शुरुआती एहसास के रूप में:
- कुछ लाख एम्बेडिंग — 2–4 GB में आरामदेह। एक निजी नॉलेज बेस, एक अकेले उत्पाद के दस्तावेज़।
- निचले लाखों — ऐप, मॉडल क्लाइंट, और उसके आस-पास OS के साथ, 16–32 GB की योजना बनाएँ। यह एक गंभीर कंपनी नॉलेज बेस या एक बहु-स्रोत RAG है।
- करोड़ों, या उच्च-आयाम वेक्टर — अब आप 48–80 GB पर हैं, और उसके आगे कई बॉक्सों में। बड़ी दस्तावेज़ संपदाएँ, बहु-किरायेदार पुनर्प्राप्ति, या आप एक साथ कई इंडेक्स गर्म रख रहे हैं।
एक मल्टी-एजेंट सिस्टम जो एक बड़ा इंडेक्स भी थामता है, दोनों लागतों को उसी बॉक्स पर जमा करता है — यही है कैसे एक 32 GB प्लान चुपचाप एक 64 GB वाला बन जाता है।
इंजन चुनाव, संक्षेप में
अगर आप पहले से Postgres चलाते हैं, pgvector सबसे कम-मेहनत विकल्प है — यह एक एक्सटेंशन है, निगरानी के लिए एक नई सेवा नहीं। जब आपके पास लाखों वेक्टर हों और तेज़ फ़िल्टर की गई खोज चाहें, Qdrant या Weaviate जैसा एक समर्पित इंजन अलग प्रोसेस कमाता है। पहले दिन इसे ओवर-इंजीनियर न करें; जो आप पहले से चलाते हैं चलाएँ और तभी अलग करें जब खोज असल में धीमी हो।
स्व-होस्ट क्यों करें
दो वजहें जिनसे लोग असल में यह करते हैं, और कोई भी "कुछ डॉलर बचाने" नहीं है:
निजता। एम्बेडिंग अमूर्त नहीं — वे उस टेक्स्ट को एन्कोड करते हैं जिससे वे आए। आपके दस्तावेज़, आपके ग्राहकों की सामग्री, आपके आंतरिक नोट्स, वेक्टर में बदले और एक तीसरे-पक्ष के सर्वरों को भेजे। स्व-होस्टिंग उसे एक मशीन पर रखती है जिसे आप नियंत्रित करते हैं। अगर डेटा इतना संवेदनशील है कि आप बिना KYC क्रिप्टो में भी चुका रहे हैं, एक प्रबंधित वेक्टर क्लाउड पूरा मक़सद पलट देता है।
फ़्लैट लागत। प्रबंधित वेक्टर सेवाएँ संग्रहीत वेक्टर और चलाई क्वेरी के हिसाब से बिल करती हैं। एक VPS एक मासिक संख्या है और आप इसे जितना चाहें हथौड़े मार सकते हैं। पैमाने पर, अनुमेय मीटर को हराता है।
साइज़िंग के लिए इसका क्या मतलब है
अपने कॉर्पस को नापकर शुरू करें, अनुमान लगाकर नहीं। अपनी एम्बेडिंग गिनती और आयाम पाएँ, एक नमूना लोड करें, रहती मेमोरी देखें, बहिर्वेशन करें। फिर इंडेक्स प्लस उसके आस-पास सब कुछ — ऐप, मॉडल क्लाइंट, बढ़ने की जगह — के लिए गुंजाइश वाला एक प्लान चुनें।
निजी रूप से रखे एक-दो मिलियन वेक्टर से आगे किसी भी चीज़ के लिए, Pro लाइन एक डेडिकेटेड IP और रात्रिकालीन बैकअप के साथ 32 से 80 GB चलाती है, जो तब मायने रखता है जब इंडेक्स ही उत्पाद हो और इसे खोना दुखे।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।