पहले ईमानदार रहें: अगर आप तेज़, सस्ती, उच्च-गुणवत्ता जनरेशन चाहते हैं, एक API कॉल करें। एक CPU VPS GPU से भरे एक डेटासेंटर को नहीं हराएगा, और जो कोई आपको अन्यथा बताता है वह कुछ बेच रहा है।
तो इन्फ़रेंस बिलकुल स्व-होस्ट क्यों करें? एक वजह, और यह एक अच्छी है: आपके सर्वर पर मॉडल आपके प्रॉम्प्ट कभी कहीं नहीं भेजता।
CPU इन्फ़रेंस असल में कैसी दिखती है
आप पर्याप्त RAM के साथ CPU पर असली मॉडल चला सकते हैं। 4-बिट पर क्वांटाइज़ किया एक 7–8B मॉडल काम करता है। एक 13B काम करता है। अगर आपके पास मेमोरी हो तो आप एक 30B-श्रेणी मॉडल भी धकेल सकते हैं। जो आप नहीं कर सकते वह इसे तेज़ बनाना है — आउटपुट कुछ टोकन प्रति सेकंड में आता है, उस तत्काल स्ट्रीम में नहीं जो एक API देती है।
यही ईमानदार सौदा है। इंटरैक्टिव चैट के लिए यह निराशाजनक है। बैकग्राउंड काम के लिए — रातभर दस्तावेज़ों का सारांश, एक क़तार को वर्गीकृत करना, एक शेड्यूल पर डेटा समृद्ध करना — कुछ टोकन प्रति सेकंड पूरी तरह ठीक है, और कोई घड़ी नहीं देख रहा।
RAM गणित
मॉडल को मेमोरी में बैठना है, क्वांटाइज़्ड हो या न हो, प्लस संदर्भ और रनटाइम के लिए ओवरहेड:
- 7–8B, 4-बिट — लगभग 6–8 GB। एक मझोले प्लान पर चलता है।
- 13B, 4-बिट — मोटे तौर पर 10–16 GB।
- 30B-श्रेणी, क्वांटाइज़्ड — 24–48 GB, क्वांटाइज़ेशन पर निर्भर।
- बड़ा, या उच्च परिशुद्धता — आप जल्दी 64–80 GB में हैं — और 80 GB से आगे कोई अकेला Pro बॉक्स फ़िट नहीं, फिर भी CPU-धीमा।
यही वजह है कि "एक स्थानीय मॉडल चलाएँ" चुपचाप एक हाई-मेमोरी सवाल बन जाता है। मॉडल ही मेमोरी फ़ुटप्रिंट है। उसी बॉक्स पर एक RAG इंडेक्स या एजेंट जोड़ें और आँकड़े जुड़ते हैं।
Ollama बनाम vLLM, संक्षेप में
Ollama आसान दरवाज़ा है — इंस्टॉल करें, ollama run, हो गया। यह एक निजी एकल-उपयोगकर्ता सेटअप के लिए सही टूल है जहाँ आप बस मॉडल उपलब्ध चाहते हैं। vLLM सर्विंग थ्रूपुट के लिए बना है: ज़्यादा सेटअप, समवर्ती लोड में बेहतर, तब सार्थक जब आप असल में वॉल्यूम संभाल रहे हों। Ollama से शुरू करें; vLLM की ओर बढ़ें जब आप असली ट्रैफ़िक सर्व करें।
निजता-पहले सच में कहाँ जीतता है
स्व-होस्टेड इन्फ़रेंस का मामला रफ़्तार या लागत नहीं — यह कि कुछ डेटा छोड़ नहीं सकता। क़ानूनी दस्तावेज़। चिकित्सा रिकॉर्ड। मालिकाना कोड। कुछ भी जहाँ प्रॉम्प्ट को एक तीसरे-पक्ष API को भेजना नीति या भरोसे की वजहों से मेज़ से बाहर हो। एक धीमा मॉडल जो पूरी तरह आपकी मशीन पर चलता है, एक तेज़ वाले को हराता है जो आप जो भी भेजते हैं सब लॉग करता है।
और अगर डेटा इतना संवेदनशील है, भुगतान भी शायद निजी होना चाहिए। बॉक्स को क्रिप्टो और बिना KYC से किराए पर लेना पूरी श्रृंखला — सर्वर, मॉडल, प्रॉम्प्ट, बिलिंग — को किसी की पहचान रिकॉर्ड से दूर रखता है। यही असली पिच है: "सस्ती इन्फ़रेंस" नहीं, बल्कि "इन्फ़रेंस जिसे कोई और नहीं देख सकता।"
लब्बोलुआब
रफ़्तार और गुणवत्ता के लिए, एक API इस्तेमाल करें — इसमें कोई शर्म नहीं। स्व-होस्ट करें जब निजता आवश्यकता हो और धीमा स्वीकार्य हो। मॉडल प्लस उसके संदर्भ प्लस बॉक्स साझा करती किसी भी चीज़ के लिए साइज़ करें, और CPU से GPU रफ़्तार की उम्मीद न करें।
जब मॉडल को असली मेमोरी चाहिए, Pro लाइन एक डेडिकेटेड IP और रात्रिकालीन बैकअप के साथ 32 से 80 GB चलाती है — एक गंभीर क्वांटाइज़्ड मॉडल को उसके आस-पास संदर्भ के लिए जगह के साथ रखने के लिए पर्याप्त।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।