−25%

Windows के सालाना भुगतान पर, 31 अक्टूबर तक। प्लान देखें

EQVPS
शुरू करें

स्थानीय LLM इन्फ़रेंस निजी रूप से होस्ट करना: एक CPU VPS क्या कर सकता और क्या नहीं

9 अग॰ 2026 · 3 मिनट पढ़ने में · EQVPS Team

पहले ईमानदार रहें: अगर आप तेज़, सस्ती, उच्च-गुणवत्ता जनरेशन चाहते हैं, एक API कॉल करें। एक CPU VPS GPU से भरे एक डेटासेंटर को नहीं हराएगा, और जो कोई आपको अन्यथा बताता है वह कुछ बेच रहा है।

तो इन्फ़रेंस बिलकुल स्व-होस्ट क्यों करें? एक वजह, और यह एक अच्छी है: आपके सर्वर पर मॉडल आपके प्रॉम्प्ट कभी कहीं नहीं भेजता।

CPU इन्फ़रेंस असल में कैसी दिखती है

आप पर्याप्त RAM के साथ CPU पर असली मॉडल चला सकते हैं। 4-बिट पर क्वांटाइज़ किया एक 7–8B मॉडल काम करता है। एक 13B काम करता है। अगर आपके पास मेमोरी हो तो आप एक 30B-श्रेणी मॉडल भी धकेल सकते हैं। जो आप नहीं कर सकते वह इसे तेज़ बनाना है — आउटपुट कुछ टोकन प्रति सेकंड में आता है, उस तत्काल स्ट्रीम में नहीं जो एक API देती है।

यही ईमानदार सौदा है। इंटरैक्टिव चैट के लिए यह निराशाजनक है। बैकग्राउंड काम के लिए — रातभर दस्तावेज़ों का सारांश, एक क़तार को वर्गीकृत करना, एक शेड्यूल पर डेटा समृद्ध करना — कुछ टोकन प्रति सेकंड पूरी तरह ठीक है, और कोई घड़ी नहीं देख रहा।

RAM गणित

मॉडल को मेमोरी में बैठना है, क्वांटाइज़्ड हो या न हो, प्लस संदर्भ और रनटाइम के लिए ओवरहेड:

  • 7–8B, 4-बिट — लगभग 6–8 GB। एक मझोले प्लान पर चलता है।
  • 13B, 4-बिट — मोटे तौर पर 10–16 GB।
  • 30B-श्रेणी, क्वांटाइज़्ड — 24–48 GB, क्वांटाइज़ेशन पर निर्भर।
  • बड़ा, या उच्च परिशुद्धता — आप जल्दी 64–80 GB में हैं — और 80 GB से आगे कोई अकेला Pro बॉक्स फ़िट नहीं, फिर भी CPU-धीमा।

यही वजह है कि "एक स्थानीय मॉडल चलाएँ" चुपचाप एक हाई-मेमोरी सवाल बन जाता है। मॉडल ही मेमोरी फ़ुटप्रिंट है। उसी बॉक्स पर एक RAG इंडेक्स या एजेंट जोड़ें और आँकड़े जुड़ते हैं।

Ollama बनाम vLLM, संक्षेप में

Ollama आसान दरवाज़ा है — इंस्टॉल करें, ollama run, हो गया। यह एक निजी एकल-उपयोगकर्ता सेटअप के लिए सही टूल है जहाँ आप बस मॉडल उपलब्ध चाहते हैं। vLLM सर्विंग थ्रूपुट के लिए बना है: ज़्यादा सेटअप, समवर्ती लोड में बेहतर, तब सार्थक जब आप असल में वॉल्यूम संभाल रहे हों। Ollama से शुरू करें; vLLM की ओर बढ़ें जब आप असली ट्रैफ़िक सर्व करें।

निजता-पहले सच में कहाँ जीतता है

स्व-होस्टेड इन्फ़रेंस का मामला रफ़्तार या लागत नहीं — यह कि कुछ डेटा छोड़ नहीं सकता। क़ानूनी दस्तावेज़। चिकित्सा रिकॉर्ड। मालिकाना कोड। कुछ भी जहाँ प्रॉम्प्ट को एक तीसरे-पक्ष API को भेजना नीति या भरोसे की वजहों से मेज़ से बाहर हो। एक धीमा मॉडल जो पूरी तरह आपकी मशीन पर चलता है, एक तेज़ वाले को हराता है जो आप जो भी भेजते हैं सब लॉग करता है।

और अगर डेटा इतना संवेदनशील है, भुगतान भी शायद निजी होना चाहिए। बॉक्स को क्रिप्टो और बिना KYC से किराए पर लेना पूरी श्रृंखला — सर्वर, मॉडल, प्रॉम्प्ट, बिलिंग — को किसी की पहचान रिकॉर्ड से दूर रखता है। यही असली पिच है: "सस्ती इन्फ़रेंस" नहीं, बल्कि "इन्फ़रेंस जिसे कोई और नहीं देख सकता।"

लब्बोलुआब

रफ़्तार और गुणवत्ता के लिए, एक API इस्तेमाल करें — इसमें कोई शर्म नहीं। स्व-होस्ट करें जब निजता आवश्यकता हो और धीमा स्वीकार्य हो। मॉडल प्लस उसके संदर्भ प्लस बॉक्स साझा करती किसी भी चीज़ के लिए साइज़ करें, और CPU से GPU रफ़्तार की उम्मीद न करें।

जब मॉडल को असली मेमोरी चाहिए, Pro लाइन एक डेडिकेटेड IP और रात्रिकालीन बैकअप के साथ 32 से 80 GB चलाती है — एक गंभीर क्वांटाइज़्ड मॉडल को उसके आस-पास संदर्भ के लिए जगह के साथ रखने के लिए पर्याप्त।

FAQ

क्या मैं बिना GPU के एक LLM चला सकता हूँ?

छोटे क्वांटाइज़्ड मॉडल, हाँ — और धीरे। 4-बिट पर क्वांटाइज़ किया एक 7–8B मॉडल पर्याप्त RAM के साथ CPU पर चलता है, पर आप आउटपुट को कुछ टोकन प्रति सेकंड में नापेंगे, उस झटपट स्ट्रीम में नहीं जो आपको एक API से मिलती है। बैच जॉब और बैकग्राउंड काम के लिए ठीक, इंटरैक्टिव चैट के लिए तकलीफ़देह।

स्थानीय इन्फ़रेंस के लिए कितनी RAM?

मॉडल को मेमोरी प्लस ओवरहेड में फ़िट होना है। एक 7–8B 4-बिट मॉडल ~6–8 GB चाहता है; 13B लगभग 10–16 GB; 30B-श्रेणी मॉडल क्वांटाइज़्ड 24–48 GB धकेलते हैं। संदर्भ और बॉक्स पर बाक़ी किसी चीज़ के लिए जगह जोड़ें। यही वजह है कि स्थानीय इन्फ़रेंस जल्दी हाई-मेमोरी क्षेत्र में उतरती है।

Ollama या vLLM?

Ollama आसान ऑन-रैंप है — एक कमांड, मॉडल खींचा, चल रहा। vLLM थ्रूपुट और सर्विंग के लिए है, ज़्यादा सेटअप, लोड में बेहतर। एक निजी एकल-उपयोगकर्ता बॉक्स के लिए, Ollama आमतौर पर सही विकल्प है; vLLM जब आप असल में वॉल्यूम पर अनुरोध सर्व करते हों।

अगर यह धीमा है तो इन्फ़रेंस स्व-होस्ट क्यों करें?

निजता। आपके प्रॉम्प्ट और आउटपुट कभी किसी प्रदाता के सर्वर या लॉग को नहीं छूते। संवेदनशील डेटा के लिए — क़ानूनी, चिकित्सा, आंतरिक कोड, कुछ भी जो आप एक तीसरे-पक्ष को नहीं भेज सकते — एक धीमा निजी मॉडल एक तेज़ वाले को हराता है जो सब कुछ देखता है। इसे बिना-KYC क्रिप्टो भुगतान के साथ जोड़ें और पूरी श्रृंखला आपकी रहती है।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।