−25%

Windows के सालाना भुगतान पर, 31 अक्टूबर तक। प्लान देखें

EQVPS
शुरू करें

निजी हाई-मेमोरी LLM इन्फ़रेंस के लिए VPS

बड़े क्वांटाइज़्ड मॉडल को असली RAM चाहिए, एक GPU नहीं जो आपके पास नहीं। एक हाई-मेमोरी CPU बॉक्स 30B-श्रेणी मॉडल निजी रूप से कहाँ चलाता है, क्या यथार्थवादी है, और कहाँ नहीं। $70/माह से।

हमारे पास Ollama और छोटे मॉडल के लिए एक अलग पेज है — वह $12 CPU बॉक्स 1B–8B और एम्बेडिंग चलाता है। यह पेज दूसरा छोर है: वे मॉडल इतने बड़े कि RAM, CPU नहीं, वह है जो आपको रोकता है।

पहले ईमानदार रहें, हर जगह की तरह: हमारे सर्वर सिर्फ़-CPU हैं, कोई GPU नहीं। एक बड़ा मॉडल यहाँ धीरे चलता है। अगर आप एक 30B मॉडल पर तेज़ इंटरैक्टिव चैट चाहते हैं, आपको एक GPU होस्ट चाहिए — अलग उत्पाद, अलग प्रदाता। एक हाई-मेमोरी CPU बॉक्स जो अच्छा करता है वह एक बड़ा क्वांटाइज़्ड मॉडल निजी रूप से ऐसे काम के लिए चलाना है जो एक चैट खिड़की नहीं।

RAM गणित

मॉडल मेमोरी में बैठता है, क्वांटाइज़्ड हो या न हो, प्लस संदर्भ और रनटाइम के लिए ओवरहेड:

  • 13B, 4-बिट — मोटे तौर पर 10–16 GB। एक मझोले प्लान पर पहले से चलता है।
  • 30B-श्रेणी, क्वांटाइज़्ड — क्वांटाइज़ेशन पर निर्भर 24–48 GB। यह Pro-32 से Pro-64 क्षेत्र है।
  • बड़ा या उच्च परिशुद्धता — 64–80 GB, और 80 GB से आगे हमारा कोई अकेला बॉक्स फ़िट नहीं। Pro-80 यहाँ छत है।

यही वजह है कि "एक बड़ा स्थानीय मॉडल चलाएँ" सचमुच एक हाई-मेमोरी सवाल है। मॉडल ही मेमोरी फ़ुटप्रिंट है। उसी होस्ट पर एक RAG इंडेक्स जोड़ें और आँकड़े जुड़ते हैं।

निजता-पहले सच में कहाँ जीतता है

मामला रफ़्तार नहीं और लागत नहीं — यह कि कुछ डेटा छोड़ नहीं सकता। क़ानूनी दस्तावेज़। चिकित्सा रिकॉर्ड। मालिकाना कोड। कुछ भी जहाँ प्रॉम्प्ट को एक तीसरे-पक्ष API को भेजना मेज़ से बाहर हो। एक धीमा मॉडल जो पूरी तरह आपकी मशीन पर चलता है एक तेज़ वाले को हराता है जो आप जो भी भेजते हैं सब लॉग करता है। हमने यहाँ पूरी तस्वीर लिखी।

और अगर डेटा इतना संवेदनशील है, भुगतान भी शायद निजी होना चाहिए। बॉक्स को क्रिप्टो और बिना KYC से किराए पर लेना पूरी श्रृंखला — सर्वर, मॉडल, प्रॉम्प्ट, बिलिंग — को किसी की पहचान रिकॉर्ड से दूर रखता है। यही पिच है: सस्ती इन्फ़रेंस नहीं, बल्कि इन्फ़रेंस जिसे कोई और नहीं देख सकता।

क्या चुनें

संदर्भ के लिए जगह वाले एक 30B-श्रेणी मॉडल के लिए, Pro-64 (64 GB) आरामदेह चुनाव है; एक तंग क्वांटाइज़ेशन Pro-32 या Pro-48 में फ़िट होता है, एक बड़ा Pro-80 पर जाता है। पहले मॉडल लोड करें, रहती मेमोरी देखें, जो आपने नापा उससे साइज़ करें। और उम्मीदें सेट करें: यह निजी बैच इन्फ़रेंस है, एक तेज़ चैट खिड़की नहीं।

तैनात करने के लिए तैयार? क्रिप्टो से भुगतान करें, बिना KYC — लगभग एक मिनट में ऑनलाइन।

अभी तैनात करें →

FAQ

यह आपके Ollama उपयोग-मामले से कैसे अलग है?

Ollama पेज एक $12 CPU बॉक्स पर छोटे मॉडल के बारे में है — 1B–8B, एम्बेडिंग, हल्का काम। यह हाई-मेमोरी छोर है: 13B से 30B-श्रेणी क्वांटाइज़्ड मॉडल जिन्हें लोड होने भर के लिए 24–48 GB या ज़्यादा चाहिए। वही सिर्फ़-CPU हक़ीक़त, कहीं बड़ा मेमोरी फ़ुटप्रिंट, अलग प्लान।

एक दिए गए मॉडल के लिए कितनी RAM?

मॉडल को मेमोरी प्लस ओवरहेड में फ़िट होना है। एक 13B 4-बिट मॉडल ~10–16 GB चाहता है; 30B-श्रेणी क्वांटाइज़्ड 24–48 GB धकेलता है; बड़ा या उच्च-परिशुद्धता जाएँ और आप 64–80 GB में हैं — उसके आगे, हमारा कोई अकेला बॉक्स फ़िट नहीं। ऊपर संदर्भ के लिए जगह जोड़ें।

क्या यह तेज़ होगा?

नहीं — यहाँ ख़ुद से ईमानदार रहें। एक बड़े मॉडल पर CPU इन्फ़रेंस कुछ टोकन प्रति सेकंड है, एक इंटरैक्टिव स्ट्रीम नहीं। यह बैच और बैकग्राउंड काम के लिए ठीक है (रातभर संक्षेप करें, एक क़तार वर्गीकृत करें)। एक बड़े मॉडल पर रियल-टाइम चैट के लिए आपको एक GPU चाहिए, जो हम नहीं देते।

इसे एक API के बजाय यहाँ क्यों चलाएँ?

निजता। आपके प्रॉम्प्ट और आउटपुट कभी किसी प्रदाता के सर्वर या लॉग को नहीं छूते। संवेदनशील डेटा के लिए — क़ानूनी, चिकित्सा, आंतरिक कोड — एक धीमा निजी मॉडल एक तेज़ वाले को हराता है जो सब कुछ देखता है। इसे बिना-KYC क्रिप्टो भुगतान के साथ जोड़ें और पूरी श्रृंखला आपकी रहती है।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।