हमारे पास Ollama और छोटे मॉडल के लिए एक अलग पेज है — वह $12 CPU बॉक्स 1B–8B और एम्बेडिंग चलाता है। यह पेज दूसरा छोर है: वे मॉडल इतने बड़े कि RAM, CPU नहीं, वह है जो आपको रोकता है।
पहले ईमानदार रहें, हर जगह की तरह: हमारे सर्वर सिर्फ़-CPU हैं, कोई GPU नहीं। एक बड़ा मॉडल यहाँ धीरे चलता है। अगर आप एक 30B मॉडल पर तेज़ इंटरैक्टिव चैट चाहते हैं, आपको एक GPU होस्ट चाहिए — अलग उत्पाद, अलग प्रदाता। एक हाई-मेमोरी CPU बॉक्स जो अच्छा करता है वह एक बड़ा क्वांटाइज़्ड मॉडल निजी रूप से ऐसे काम के लिए चलाना है जो एक चैट खिड़की नहीं।
RAM गणित
मॉडल मेमोरी में बैठता है, क्वांटाइज़्ड हो या न हो, प्लस संदर्भ और रनटाइम के लिए ओवरहेड:
- 13B, 4-बिट — मोटे तौर पर 10–16 GB। एक मझोले प्लान पर पहले से चलता है।
- 30B-श्रेणी, क्वांटाइज़्ड — क्वांटाइज़ेशन पर निर्भर 24–48 GB। यह Pro-32 से Pro-64 क्षेत्र है।
- बड़ा या उच्च परिशुद्धता — 64–80 GB, और 80 GB से आगे हमारा कोई अकेला बॉक्स फ़िट नहीं। Pro-80 यहाँ छत है।
यही वजह है कि "एक बड़ा स्थानीय मॉडल चलाएँ" सचमुच एक हाई-मेमोरी सवाल है। मॉडल ही मेमोरी फ़ुटप्रिंट है। उसी होस्ट पर एक RAG इंडेक्स जोड़ें और आँकड़े जुड़ते हैं।
निजता-पहले सच में कहाँ जीतता है
मामला रफ़्तार नहीं और लागत नहीं — यह कि कुछ डेटा छोड़ नहीं सकता। क़ानूनी दस्तावेज़। चिकित्सा रिकॉर्ड। मालिकाना कोड। कुछ भी जहाँ प्रॉम्प्ट को एक तीसरे-पक्ष API को भेजना मेज़ से बाहर हो। एक धीमा मॉडल जो पूरी तरह आपकी मशीन पर चलता है एक तेज़ वाले को हराता है जो आप जो भी भेजते हैं सब लॉग करता है। हमने यहाँ पूरी तस्वीर लिखी।
और अगर डेटा इतना संवेदनशील है, भुगतान भी शायद निजी होना चाहिए। बॉक्स को क्रिप्टो और बिना KYC से किराए पर लेना पूरी श्रृंखला — सर्वर, मॉडल, प्रॉम्प्ट, बिलिंग — को किसी की पहचान रिकॉर्ड से दूर रखता है। यही पिच है: सस्ती इन्फ़रेंस नहीं, बल्कि इन्फ़रेंस जिसे कोई और नहीं देख सकता।
क्या चुनें
संदर्भ के लिए जगह वाले एक 30B-श्रेणी मॉडल के लिए, Pro-64 (64 GB) आरामदेह चुनाव है; एक तंग क्वांटाइज़ेशन Pro-32 या Pro-48 में फ़िट होता है, एक बड़ा Pro-80 पर जाता है। पहले मॉडल लोड करें, रहती मेमोरी देखें, जो आपने नापा उससे साइज़ करें। और उम्मीदें सेट करें: यह निजी बैच इन्फ़रेंस है, एक तेज़ चैट खिड़की नहीं।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।