हर प्रॉम्प्ट को किसी और के API को भेजना ठीक है — जब तक नहीं। शायद डेटा संवेदनशील है और आप चाहेंगे कि यह कभी आपके सर्वर से न निकले। शायद आप दर सीमाओं से, या एक मॉडल संस्करण के आपके पैरों तले बदलने से, या प्रयोग करते वक़्त एक प्रति-टोकन मीटर के टिकने से थक गए हैं। किसी बिंदु पर "अगर मैं बस अपना ख़ुद का चलाऊँ तो?" एक विचार प्रयोग होना बंद कर देता है।
Ollama उसे सचमुच आसान बनाता है। कठिन सवाल है एक VPS पर क्या फ़िट बैठता है — और यहाँ ईमानदार जवाब अतिशयोक्ति से ज़्यादा मायने रखता है।
आप CPU पर असल में क्या चला सकते हैं
कोई GPU नहीं? तो आप CPU इन्फ़रेंस कर रहे हैं, और मॉडल आकार सब कुछ है। क्वांटाइज़ेशन (वज़न को 4-बिट तक निचोड़ना) वह है जो इसे व्यावहारिक बनाता है — आप गुणवत्ता का एक टुकड़ा खोते हैं और मेमोरी का एक ढेर बचाते हैं।
मोटे आँकड़े, वे जो मायने रखते हैं:
- 3B मॉडल, 4-बिट — ~3 GB RAM। चैट और सरल कामों के लिए काफ़ी तेज़।
- 7B मॉडल, 4-बिट — ~5 GB RAM। स्वीट स्पॉट: ध्यान देने योग्य रूप से होशियार, फिर भी एक पठनीय गति से चलता है।
- 13B और ऊपर — 8-10 GB+ और CPU पर धीमा। तकनीकी रूप से संभव, व्यावहारिक रूप से परेशान करने वाला।
रफ़्तार, ईमानदारी से: कुछ vCPU पर आप कुछ टोकन प्रति सेकंड देखेंगे। एक चैटबॉट या एक कोडिंग सहायक के लिए बिलकुल ठीक जहाँ आप टाइप होते हुए पढ़ते हैं। दस लाख दस्तावेज़ों को बैच-प्रोसेस करने के लिए ठीक नहीं — वह एक GPU काम है, और हम अन्यथा दिखावा नहीं करते। हम GPU इंस्टेंस नहीं देते। अगर आपके प्लान को एक 70B मॉडल या भारी थ्रूपुट चाहिए, एक CPU VPS — हमारा या किसी का — ग़लत टूल है, और आपको यह एक पैसा ख़र्च करने से पहले जानना चाहिए।
पर एक निजी 7B जो आपके सवालों का जवाब देता है और कभी घर फ़ोन नहीं करता? वह एक 6 GB बॉक्स पर आराम से चलता है।
इंस्टॉल — तीन कमांड
सर्वर खड़ा करें, SSH करें, और:
curl -fsSL https://ollama.com/install.sh | sh # Ollama इंस्टॉल करता है
ollama run llama3.2:3b # एक 3B मॉडल खींचता + चलाता है
बस इतना ही — आप टर्मिनल में चैट कर रहे हैं। इसे अपने ख़ुद के कोड से इस्तेमाल करने के लिए, Ollama पहले से पोर्ट 11434 पर एक HTTP API सर्व करता है:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
पहले से जानने लायक एक पेच: डिफ़ॉल्ट रूप से वह API localhost से बँधता है। इसे वैसा ही रखें और SSH पर टनल करें, वरना यह इंटरनेट को उजागर है। अगर आप इसे पहुँच योग्य चाहें, इसे auth के पीछे रखें — एक सार्वजनिक IP पर एक खुला मॉडल एंडपॉइंट न छोड़ें।
बॉक्स चुनना
प्लान को मॉडल से मिलाएँ, उल्टा नहीं:
| आप क्या चलाना चाहते हैं | जो RAM आपको चाहिए | समझदार प्लान |
|---|---|---|
| 3B मॉडल, हल्का उपयोग | ~3 GB | Small (4 GB) |
| 7B मॉडल, आराम से | ~5-6 GB | Medium (6 GB) |
| बड़ा / उच्च थ्रूपुट | GPU क्षेत्र | एक CPU VPS नहीं |
ज़्यादातर स्व-होस्टर के लिए, Medium (6 GB) ईमानदार सिफ़ारिश है — एक 7B मॉडल प्लस आपके ऐप और OS के लिए पर्याप्त गुंजाइश। Small (4 GB) काम करता है अगर आप 3B तक रहें। उससे नीचे कुछ भी तंग है जब OS और संदर्भ खा जाते हैं।
इसे यहाँ क्यों करें
अगर आप एक LLM स्व-होस्ट कर रहे हैं, निजता आमतौर पर आधी वजह है — तो बॉक्स किराए पर लेने के लिए अपनी ID सौंपना अजीब होगा। आपको नहीं करना: आप USDC या USDT में चुका सकते हैं (या ऑन-रैंप के ज़रिए एक कार्ड), कोई KYC नहीं, और सर्वर लगभग एक मिनट में आपका है। क्रिप्टो-नेटिव, एजेंट-अनुकूल, और डेटा एक मशीन पर रहता है जिसे आप नियंत्रित करते हैं।
समझौता वही है जिस बारे में हम ईमानदार रहे: सिर्फ़ CPU, एक 6 GB छत, छोटे मॉडल। उसके भीतर, स्व-होस्टिंग बढ़िया है। उसके बाहर, किसी को आपको एक ऐसे काम के लिए एक CPU बॉक्स न बेचने दें जिसे एक GPU चाहिए।
आज़माने को तैयार? एक प्लान चुनें, चुकाएँ, और आपके पास लगभग 60 सेकंड में root होगा — फिर यह आपके ख़ुद के निजी मॉडल तक तीन कमांड है।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।