−25%

Windows के सालाना भुगतान पर, 31 अक्टूबर तक। प्लान देखें

EQVPS
शुरू करें

Ollama के साथ एक VPS पर एक स्थानीय LLM स्व-होस्ट करना — असल में क्या काम करता है

14 जून 2026 · 4 मिनट पढ़ने में · EQVPS Team

हर प्रॉम्प्ट को किसी और के API को भेजना ठीक है — जब तक नहीं। शायद डेटा संवेदनशील है और आप चाहेंगे कि यह कभी आपके सर्वर से न निकले। शायद आप दर सीमाओं से, या एक मॉडल संस्करण के आपके पैरों तले बदलने से, या प्रयोग करते वक़्त एक प्रति-टोकन मीटर के टिकने से थक गए हैं। किसी बिंदु पर "अगर मैं बस अपना ख़ुद का चलाऊँ तो?" एक विचार प्रयोग होना बंद कर देता है।

Ollama उसे सचमुच आसान बनाता है। कठिन सवाल है एक VPS पर क्या फ़िट बैठता है — और यहाँ ईमानदार जवाब अतिशयोक्ति से ज़्यादा मायने रखता है।

आप CPU पर असल में क्या चला सकते हैं

कोई GPU नहीं? तो आप CPU इन्फ़रेंस कर रहे हैं, और मॉडल आकार सब कुछ है। क्वांटाइज़ेशन (वज़न को 4-बिट तक निचोड़ना) वह है जो इसे व्यावहारिक बनाता है — आप गुणवत्ता का एक टुकड़ा खोते हैं और मेमोरी का एक ढेर बचाते हैं।

मोटे आँकड़े, वे जो मायने रखते हैं:

  • 3B मॉडल, 4-बिट — ~3 GB RAM। चैट और सरल कामों के लिए काफ़ी तेज़।
  • 7B मॉडल, 4-बिट — ~5 GB RAM। स्वीट स्पॉट: ध्यान देने योग्य रूप से होशियार, फिर भी एक पठनीय गति से चलता है।
  • 13B और ऊपर — 8-10 GB+ और CPU पर धीमा। तकनीकी रूप से संभव, व्यावहारिक रूप से परेशान करने वाला।

रफ़्तार, ईमानदारी से: कुछ vCPU पर आप कुछ टोकन प्रति सेकंड देखेंगे। एक चैटबॉट या एक कोडिंग सहायक के लिए बिलकुल ठीक जहाँ आप टाइप होते हुए पढ़ते हैं। दस लाख दस्तावेज़ों को बैच-प्रोसेस करने के लिए ठीक नहीं — वह एक GPU काम है, और हम अन्यथा दिखावा नहीं करते। हम GPU इंस्टेंस नहीं देते। अगर आपके प्लान को एक 70B मॉडल या भारी थ्रूपुट चाहिए, एक CPU VPS — हमारा या किसी का — ग़लत टूल है, और आपको यह एक पैसा ख़र्च करने से पहले जानना चाहिए।

पर एक निजी 7B जो आपके सवालों का जवाब देता है और कभी घर फ़ोन नहीं करता? वह एक 6 GB बॉक्स पर आराम से चलता है।

इंस्टॉल — तीन कमांड

सर्वर खड़ा करें, SSH करें, और:

curl -fsSL https://ollama.com/install.sh | sh   # Ollama इंस्टॉल करता है
ollama run llama3.2:3b                            # एक 3B मॉडल खींचता + चलाता है

बस इतना ही — आप टर्मिनल में चैट कर रहे हैं। इसे अपने ख़ुद के कोड से इस्तेमाल करने के लिए, Ollama पहले से पोर्ट 11434 पर एक HTTP API सर्व करता है:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

पहले से जानने लायक एक पेच: डिफ़ॉल्ट रूप से वह API localhost से बँधता है। इसे वैसा ही रखें और SSH पर टनल करें, वरना यह इंटरनेट को उजागर है। अगर आप इसे पहुँच योग्य चाहें, इसे auth के पीछे रखें — एक सार्वजनिक IP पर एक खुला मॉडल एंडपॉइंट न छोड़ें।

बॉक्स चुनना

प्लान को मॉडल से मिलाएँ, उल्टा नहीं:

आप क्या चलाना चाहते हैंजो RAM आपको चाहिएसमझदार प्लान
3B मॉडल, हल्का उपयोग~3 GBSmall (4 GB)
7B मॉडल, आराम से~5-6 GBMedium (6 GB)
बड़ा / उच्च थ्रूपुटGPU क्षेत्रएक CPU VPS नहीं

ज़्यादातर स्व-होस्टर के लिए, Medium (6 GB) ईमानदार सिफ़ारिश है — एक 7B मॉडल प्लस आपके ऐप और OS के लिए पर्याप्त गुंजाइश। Small (4 GB) काम करता है अगर आप 3B तक रहें। उससे नीचे कुछ भी तंग है जब OS और संदर्भ खा जाते हैं।

इसे यहाँ क्यों करें

अगर आप एक LLM स्व-होस्ट कर रहे हैं, निजता आमतौर पर आधी वजह है — तो बॉक्स किराए पर लेने के लिए अपनी ID सौंपना अजीब होगा। आपको नहीं करना: आप USDC या USDT में चुका सकते हैं (या ऑन-रैंप के ज़रिए एक कार्ड), कोई KYC नहीं, और सर्वर लगभग एक मिनट में आपका है। क्रिप्टो-नेटिव, एजेंट-अनुकूल, और डेटा एक मशीन पर रहता है जिसे आप नियंत्रित करते हैं।

समझौता वही है जिस बारे में हम ईमानदार रहे: सिर्फ़ CPU, एक 6 GB छत, छोटे मॉडल। उसके भीतर, स्व-होस्टिंग बढ़िया है। उसके बाहर, किसी को आपको एक ऐसे काम के लिए एक CPU बॉक्स न बेचने दें जिसे एक GPU चाहिए।

आज़माने को तैयार? एक प्लान चुनें, चुकाएँ, और आपके पास लगभग 60 सेकंड में root होगा — फिर यह आपके ख़ुद के निजी मॉडल तक तीन कमांड है।

FAQ

क्या मैं बिना GPU के एक LLM चला सकता हूँ?

हाँ, छोटे मॉडल के लिए। 4-बिट क्वांटाइज़ेशन में एक 3B या 7B मॉडल CPU पर चलता है और एक पठनीय गति से जवाब देता है — एक चैटबॉट, एक कोडिंग हेल्पर, या बैकग्राउंड कामों के लिए ठीक जहाँ आप कर्सर नहीं देख रहे। CPU पर आप जो नहीं कर सकते वह एक बड़ा मॉडल (13B और ऊपर) सर्व करना या उच्च थ्रूपुट धकेलना है; वहीं एक GPU वैकल्पिक होना बंद कर देता है।

Llama 7B के लिए मुझे कितनी RAM चाहिए?

एक 4-बिट 7B मॉडल के लिए लगभग 5 GB जब आप संदर्भ खिड़की और OS जोड़ें — तो एक 6 GB बॉक्स आरामदेह तल है। एक 3B मॉडल लगभग 3 GB में फ़िट होता है। छोटा क्वांट (Q4) थोड़ी गुणवत्ता को कहीं कम मेमोरी के बदले देता है, जो एक VPS पर सही सौदा है।

क्या एक LLM स्व-होस्ट करना एक API से सस्ता है?

यह वॉल्यूम पर निर्भर। एक होस्टेड API प्रति टोकन लेता है और निष्क्रिय होने पर कुछ नहीं ख़र्च करता; एक VPS एक फ़्लैट मासिक बिल है चाहे आप इसे इस्तेमाल करें या न करें। अगर आप अनुरोधों की एक स्थिर धारा चलाते हैं, या आप मुख्य रूप से निजता और कोई दर सीमा नहीं की परवाह करते हैं, स्व-होस्टिंग जीतती है। कभी-कभार एक-बार के प्रॉम्प्ट के लिए, एक मीटर किया API सस्ता है।

एक क्लाउड API इस्तेमाल करने के बजाय स्व-होस्ट क्यों?

तीन वजहें जिनसे लोग असल में करते हैं: डेटा कभी आपके सर्वर से नहीं निकलता (क़ानूनी, चिकित्सा, या बस निजी नोट्स के लिए असली), कोई दर सीमा या प्रति-टोकन मीटर नहीं, और मॉडल आपके नीचे बदलेगा या अप्रचलित नहीं होगा। लागत यह है कि आप बॉक्स प्रबंधित करते हैं और उसके हार्डवेयर के भीतर रहते हैं।

एक CPU VPS पर मैं यथार्थवादी रूप से सबसे बड़ा कौन-सा मॉडल चला सकता हूँ?

एक 6 GB बॉक्स पर 4-बिट में एक 7B मॉडल स्वीट स्पॉट है। आप तकनीकी रूप से पर्याप्त RAM के साथ एक 13B लोड कर सकते हैं, पर CPU पर यह इतना धीमा हो जाता है कि आप इसे महसूस करेंगे। उसके आगे आप एक GPU चाहते हैं, जो एक अलग तरह का होस्ट है।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।