EQVPS

VPS पर Ollama कैसे इंस्टॉल करें (और इसकी API कॉल करें)

VPS पर Ollama इंस्टॉल करें, एक छोटा मॉडल पुल करें, और इसकी HTTP API कॉल करें — इस ईमानदार टिप्पणी के साथ कि ये CPU मशीनें हैं, इसलिए छोटे क्वांटाइज़्ड मॉडल और एम्बेडिंग पर टिके रहें। कॉपी-पेस्ट कमांड, और इसे सुरक्षित रूप से कैसे एक्सपोज़ करें।

Ollama एक लोकल मॉडल चलाना एक-लाइन इंस्टॉल बना देता है। यह हाउ-टू है; CPU इन्फ़रेंस क्या कर सकता है और क्या नहीं (और RAG का बेहतरीन मुकाम) की ईमानदार तस्वीर के लिए देखें Ollama के लिए VPS उपयोग-केस और Ollama सेल्फ-होस्ट करना

1. Ollama इंस्टॉल करें

curl -fsSL https://ollama.com/install.sh | sh

यह Ollama इंस्टॉल करता है और इसे एक systemd सेवा के रूप में शुरू करता है जो localhost:11434 पर सुनती है।

2. एक छोटा मॉडल पुल करें और चलाएँ

CPU मशीन पर, छोटे से शुरू करें:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B मॉडल CPU पर सचमुच उपयोगी हैं; 7–8B कुछ टोकन/सेकंड पर चलते हैं (बैच के लिए ठीक, चैट के लिए कष्टदायक); 13B+ स्वैप करेंगे और रेंगेंगे — न करें।

3. HTTP API कॉल करें

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

एम्बेडिंग CPU का बेहतरीन मुकाम है:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. इसे localhost पर रखें — ज़रूरत हो तो सुरक्षित रूप से एक्सपोज़ करें

Ollama डिफ़ॉल्ट रूप से 127.0.0.1:11434 से बंधता है। इसे वहीं रखें। यदि किसी और मशीन से पहुँचना हो, तो डेडिकेटेड-IP प्लान पर सामने प्रमाणीकरण वाला रिवर्स प्रॉक्सी रखें (nginx + HTTPS गाइड) या SSH टनल इस्तेमाल करें — बिना प्रमाणीकरण वाले मॉडल एंडपॉइंट को कभी सार्वजनिक रूप से एक्सपोज़ न करें।

ईमानदार हिस्सा

ये केवल-CPU इंस्टेंस हैं (कोई GPU नहीं)। छोटे क्वांटाइज़्ड मॉडल और एम्बेडिंग अच्छे चलते हैं; बड़े नहीं। Ollama को निजी RAG स्टैक के लिए वेक्टर DB के साथ जोड़ें — छोटे लोकल एम्बेडिंग साथ में एक लोकल वेक्टर स्टोर वही सेटअप है जो यहाँ सचमुच चमकता है। Medium ($12/माह, 6 GB) आरामदायक प्लान है। लगभग एक मिनट में root, कोई KYC नहीं, क्रिप्टो में भुगतान।

सामान्य प्रश्न

VPS पर Ollama कैसे इंस्टॉल करूँ?

एक कमांड: curl -fsSL https://ollama.com/install.sh | sh। फिर एक छोटा मॉडल ollama pull करें और ollama run करें, या localhost:11434 पर HTTP API कॉल करें। कदम नीचे हैं। CPU VPS पर छोटे क्वांटाइज़्ड मॉडल (1B–8B) और एम्बेडिंग पर टिके रहें — बड़े मॉडल को GPU चाहिए।

क्या CPU VPS पर मॉडल तेज़ होंगे?

छोटे हाँ, बड़े नहीं। 4-बिट क्वांटाइज़ेशन पर 7–8B मॉडल पर कुछ टोकन प्रति सेकंड की अपेक्षा करें, और 1–3B मॉडल तथा एम्बेडिंग मॉडल पर सचमुच फुर्तीला प्रदर्शन। बैकग्राउंड जॉब, वर्गीकरण और RAG पाइपलाइनों के लिए शानदार — किसी बड़े मॉडल पर तेज़ इंटरैक्टिव चैट के लिए नहीं।

क्या मुझे Ollama की API इंटरनेट पर एक्सपोज़ करनी चाहिए?

नहीं। इसे localhost:11434 पर रखें। यदि रिमोट एक्सेस चाहिए, तो इसे डेडिकेटेड-IP प्लान पर प्रमाणीकरण वाले रिवर्स प्रॉक्सी के पीछे रखें, या SSH टनल से पहुँचें। बिना प्रमाणीकरण वाले मॉडल एंडपॉइंट को कभी खुले इंटरनेट पर एक्सपोज़ न करें।

मुझे कौन सा प्लान चाहिए?

हमारा Medium ($12/माह, 6 GB) छोटे मॉडल और एम्बेडिंग के लिए आरामदायक है; Small ($8) 1–3B मॉडल परखने के लिए चलता है। ये केवल-CPU इंस्टेंस हैं — कोई GPU नहीं — इसलिए गति की उम्मीद से नहीं, मॉडल के RAM फुटप्रिंट के हिसाब से आकार चुनें।

क्या आप पहचान-पत्र या कार्ड माँगते हैं?

नहीं। साइन अप के लिए एक ईमेल, USDC या USDT में भुगतान — कोई दस्तावेज़ नहीं, कोई कार्ड नहीं।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।