Ollama एक लोकल मॉडल चलाना एक-लाइन इंस्टॉल बना देता है। यह हाउ-टू है; CPU इन्फ़रेंस क्या कर सकता है और क्या नहीं (और RAG का बेहतरीन मुकाम) की ईमानदार तस्वीर के लिए देखें Ollama के लिए VPS उपयोग-केस और Ollama सेल्फ-होस्ट करना।
1. Ollama इंस्टॉल करें
curl -fsSL https://ollama.com/install.sh | sh
यह Ollama इंस्टॉल करता है और इसे एक systemd सेवा के रूप में शुरू करता है जो localhost:11434 पर सुनती है।
2. एक छोटा मॉडल पुल करें और चलाएँ
CPU मशीन पर, छोटे से शुरू करें:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B मॉडल CPU पर सचमुच उपयोगी हैं; 7–8B कुछ टोकन/सेकंड पर चलते हैं (बैच के लिए ठीक, चैट के लिए कष्टदायक); 13B+ स्वैप करेंगे और रेंगेंगे — न करें।
3. HTTP API कॉल करें
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
एम्बेडिंग CPU का बेहतरीन मुकाम है:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. इसे localhost पर रखें — ज़रूरत हो तो सुरक्षित रूप से एक्सपोज़ करें
Ollama डिफ़ॉल्ट रूप से 127.0.0.1:11434 से बंधता है। इसे वहीं रखें। यदि किसी और मशीन से पहुँचना हो, तो डेडिकेटेड-IP प्लान पर सामने प्रमाणीकरण वाला रिवर्स प्रॉक्सी रखें (nginx + HTTPS गाइड) या SSH टनल इस्तेमाल करें — बिना प्रमाणीकरण वाले मॉडल एंडपॉइंट को कभी सार्वजनिक रूप से एक्सपोज़ न करें।
ईमानदार हिस्सा
ये केवल-CPU इंस्टेंस हैं (कोई GPU नहीं)। छोटे क्वांटाइज़्ड मॉडल और एम्बेडिंग अच्छे चलते हैं; बड़े नहीं। Ollama को निजी RAG स्टैक के लिए वेक्टर DB के साथ जोड़ें — छोटे लोकल एम्बेडिंग साथ में एक लोकल वेक्टर स्टोर वही सेटअप है जो यहाँ सचमुच चमकता है। Medium ($12/माह, 6 GB) आरामदायक प्लान है। लगभग एक मिनट में root, कोई KYC नहीं, क्रिप्टो में भुगतान।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।