आइए निराशाजनक हिस्सा रास्ते से हटा दें, क्योंकि इंटरनेट ऐसे पेजों से भरा है जो नहीं करते।
हमारे सर्वर सिर्फ़-CPU हैं। हम GPU नहीं देते। इसका मतलब यहाँ स्थानीय LLM काम की एक सख़्त छत है, और अन्यथा दिखावा करना बस आपका पैसा बर्बाद करेगा।
CPU पर असल में क्या काम करता है
6 vCPU तक और 6 GB RAM (हमारा Medium प्लान — $12/माह) के साथ, आप छोटे क्वांटाइज़्ड मॉडल की सीमा में हैं:
- 1B–3B मॉडल (Q4): सचमुच उपयोग योग्य। वर्गीकरण, टैगिंग, रूटिंग, और सरल संरचित निष्कर्षण के लिए काफ़ी तेज़।
- 7B–8B मॉडल (Q4): चलते हैं, पर कुछ टोकन प्रति सेकंड की उम्मीद रखें। एक क़तार के लिए ठीक जो रातभर दस्तावेज़ चबाती है। एक चैट खिड़की के रूप में तकलीफ़देह।
- एम्बेडिंग मॉडल: उत्कृष्ट फ़िट। वे छोटे हैं, CPU पर तेज़, और यह शायद हमारे जैसे एक बॉक्स पर Ollama चलाने की सबसे अच्छी अकेली वजह है।
- 13B और ऊपर: न करें। आप स्वैपिंग और इंतज़ार कर रहे होंगे।
अगर आपको एक तेज़, इंटरैक्टिव 70B चैट चाहिए, आपको एक GPU होस्ट चाहिए — वह एक अलग प्रदाता से एक अलग उत्पाद है, और हम आपके $12 लेने के बजाय यह बताना पसंद करते हैं।
एक CPU बॉक्स सचमुच कहाँ जीतता है
निजता। आपके दस्तावेज़, आपके प्रॉम्प्ट, आपके एम्बेडिंग — कभी एक मशीन नहीं छोड़ते जिसे आप नियंत्रित करते हैं, कभी किसी का प्रशिक्षण डेटा नहीं बनते। बहुत से लोगों के लिए वह पूरा मक़सद है, और कुछ टोकन प्रति सेकंड एक स्वीकार्य सौदा है।
लागत अनुमेयता। कोई प्रति-टोकन बिल नहीं। एक पाइपलाइन जो पचास हज़ार रिकॉर्ड वर्गीकृत करती है उतना ही ख़र्च करती है जितना एक जो पचास वर्गीकृत करती है: $12।
Async काम। ज़्यादातर उपयोगी LLM काम एक चैट खिड़की नहीं। यह एक क़तार है: इन्हें संक्षेप करो, उन्हें टैग करो, इस कॉर्पस को एम्बेड करो। एक CPU बॉक्स रातभर एक backlog पीसता उसमें बिलकुल अच्छा है।
सेटअप
# Ubuntu 24.04 — Medium प्लान अनुशंसित
curl -fsSL https://ollama.com/install.sh | sh
# कुछ छोटे से शुरू करें और ख़ुद देखें
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# एम्बेडिंग — CPU के लिए स्वीट स्पॉट
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama localhost:11434 पर एक HTTP API परोसता है। इसे वहीं रखें। अगर आपको इसे कहीं और से पहुँचना है, इसे एक डेडिकेटेड-IP प्लान पर प्रमाणीकरण वाले एक रिवर्स प्रॉक्सी के पीछे रखें — एक अप्रमाणित मॉडल एंडपॉइंट को खुले इंटरनेट पर कभी उजागर न करें।
इसे एक वेक्टर डेटाबेस के साथ जोड़ें (Docker में Qdrant या pgvector) और आपके पास एक $12 बॉक्स पर एक पूरा निजी RAG स्टैक है। वह संयोजन — छोटे स्थानीय एम्बेडिंग, स्थानीय वेक्टर स्टोर, सिर्फ़ भारी जनरेशन क़दम के लिए बाहरी API — वह सेटअप है जो असल में इस जैसे हार्डवेयर पर समझ में आता है।
एक प्लान चुनना
| उपयोग | प्लान | क़ीमत |
|---|---|---|
| एम्बेडिंग, 1–3B मॉडल, RAG पाइपलाइन | Medium | $12/माह |
| वही, प्लस auth के पीछे एक सार्वजनिक एंडपॉइंट | Medium-IP | $20/माह |
| बस छोटे मॉडल परखना | Small | $8/माह |
सिर्फ़-CPU, 6 vCPU तक और 6 GB RAM। NVMe स्टोरेज, अनमीटर्ड ट्रैफ़िक, जर्मनी या फ़िनलैंड। क्रिप्टो भुगतान, कोई KYC नहीं। सालाना बिलिंग बारह के बजाय एक ट्रांसफ़र है।
संबंधित पठन
- AI मेमोरी के लिए एक वेक्टर DB होस्ट करें — एक निजी RAG स्टैक का दूसरा आधा
- AI एजेंट्स के लिए VPS — उसी बॉक्स पर ऑर्केस्ट्रेशन
तैयार? एक सर्वर डिप्लॉय करें → — लगभग एक मिनट में लाइव, क्रिप्टो में भुगतान, कोई ID ज़रूरी नहीं।
टिप्पणियाँ
अभी तक कोई टिप्पणी नहीं। पहले बनें।