−25%

Windows के सालाना भुगतान पर, 31 अक्टूबर तक। प्लान देखें

EQVPS
शुरू करें

Ollama और स्थानीय LLM के लिए VPS

एक CPU सर्वर पर छोटे भाषा मॉडल स्व-होस्ट करें — निजी, अनमीटर्ड, क्रिप्टो में भुगतान। CPU इन्फ़रेंस क्या कर सकती और क्या नहीं, इस बारे में ईमानदार। $12/माह से।

आइए निराशाजनक हिस्सा रास्ते से हटा दें, क्योंकि इंटरनेट ऐसे पेजों से भरा है जो नहीं करते।

हमारे सर्वर सिर्फ़-CPU हैं। हम GPU नहीं देते। इसका मतलब यहाँ स्थानीय LLM काम की एक सख़्त छत है, और अन्यथा दिखावा करना बस आपका पैसा बर्बाद करेगा।

CPU पर असल में क्या काम करता है

6 vCPU तक और 6 GB RAM (हमारा Medium प्लान — $12/माह) के साथ, आप छोटे क्वांटाइज़्ड मॉडल की सीमा में हैं:

  • 1B–3B मॉडल (Q4): सचमुच उपयोग योग्य। वर्गीकरण, टैगिंग, रूटिंग, और सरल संरचित निष्कर्षण के लिए काफ़ी तेज़।
  • 7B–8B मॉडल (Q4): चलते हैं, पर कुछ टोकन प्रति सेकंड की उम्मीद रखें। एक क़तार के लिए ठीक जो रातभर दस्तावेज़ चबाती है। एक चैट खिड़की के रूप में तकलीफ़देह।
  • एम्बेडिंग मॉडल: उत्कृष्ट फ़िट। वे छोटे हैं, CPU पर तेज़, और यह शायद हमारे जैसे एक बॉक्स पर Ollama चलाने की सबसे अच्छी अकेली वजह है।
  • 13B और ऊपर: न करें। आप स्वैपिंग और इंतज़ार कर रहे होंगे।

अगर आपको एक तेज़, इंटरैक्टिव 70B चैट चाहिए, आपको एक GPU होस्ट चाहिए — वह एक अलग प्रदाता से एक अलग उत्पाद है, और हम आपके $12 लेने के बजाय यह बताना पसंद करते हैं।

एक CPU बॉक्स सचमुच कहाँ जीतता है

निजता। आपके दस्तावेज़, आपके प्रॉम्प्ट, आपके एम्बेडिंग — कभी एक मशीन नहीं छोड़ते जिसे आप नियंत्रित करते हैं, कभी किसी का प्रशिक्षण डेटा नहीं बनते। बहुत से लोगों के लिए वह पूरा मक़सद है, और कुछ टोकन प्रति सेकंड एक स्वीकार्य सौदा है।

लागत अनुमेयता। कोई प्रति-टोकन बिल नहीं। एक पाइपलाइन जो पचास हज़ार रिकॉर्ड वर्गीकृत करती है उतना ही ख़र्च करती है जितना एक जो पचास वर्गीकृत करती है: $12।

Async काम। ज़्यादातर उपयोगी LLM काम एक चैट खिड़की नहीं। यह एक क़तार है: इन्हें संक्षेप करो, उन्हें टैग करो, इस कॉर्पस को एम्बेड करो। एक CPU बॉक्स रातभर एक backlog पीसता उसमें बिलकुल अच्छा है।

सेटअप

# Ubuntu 24.04 — Medium प्लान अनुशंसित
curl -fsSL https://ollama.com/install.sh | sh

# कुछ छोटे से शुरू करें और ख़ुद देखें
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# एम्बेडिंग — CPU के लिए स्वीट स्पॉट
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama localhost:11434 पर एक HTTP API परोसता है। इसे वहीं रखें। अगर आपको इसे कहीं और से पहुँचना है, इसे एक डेडिकेटेड-IP प्लान पर प्रमाणीकरण वाले एक रिवर्स प्रॉक्सी के पीछे रखें — एक अप्रमाणित मॉडल एंडपॉइंट को खुले इंटरनेट पर कभी उजागर न करें।

इसे एक वेक्टर डेटाबेस के साथ जोड़ें (Docker में Qdrant या pgvector) और आपके पास एक $12 बॉक्स पर एक पूरा निजी RAG स्टैक है। वह संयोजन — छोटे स्थानीय एम्बेडिंग, स्थानीय वेक्टर स्टोर, सिर्फ़ भारी जनरेशन क़दम के लिए बाहरी API — वह सेटअप है जो असल में इस जैसे हार्डवेयर पर समझ में आता है।

एक प्लान चुनना

उपयोगप्लानक़ीमत
एम्बेडिंग, 1–3B मॉडल, RAG पाइपलाइनMedium$12/माह
वही, प्लस auth के पीछे एक सार्वजनिक एंडपॉइंटMedium-IP$20/माह
बस छोटे मॉडल परखनाSmall$8/माह

सिर्फ़-CPU, 6 vCPU तक और 6 GB RAM। NVMe स्टोरेज, अनमीटर्ड ट्रैफ़िक, जर्मनी या फ़िनलैंड। क्रिप्टो भुगतान, कोई KYC नहीं। सालाना बिलिंग बारह के बजाय एक ट्रांसफ़र है।

संबंधित पठन


तैयार? एक सर्वर डिप्लॉय करें → — लगभग एक मिनट में लाइव, क्रिप्टो में भुगतान, कोई ID ज़रूरी नहीं।

Open WebUI के लिए VPS: LLM के लिए निजी चैट इंटरफ़ेस →

तैनात करने के लिए तैयार? क्रिप्टो से भुगतान करें, बिना KYC — लगभग एक मिनट में ऑनलाइन।

अभी तैनात करें →

FAQ

क्या मैं इस पर Llama 70B चला सकता हूँ?

नहीं। हमारे प्लान सिर्फ़-CPU हैं 6 GB तक RAM के साथ — वह छोटे क्वांटाइज़्ड मॉडल की सीमा है (4-बिट पर मोटे तौर पर 1B–8B)। एक 70B मॉडल को एक GPU और कहीं ज़्यादा मेमोरी चाहिए। हम GPU नहीं देते, और हम आपको एक निराशा बेचने के बजाय यह कहना पसंद करते हैं।

CPU इन्फ़रेंस सच में कितनी तेज़ है?

4-बिट क्वांटाइज़ेशन पर एक 7–8B मॉडल पर कुछ टोकन प्रति सेकंड की उम्मीद रखें, और 1–3B मॉडल पर ध्यान देने योग्य रूप से बेहतर। यह बैकग्राउंड जॉब, एम्बेडिंग, वर्गीकरण, और async पाइपलाइन के लिए ठीक है। यह एक फुर्तीली इंटरैक्टिव चैट के लिए ठीक नहीं।

तो यह असल में किसके लिए अच्छा है?

निजी एम्बेडिंग, वर्गीकरण, सारांश क़तारें, RAG पाइपलाइन जहाँ लेटेंसी मायने नहीं रखती, और डेटा को तीसरे-पक्ष API से दूर रखना। साथ ही: कहीं एक GPU किराए पर लेने से पहले सीखना, परखना, और प्रोटोटाइप करना।

क्या आप ID माँगते हैं?

नहीं। रजिस्टर को ईमेल, चुकाने को USDC या USDT। जो अक्सर वही वजह है जिससे लोग पहले एक निजी मॉडल चाहते हैं।

टिप्पणियाँ

अभी तक कोई टिप्पणी नहीं। पहले बनें।

एक टिप्पणी छोड़ें

टिप्पणियाँ दिखने से पहले मॉडरेट की जाती हैं।