EQVPS

Ollama اور Local LLMs کے لیے VPS

ایک CPU سرور پر چھوٹے language models سیلف-ہوسٹ کریں — نجی، unmetered، کرپٹو میں ادا۔ CPU inference کیا کر سکتا اور کیا نہیں اس پر ایماندار۔ $12/ماہ سے۔

مایوس کن حصہ نمٹا لیں، کیونکہ انٹرنیٹ ایسے صفحات سے بھرا ہے جو نہیں کرتے۔

ہمارے سرورز CPU-only ہیں۔ ہم GPUs نہیں دیتے۔ اس کا مطلب یہاں local LLM کام کی ایک سخت حد ہے، اور دوسرا بہانہ کرنا صرف آپ کا پیسہ ضائع کرے گا۔

CPU پر دراصل کیا کام کرتا ہے

6 vCPU تک اور 6 GB RAM کے ساتھ (ہمارا Medium پلان — $12/ماہ)، آپ چھوٹے quantized models کی رینج میں ہیں:

اگر آپ کو ایک تیز، interactive 70B chat چاہیے، تو آپ کو ایک GPU ہوسٹ درکار ہے — یہ ایک مختلف پرووائیڈر کا ایک مختلف پروڈکٹ ہے، اور آپ کے $12 لینے کے بجائے ہم یہ کہنا بہتر سمجھتے ہیں۔

کہاں ایک CPU باکس واقعی جیتتا ہے

پرائیویسی۔ آپ کی دستاویزات، آپ کے prompts، آپ کے embeddings — کبھی آپ کے کنٹرول والی مشین نہ چھوڑتے، کبھی کسی کا training data نہ بنتے۔ بہت سے لوگوں کے لیے یہی پورا مقصد ہے، اور فی سیکنڈ چند tokens ایک قابلِ قبول سودا ہے۔

لاگت کی پیش گوئی۔ کوئی per-token بل نہیں۔ پچاس ہزار ریکارڈ classify کرتی ایک pipeline پچاس classify کرتی ایک کی وہی لاگت ہے: $12۔

Async کام۔ زیادہ تر مفید LLM کام ایک chat window نہیں۔ یہ ایک queue ہے: انہیں summarize کرو، اُنہیں tag کرو، یہ corpus embed کرو۔ رات بھر ایک backlog چباتا ایک CPU باکس اس میں بالکل اچھا ہے۔

سیٹ اپ

# Ubuntu 24.04 — Medium پلان تجویز کردہ
curl -fsSL https://ollama.com/install.sh | sh

# کچھ چھوٹے سے شروع کریں اور خود دیکھیں
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — CPU کا sweet spot
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama localhost:11434 پر ایک HTTP API پیش کرتا ہے۔ اسے وہیں رکھیں۔ اگر آپ کو اسے کہیں اور سے پہنچنا ہو، تو اسے ایک dedicated-IP پلان پر authentication کے ساتھ ایک reverse proxy کے پیچھے رکھیں — کبھی ایک unauthenticated ماڈل-endpoint کو کھلے انٹرنیٹ پر نہ کھولیں۔

اسے ایک vector database کے ساتھ جوڑیں (Docker میں Qdrant یا pgvector) اور آپ کے پاس ایک $12 باکس پر ایک مکمل نجی RAG اسٹیک ہے۔ وہ امتزاج — چھوٹے local embeddings، local vector store، صرف بھاری generation قدم کے لیے بیرونی API — ایسے ہارڈویئر پر وہ سیٹ اپ ہے جو دراصل معنی رکھتا ہے۔

ایک پلان چننا

استعمالپلانقیمت
Embeddings، 1–3B models، RAG pipelineMedium$12/ماہ
وہی، plus auth کے پیچھے ایک public endpointMedium-IP$20/ماہ
بس چھوٹے models آزماناSmall$8/ماہ

CPU-only، 6 vCPU تک اور 6 GB RAM۔ NVMe اسٹوریج، unmetered ٹریفک، جرمنی یا فن لینڈ۔ کرپٹو ادائیگی، no KYC۔ سالانہ بلنگ بارہ کے بجائے ایک ٹرانسفر ہے۔

متعلقہ مطالعہ


تیار؟ ایک سرور تعینات کریں → — تقریباً ایک منٹ میں چالو، کرپٹو میں ادا، کوئی ID درکار نہیں۔

تعینات کے لیے تیار؟ کرپٹو میں ادائیگی کریں، بغیر KYC — تقریباً ایک منٹ میں لائیو۔

ابھی ڈیپلائے کریں →

عمومی سوالات

کیا میں اس پر Llama 70B چلا سکتا ہوں؟

نہیں۔ ہمارے پلانز CPU-only ہیں 6 GB تک RAM کے ساتھ — یہ چھوٹے quantized models کی رینج ہے (4-bit پر تقریباً 1B–8B)۔ ایک 70B ماڈل کو ایک GPU اور کہیں زیادہ memory درکار ہے۔ ہم GPUs نہیں دیتے، اور آپ کو ایک مایوسی بیچنے کے بجائے ہم یہ کہنا بہتر سمجھتے ہیں۔

CPU inference دراصل کتنی تیز ہے؟

4-bit quantization پر ایک 7–8B ماڈل پر فی سیکنڈ چند tokens کی توقع کریں، اور 1–3B models پر نمایاں طور پر بہتر۔ یہ background jobs، embeddings، classification، اور async pipelines کے لیے ٹھیک ہے۔ ایک چست interactive chat کے لیے ٹھیک نہیں۔

تو یہ دراصل کس چیز کے لیے اچھا ہے؟

نجی embeddings، classification، summarization queues، ایسے RAG pipelines جہاں latency اہم نہیں، اور ڈیٹا کو تیسرے فریق کے APIs سے دور رکھنا۔ نیز: کہیں ایک GPU کرائے پر لینے سے پہلے سیکھنا، آزمانا، اور prototyping۔

کیا آپ ID مانگتے ہیں؟

نہیں۔ register کے لیے ای میل، ادا کرنے کے لیے USDC یا USDT۔ جو اکثر پہلے ہی لوگوں کے ایک نجی ماڈل چاہنے کی وجہ ہے۔

تبصرے

ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔

ایک تبصرہ چھوڑیں

تبصرے ظاہر ہونے سے پہلے moderate کیے جاتے ہیں۔