EQVPS

VPS پر Ollama کیسے انسٹال کریں (اور اس کی API کال کریں)

VPS پر Ollama انسٹال کریں، ایک چھوٹا ماڈل کھینچیں، اور اس کی HTTP API کال کریں — اس ایماندار نوٹ کے ساتھ کہ یہ CPU مشینیں ہیں، تو چھوٹے کوانٹائزڈ ماڈلز اور ایمبیڈنگز پر رہیں۔ کاپی پیسٹ کمانڈز، اور اسے محفوظ طریقے سے کیسے ظاہر کریں۔

Ollama ایک لوکل ماڈل چلانے کو ایک-لائن انسٹال بنا دیتا ہے۔ یہ ہاؤ-ٹو ہے؛ CPU انفرنس کیا کر سکتا ہے اور کیا نہیں (اور RAG کا بہترین مقام) کی ایماندار تصویر کے لیے دیکھیں Ollama کے لیے VPS یوز-کیس اور Ollama سیلف-ہوسٹ کرنا۔

1. Ollama انسٹال کریں

curl -fsSL https://ollama.com/install.sh | sh

یہ Ollama انسٹال کرتا ہے اور اسے ایک systemd سروس کے طور پر شروع کرتا ہے جو localhost:11434 پر سنتی ہے۔

2. ایک چھوٹا ماڈل کھینچیں اور چلائیں

CPU مشین پر چھوٹے سے شروع کریں:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B ماڈلز CPU پر واقعی قابلِ استعمال ہیں؛ 7–8B چند ٹوکن/سیکنڈ پر چلتے ہیں (بیچ کے لیے ٹھیک، چیٹ کے لیے تکلیف دہ)؛ 13B+ سواپ کریں گے اور رینگیں گے — نہ کریں۔

3. HTTP API کال کریں

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

ایمبیڈنگز CPU کا بہترین مقام ہیں:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. اسے localhost پر رکھیں — ضرورت ہو تو محفوظ طریقے سے ظاہر کریں

Ollama ڈیفالٹ طور پر 127.0.0.1:11434 سے منسلک ہوتا ہے۔ اسے وہیں رکھیں۔ اگر آپ کو کسی اور مشین سے پہنچنا ہو تو سامنے ایک ڈیڈیکیٹڈ-IP پلان پر توثیق والا reverse proxy رکھیں (nginx + HTTPS گائیڈ) یا SSH ٹنل استعمال کریں — بغیر توثیق والے ماڈل اینڈ پوائنٹ کو کبھی عوامی طور پر ظاہر نہ کریں۔

ایماندار حصہ

یہ صرف-CPU انسٹینسز ہیں (کوئی GPU نہیں)۔ چھوٹے کوانٹائزڈ ماڈلز اور ایمبیڈنگز اچھے چلتے ہیں؛ بڑے نہیں۔ Ollama کو پرائیویٹ RAG اسٹیک کے لیے ویکٹر DB کے ساتھ جوڑیں — چھوٹے لوکل ایمبیڈنگز کے ساتھ ایک لوکل ویکٹر اسٹور وہی سیٹ اپ ہے جو یہاں واقعی چمکتا ہے۔ Medium ($12/ماہ، 6 GB) آرام دہ پلان ہے۔ تقریباً ایک منٹ میں root، کوئی KYC نہیں، کرپٹو میں ادائیگی۔

عمومی سوالات

VPS پر Ollama کیسے انسٹال کروں؟

ایک کمانڈ: curl -fsSL https://ollama.com/install.sh | sh۔ پھر ایک چھوٹا ماڈل ollama pull کریں اور ollama run کریں، یا localhost:11434 پر HTTP API کال کریں۔ اقدامات نیچے ہیں۔ CPU VPS پر چھوٹے کوانٹائزڈ ماڈلز (1B–8B) اور ایمبیڈنگز پر رہیں — بڑے ماڈلز کو GPU چاہیے۔

کیا CPU VPS پر ماڈلز تیز ہوں گے؟

چھوٹے ہاں، بڑے نہیں۔ 4-بٹ کوانٹائزیشن پر 7–8B ماڈل پر چند ٹوکن فی سیکنڈ کی توقع رکھیں، اور 1–3B ماڈلز اور ایمبیڈنگ ماڈلز پر واقعی چست کارکردگی۔ بیک گراؤنڈ جابز، درجہ بندی اور RAG پائپ لائنوں کے لیے شاندار — کسی بڑے ماڈل پر تیز انٹرایکٹو چیٹ کے لیے نہیں۔

کیا مجھے Ollama کی API انٹرنیٹ پر ظاہر کرنی چاہیے؟

نہیں۔ اسے localhost:11434 پر رکھیں۔ اگر ریموٹ رسائی درکار ہو تو اسے ڈیڈیکیٹڈ-IP پلان پر توثیق والے reverse proxy کے پیچھے رکھیں، یا SSH ٹنل سے پہنچیں۔ بغیر توثیق والے ماڈل اینڈ پوائنٹ کو کبھی کھلے انٹرنیٹ پر ظاہر نہ کریں۔

مجھے کون سا پلان چاہیے؟

ہمارا Medium ($12/ماہ، 6 GB) چھوٹے ماڈلز اور ایمبیڈنگز کے لیے آرام دہ ہے؛ Small ($8) 1–3B ماڈلز آزمانے کے لیے چلتا ہے۔ یہ صرف-CPU انسٹینسز ہیں — کوئی GPU نہیں — تو رفتار کی امید سے نہیں، ماڈل کے RAM فٹ پرنٹ کے مطابق سائز چنیں۔

کیا آپ شناخت یا کارڈ مانگتے ہیں؟

نہیں۔ سائن اپ کے لیے ایک ای میل، USDC یا USDT میں ادائیگی — کوئی دستاویزات نہیں، کوئی کارڈ نہیں۔

تبصرے

ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔

ایک تبصرہ چھوڑیں

تبصرے ظاہر ہونے سے پہلے moderate کیے جاتے ہیں۔