Ollama ایک لوکل ماڈل چلانے کو ایک-لائن انسٹال بنا دیتا ہے۔ یہ ہاؤ-ٹو ہے؛ CPU انفرنس کیا کر سکتا ہے اور کیا نہیں (اور RAG کا بہترین مقام) کی ایماندار تصویر کے لیے دیکھیں Ollama کے لیے VPS یوز-کیس اور Ollama سیلف-ہوسٹ کرنا۔
1. Ollama انسٹال کریں
curl -fsSL https://ollama.com/install.sh | sh
یہ Ollama انسٹال کرتا ہے اور اسے ایک systemd سروس کے طور پر شروع کرتا ہے جو localhost:11434 پر سنتی ہے۔
2. ایک چھوٹا ماڈل کھینچیں اور چلائیں
CPU مشین پر چھوٹے سے شروع کریں:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B ماڈلز CPU پر واقعی قابلِ استعمال ہیں؛ 7–8B چند ٹوکن/سیکنڈ پر چلتے ہیں (بیچ کے لیے ٹھیک، چیٹ کے لیے تکلیف دہ)؛ 13B+ سواپ کریں گے اور رینگیں گے — نہ کریں۔
3. HTTP API کال کریں
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
ایمبیڈنگز CPU کا بہترین مقام ہیں:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. اسے localhost پر رکھیں — ضرورت ہو تو محفوظ طریقے سے ظاہر کریں
Ollama ڈیفالٹ طور پر 127.0.0.1:11434 سے منسلک ہوتا ہے۔ اسے وہیں رکھیں۔ اگر آپ کو کسی اور مشین سے پہنچنا ہو تو سامنے ایک ڈیڈیکیٹڈ-IP پلان پر توثیق والا reverse proxy رکھیں (nginx + HTTPS گائیڈ) یا SSH ٹنل استعمال کریں — بغیر توثیق والے ماڈل اینڈ پوائنٹ کو کبھی عوامی طور پر ظاہر نہ کریں۔
ایماندار حصہ
یہ صرف-CPU انسٹینسز ہیں (کوئی GPU نہیں)۔ چھوٹے کوانٹائزڈ ماڈلز اور ایمبیڈنگز اچھے چلتے ہیں؛ بڑے نہیں۔ Ollama کو پرائیویٹ RAG اسٹیک کے لیے ویکٹر DB کے ساتھ جوڑیں — چھوٹے لوکل ایمبیڈنگز کے ساتھ ایک لوکل ویکٹر اسٹور وہی سیٹ اپ ہے جو یہاں واقعی چمکتا ہے۔ Medium ($12/ماہ، 6 GB) آرام دہ پلان ہے۔ تقریباً ایک منٹ میں root، کوئی KYC نہیں، کرپٹو میں ادائیگی۔
تبصرے
ابھی کوئی تبصرہ نہیں۔ پہلے بنیں۔