Ollama একটি লোকাল মডেল চালানোকে এক-লাইন ইনস্টলে পরিণত করে। এটি হাউ-টু; CPU ইনফারেন্স কী করতে পারে ও পারে না (এবং RAG-এর সেরা জায়গা) তার সৎ চিত্রের জন্য দেখুন Ollama-র জন্য VPS ইউজ-কেস ও Ollama সেল্ফ-হোস্ট করা।
1. Ollama ইনস্টল করুন
curl -fsSL https://ollama.com/install.sh | sh
এটি Ollama ইনস্টল করে এবং একটি systemd সার্ভিস হিসেবে চালু করে যা localhost:11434-এ শোনে।
2. একটি ছোট মডেল পুল করে চালান
CPU মেশিনে ছোট থেকে শুরু করুন:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B মডেল CPU-তে সত্যিই ব্যবহারযোগ্য; 7–8B সেকেন্ডে কয়েকটি টোকেনে চলে (ব্যাচের জন্য ঠিক, চ্যাটের জন্য কষ্টকর); 13B+ সোয়াপ করবে ও হামাগুড়ি দেবে — করবেন না।
3. HTTP API কল করুন
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
এমবেডিং হলো CPU-র সেরা জায়গা:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. localhost-এ রাখুন — দরকার হলে নিরাপদে এক্সপোজ করুন
Ollama ডিফল্টে 127.0.0.1:11434-এ বাইন্ড করে। সেখানেই রাখুন। অন্য মেশিন থেকে পৌঁছাতে হলে সামনে একটি ডেডিকেটেড-IP প্ল্যানে প্রমাণীকরণসহ reverse proxy রাখুন (nginx + HTTPS গাইড) বা SSH টানেল ব্যবহার করুন — প্রমাণীকরণহীন মডেল এন্ডপয়েন্ট কখনো প্রকাশ্যে এক্সপোজ করবেন না।
সৎ অংশ
এগুলো কেবল-CPU ইনস্ট্যান্স (কোনো GPU নেই)। ছোট কোয়ান্টাইজড মডেল ও এমবেডিং ভালো চলে; বড়গুলো নয়। Ollama-কে প্রাইভেট RAG স্ট্যাকের জন্য একটি ভেক্টর DB-র সঙ্গে জুড়ে দিন — ছোট লোকাল এমবেডিং সঙ্গে একটি লোকাল ভেক্টর স্টোর হলো সেই সেটআপ যা এখানে সত্যিই উজ্জ্বল হয়। Medium ($12/মাস, 6 GB) স্বচ্ছন্দ প্ল্যান। প্রায় এক মিনিটে root, কোনো KYC নেই, ক্রিপ্টোতে পেমেন্ট।
মন্তব্য
এখনো কোনো মন্তব্য নেই। প্রথম হোন।