EQVPS

VPS-এ কীভাবে Ollama ইনস্টল করবেন (এবং এর API কল করবেন)

VPS-এ Ollama ইনস্টল করুন, একটি ছোট মডেল পুল করুন, এবং এর HTTP API কল করুন — সৎ নোটসহ যে এগুলো CPU মেশিন, তাই ছোট কোয়ান্টাইজড মডেল ও এমবেডিংয়ে থাকুন। কপি-পেস্ট কমান্ড, এবং এটি নিরাপদে কীভাবে এক্সপোজ করবেন।

Ollama একটি লোকাল মডেল চালানোকে এক-লাইন ইনস্টলে পরিণত করে। এটি হাউ-টু; CPU ইনফারেন্স কী করতে পারে ও পারে না (এবং RAG-এর সেরা জায়গা) তার সৎ চিত্রের জন্য দেখুন Ollama-র জন্য VPS ইউজ-কেসOllama সেল্ফ-হোস্ট করা

1. Ollama ইনস্টল করুন

curl -fsSL https://ollama.com/install.sh | sh

এটি Ollama ইনস্টল করে এবং একটি systemd সার্ভিস হিসেবে চালু করে যা localhost:11434-এ শোনে।

2. একটি ছোট মডেল পুল করে চালান

CPU মেশিনে ছোট থেকে শুরু করুন:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B মডেল CPU-তে সত্যিই ব্যবহারযোগ্য; 7–8B সেকেন্ডে কয়েকটি টোকেনে চলে (ব্যাচের জন্য ঠিক, চ্যাটের জন্য কষ্টকর); 13B+ সোয়াপ করবে ও হামাগুড়ি দেবে — করবেন না।

3. HTTP API কল করুন

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

এমবেডিং হলো CPU-র সেরা জায়গা:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. localhost-এ রাখুন — দরকার হলে নিরাপদে এক্সপোজ করুন

Ollama ডিফল্টে 127.0.0.1:11434-এ বাইন্ড করে। সেখানেই রাখুন। অন্য মেশিন থেকে পৌঁছাতে হলে সামনে একটি ডেডিকেটেড-IP প্ল্যানে প্রমাণীকরণসহ reverse proxy রাখুন (nginx + HTTPS গাইড) বা SSH টানেল ব্যবহার করুন — প্রমাণীকরণহীন মডেল এন্ডপয়েন্ট কখনো প্রকাশ্যে এক্সপোজ করবেন না।

সৎ অংশ

এগুলো কেবল-CPU ইনস্ট্যান্স (কোনো GPU নেই)। ছোট কোয়ান্টাইজড মডেল ও এমবেডিং ভালো চলে; বড়গুলো নয়। Ollama-কে প্রাইভেট RAG স্ট্যাকের জন্য একটি ভেক্টর DB-র সঙ্গে জুড়ে দিন — ছোট লোকাল এমবেডিং সঙ্গে একটি লোকাল ভেক্টর স্টোর হলো সেই সেটআপ যা এখানে সত্যিই উজ্জ্বল হয়। Medium ($12/মাস, 6 GB) স্বচ্ছন্দ প্ল্যান। প্রায় এক মিনিটে root, কোনো KYC নেই, ক্রিপ্টোতে পেমেন্ট।

FAQ

VPS-এ Ollama কীভাবে ইনস্টল করব?

একটি কমান্ড: curl -fsSL https://ollama.com/install.sh | sh। তারপর একটি ছোট মডেল ollama pull করুন ও ollama run করুন, অথবা localhost:11434-এ HTTP API কল করুন। ধাপগুলো নিচে। CPU VPS-এ ছোট কোয়ান্টাইজড মডেল (1B–8B) ও এমবেডিংয়ে থাকুন — বড় মডেলের জন্য GPU লাগে।

CPU VPS-এ মডেল কি দ্রুত হবে?

ছোটগুলো হ্যাঁ, বড়গুলো না। 4-বিট কোয়ান্টাইজেশনে একটি 7–8B মডেলে সেকেন্ডে কয়েকটি টোকেন আশা করুন, আর 1–3B মডেল ও এমবেডিং মডেলে সত্যিই চটপটে পারফরম্যান্স। ব্যাকগ্রাউন্ড জব, শ্রেণিবিভাগ ও RAG পাইপলাইনের জন্য দারুণ — বড় মডেলে দ্রুত ইন্টারঅ্যাকটিভ চ্যাটের জন্য নয়।

Ollama-র API কি ইন্টারনেটে এক্সপোজ করা উচিত?

না। এটি localhost:11434-এ রাখুন। রিমোট অ্যাক্সেস দরকার হলে ডেডিকেটেড-IP প্ল্যানে প্রমাণীকরণসহ একটি reverse proxy-র পেছনে রাখুন, বা SSH টানেল দিয়ে পৌঁছান। প্রমাণীকরণহীন মডেল এন্ডপয়েন্ট কখনো খোলা ইন্টারনেটে এক্সপোজ করবেন না।

আমার কোন প্ল্যান দরকার?

আমাদের Medium ($12/মাস, 6 GB) ছোট মডেল ও এমবেডিংয়ের জন্য স্বচ্ছন্দ; Small ($8) 1–3B মডেল পরীক্ষার জন্য চলে। এগুলো কেবল-CPU ইনস্ট্যান্স — কোনো GPU নেই — তাই গতির আশায় নয়, মডেলের RAM ফুটপ্রিন্ট অনুযায়ী আকার বেছে নিন।

আপনারা কি পরিচয়পত্র বা কার্ড চান?

না। সাইন আপে একটি ইমেল, USDC বা USDT-তে পেমেন্ট — কোনো নথি নয়, কোনো কার্ড নয়।

মন্তব্য

এখনো কোনো মন্তব্য নেই। প্রথম হোন।

একটি মন্তব্য দিন

মন্তব্য প্রকাশের আগে মডারেট করা হয়।