প্রতিটি prompt কারো API-তে পাঠানো ঠিক — যতক্ষণ না নয়। হয়তো ডেটা সংবেদনশীল আর আপনি বরং এটি কখনও আপনার সার্ভার না-ছাড়ুক চান। হয়তো আপনি rate limit-এ ক্লান্ত, বা আপনার পায়ের নিচে একটি মডেল সংস্করণ বদলানোয়, বা একটি per-token মিটার টিক করায় যখন আপনি পরীক্ষা করছেন। কোনো এক পর্যায়ে "আমি যদি কেবল নিজেরটা চালাই?" একটি চিন্তা-পরীক্ষা হওয়া থামায়।
Ollama সেটি সত্যিই সহজ করে। কঠিনতর প্রশ্ন হলো একটি VPS-এ কী আঁটে — আর এখানে hype-এর চেয়ে সৎ উত্তর বেশি গুরুত্বপূর্ণ।
CPU-তে আপনি আসলে কী চালাতে পারেন
কোনো GPU নেই? তাহলে আপনি CPU ইনফারেন্স করছেন, আর মডেল-আকারই সব। Quantization (weight-কে 4-bit-এ চেপে) এটিকে ব্যবহারিক করে — আপনি সামান্য মান হারান ও এক গাদা memory বাঁচান।
মোটামুটি সংখ্যা, যেগুলো গুরুত্বপূর্ণ:
- 3B মডেল, 4-bit — ~3 GB RAM। chat ও সরল কাজের জন্য যথেষ্ট চটপটে।
- 7B মডেল, 4-bit — ~5 GB RAM। sweet spot: লক্ষণীয়ভাবে চতুর, তবুও একটি পাঠযোগ্য গতিতে চলে।
- 13B ও তার ওপরে — 8-10 GB+ আর CPU-তে ধীর। প্রযুক্তিগতভাবে সম্ভব, ব্যবহারিকভাবে বিরক্তিকর।
গতি, সৎভাবে: কয়েকটি vCPU-তে আপনি সেকেন্ডে মুষ্টিমেয় token দেখবেন। একটি chatbot বা একটি coding assistant-এর জন্য পুরোপুরি ঠিক যেখানে এটি টাইপ করার সাথে আপনি পড়েন। এক মিলিয়ন নথি batch-process করার জন্য ঠিক নয় — সেটি একটি GPU কাজ, আর আমরা অন্য ভান করি না। আমরা GPU ইনস্ট্যান্স দিই না। আপনার প্ল্যানের একটি 70B মডেল বা ভারী throughput লাগলে, একটি CPU VPS — আমাদের বা যে কারোর — ভুল টুল, আর একটি পয়সা খরচের আগে আপনার তা জানা উচিত।
কিন্তু একটি প্রাইভেট 7B যা আপনার প্রশ্নের উত্তর দেয় ও কখনও phone home করে না? সেটি একটি 6 GB বক্সে আরামে চলে।
Install — তিন কমান্ড
সার্ভার চালু করুন, SSH করে ঢুকুন, ও:
curl -fsSL https://ollama.com/install.sh | sh # Ollama ইনস্টল করে
ollama run llama3.2:3b # একটি 3B মডেল টানে + চালায়
ব্যস — আপনি terminal-এ chat করছেন। নিজের কোড থেকে এটি ব্যবহার করতে, Ollama ইতিমধ্যেই পোর্ট 11434-এ একটি HTTP API পরিবেশন করে:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
আগে জানার একটি খটকা: ডিফল্টে সেই API localhost-এ bind করে। এটিকে সেভাবেই রাখুন ও SSH-এর ওপর tunnel করুন, নইলে এটি ইন্টারনেটে উন্মুক্ত। এটি পৌঁছানোযোগ্য চাইলে, এটিকে auth-এর পেছনে রাখুন — একটি পাবলিক IP-তে একটি খোলা মডেল-endpoint রাখবেন না।
বক্স বাছা
উল্টো নয়, মডেলের সাথে প্ল্যান মেলান:
| আপনি যা চালাতে চান | যত RAM দরকার | বিবেচ্য প্ল্যান |
|---|---|---|
| 3B মডেল, হালকা ব্যবহার | ~3 GB | Small (4 GB) |
| 7B মডেল, আরামে | ~5-6 GB | Medium (6 GB) |
| বড় / উচ্চ throughput | GPU এলাকা | একটি CPU VPS নয় |
বেশিরভাগ সেলফ-হোস্টারের জন্য, Medium (6 GB) সৎ সুপারিশ — একটি 7B মডেল plus আপনার app ও OS-এর জন্য যথেষ্ট headroom। Small (4 GB) কাজ করে যদি আপনি 3B-তে থাকেন। তার নিচে যেকোনো কিছু OS ও context খাওয়ার পরে খুব আঁটসাঁট।
এখানে কেন করবেন
আপনি একটি LLM সেলফ-হোস্ট করলে, প্রাইভেসি সাধারণত অর্ধেক কারণ — তাই বক্সটি ভাড়া নিতে আপনার ID দেওয়া অদ্ভুত হত। আপনাকে দিতে হয় না: আপনি USDC বা USDT-তে (বা on-ramp-এর মাধ্যমে একটি কার্ড) পরিশোধ করতে পারেন, no KYC, আর সার্ভার প্রায় এক মিনিটে আপনার। Crypto-native, agent-বান্ধব, আর ডেটা আপনার নিয়ন্ত্রিত একটি মেশিনে থাকে।
ট্রেডঅফ সেটাই যা নিয়ে আমরা সৎ ছিলাম: শুধু CPU, একটি 6 GB সীমা, ছোট মডেল। এর মধ্যে, সেলফ-হোস্টিং দারুণ। এর বাইরে, কেউ আপনাকে একটি GPU লাগে এমন কাজের জন্য একটি CPU বক্স বেচতে দেবেন না।
চেষ্টা করতে প্রস্তুত? একটি প্ল্যান বাছুন, পরিশোধ করুন, আর প্রায় 60 সেকেন্ডে root পাবেন — তারপর আপনার নিজের প্রাইভেট মডেল পর্যন্ত তিন কমান্ড।
মন্তব্য
এখনো কোনো মন্তব্য নেই। প্রথম হোন।