শুরুতেই সৎ থাকি: আপনি দ্রুত, সস্তা, উচ্চ-মানের জেনারেশন চাইলে, একটি API ডাকুন। একটি CPU VPS GPU-তে ভরা একটি datacenter-কে হারাবে না, আর যে কেউ অন্য বলছে সে কিছু বেচছে।
তাহলে আদৌ ইনফারেন্স সেলফ-হোস্ট কেন? একটি কারণ, আর এটি একটি ভালো কারণ: আপনার সার্ভারের মডেল কখনও আপনার prompt কোথাও পাঠায় না।
CPU ইনফারেন্স আসলে কেমন দেখায়
আপনি যথেষ্ট RAM সহ CPU-তে আসল মডেল চালাতে পারেন। 4-bit-এ quantized একটি 7–8B মডেল কাজ করে। একটি 13B কাজ করে। আপনি memory থাকলে এমনকি একটি 30B-শ্রেণির মডেলও ঠেলতে পারেন। আপনি যা পারবেন না তা হলো এটিকে দ্রুত করা — output সেকেন্ডে কয়েকটি token-এ আসে, একটি API যে তাৎক্ষণিক stream দেয় তাতে নয়।
সেটাই সৎ বিনিময়। ইন্টারঅ্যাক্টিভ চ্যাটের জন্য এটি হতাশাজনক। background কাজের জন্য — রাতভর নথি summarize করা, একটি queue classify করা, একটি সময়সূচিতে ডেটা enrich করা — সেকেন্ডে কয়েকটি token পুরোপুরি ঠিক, আর কেউ ঘড়ি দেখছে না।
RAM-এর হিসাব
মডেলকে memory-তে বসতে হবে, quantized হোক বা না, plus context ও runtime-এর overhead:
- 7–8B, 4-bit — প্রায় 6–8 GB। একটি মাঝারি প্ল্যানে চলে।
- 13B, 4-bit — মোটামুটি 10–16 GB।
- 30B-শ্রেণির, quantized — quantization অনুসারে 24–48 GB।
- আরও বড়, বা উচ্চ নির্ভুলতা — আপনি দ্রুত 64–80 GB-তে — আর 80 GB-র পরে কোনো একক Pro বক্সে আঁটে না, তবুও CPU-ধীর।
এজন্যই "একটি local মডেল চালাই" নীরবে একটি high-memory প্রশ্ন হয়ে যায়। মডেলটি ই হলো memory footprint। একই বক্সে একটি RAG index বা agent যোগ করুন — সংখ্যাগুলো জমে।
Ollama বনাম vLLM, সংক্ষেপে
Ollama সহজ দরজা — ইনস্টল, ollama run, শেষ। এটি একটি প্রাইভেট single-user সেটআপের সঠিক টুল যেখানে আপনি কেবল মডেলটি উপলব্ধ চান। vLLM serving throughput-এর জন্য বানানো: বেশি সেটআপ, concurrent লোডের নিচে ভালো, সার্থক যখন আপনি আসলে ভলিউম সামলাচ্ছেন। Ollama দিয়ে শুরু করুন; আসল ট্র্যাফিক পরিবেশন করলে vLLM-এর দিকে হাত বাড়ান।
কোথায় private-first সত্যিই জেতে
সেলফ-হোস্টেড ইনফারেন্সের যুক্তি গতি বা খরচ নয় — এটি যে কিছু ডেটা বেরোতে পারে না। আইনি নথি। চিকিৎসা রেকর্ড। মালিকানাধীন কোড। যেখানে নীতি বা বিশ্বাসের কারণে prompt একটি তৃতীয়-পক্ষের API-তে পাঠানোই অসম্ভব। যে ধীর মডেল পুরোপুরি আপনার মেশিনে চলে সে সেই দ্রুত মডেলকে হারায় যা আপনার পাঠানো সব log করে।
আর ডেটা এতই সংবেদনশীল হলে, পেমেন্টও সম্ভবত প্রাইভেট হওয়া উচিত। বক্সটি ক্রিপ্টো ও no KYC-তে ভাড়া নিলে পুরো চেইন — সার্ভার, মডেল, prompt, বিলিং — কারো পরিচয়-রেকর্ডের বাইরে থাকে। এটাই আসল প্রস্তাব: "সস্তা ইনফারেন্স" নয়, বরং "এমন ইনফারেন্স যা আর কেউ দেখতে পায় না।"
শেষ কথা
গতি ও মানের জন্য, একটি API ব্যবহার করুন — এতে লজ্জা নেই। প্রাইভেসি প্রয়োজন হলে ও ধীর গ্রহণযোগ্য হলে সেলফ-হোস্ট করুন। মডেল plus এর context plus বক্স শেয়ার করা অন্য যেকোনো কিছুর জন্য size করুন, ও CPU থেকে GPU গতি আশা করবেন না।
মডেলের যখন আসল memory দরকার, Pro লাইন একটি dedicated IP ও রাত্রিকালীন backup সহ 32 থেকে 80 GB চালায় — context-এর জায়গা সহ একটি গুরুতর quantized মডেল ধরে রাখতে যথেষ্ট।
মন্তব্য
এখনো কোনো মন্তব্য নেই। প্রথম হোন।