EQVPS

প্রাইভেটভাবে local LLM ইনফারেন্স হোস্ট করা: একটি CPU VPS কী পারে ও পারে না

Aug 9, 2026 · 2 min read · EQVPS Team

শুরুতেই সৎ থাকি: আপনি দ্রুত, সস্তা, উচ্চ-মানের জেনারেশন চাইলে, একটি API ডাকুন। একটি CPU VPS GPU-তে ভরা একটি datacenter-কে হারাবে না, আর যে কেউ অন্য বলছে সে কিছু বেচছে।

তাহলে আদৌ ইনফারেন্স সেলফ-হোস্ট কেন? একটি কারণ, আর এটি একটি ভালো কারণ: আপনার সার্ভারের মডেল কখনও আপনার prompt কোথাও পাঠায় না।

CPU ইনফারেন্স আসলে কেমন দেখায়

আপনি যথেষ্ট RAM সহ CPU-তে আসল মডেল চালাতে পারেন। 4-bit-এ quantized একটি 7–8B মডেল কাজ করে। একটি 13B কাজ করে। আপনি memory থাকলে এমনকি একটি 30B-শ্রেণির মডেলও ঠেলতে পারেন। আপনি যা পারবেন না তা হলো এটিকে দ্রুত করা — output সেকেন্ডে কয়েকটি token-এ আসে, একটি API যে তাৎক্ষণিক stream দেয় তাতে নয়।

সেটাই সৎ বিনিময়। ইন্টারঅ্যাক্টিভ চ্যাটের জন্য এটি হতাশাজনক। background কাজের জন্য — রাতভর নথি summarize করা, একটি queue classify করা, একটি সময়সূচিতে ডেটা enrich করা — সেকেন্ডে কয়েকটি token পুরোপুরি ঠিক, আর কেউ ঘড়ি দেখছে না।

RAM-এর হিসাব

মডেলকে memory-তে বসতে হবে, quantized হোক বা না, plus context ও runtime-এর overhead:

এজন্যই "একটি local মডেল চালাই" নীরবে একটি high-memory প্রশ্ন হয়ে যায়। মডেলটি হলো memory footprint। একই বক্সে একটি RAG index বা agent যোগ করুন — সংখ্যাগুলো জমে।

Ollama বনাম vLLM, সংক্ষেপে

Ollama সহজ দরজা — ইনস্টল, ollama run, শেষ। এটি একটি প্রাইভেট single-user সেটআপের সঠিক টুল যেখানে আপনি কেবল মডেলটি উপলব্ধ চান। vLLM serving throughput-এর জন্য বানানো: বেশি সেটআপ, concurrent লোডের নিচে ভালো, সার্থক যখন আপনি আসলে ভলিউম সামলাচ্ছেন। Ollama দিয়ে শুরু করুন; আসল ট্র্যাফিক পরিবেশন করলে vLLM-এর দিকে হাত বাড়ান।

কোথায় private-first সত্যিই জেতে

সেলফ-হোস্টেড ইনফারেন্সের যুক্তি গতি বা খরচ নয় — এটি যে কিছু ডেটা বেরোতে পারে না। আইনি নথি। চিকিৎসা রেকর্ড। মালিকানাধীন কোড। যেখানে নীতি বা বিশ্বাসের কারণে prompt একটি তৃতীয়-পক্ষের API-তে পাঠানোই অসম্ভব। যে ধীর মডেল পুরোপুরি আপনার মেশিনে চলে সে সেই দ্রুত মডেলকে হারায় যা আপনার পাঠানো সব log করে।

আর ডেটা এতই সংবেদনশীল হলে, পেমেন্টও সম্ভবত প্রাইভেট হওয়া উচিত। বক্সটি ক্রিপ্টো ও no KYC-তে ভাড়া নিলে পুরো চেইন — সার্ভার, মডেল, prompt, বিলিং — কারো পরিচয়-রেকর্ডের বাইরে থাকে। এটাই আসল প্রস্তাব: "সস্তা ইনফারেন্স" নয়, বরং "এমন ইনফারেন্স যা আর কেউ দেখতে পায় না।"

শেষ কথা

গতি ও মানের জন্য, একটি API ব্যবহার করুন — এতে লজ্জা নেই। প্রাইভেসি প্রয়োজন হলে ও ধীর গ্রহণযোগ্য হলে সেলফ-হোস্ট করুন। মডেল plus এর context plus বক্স শেয়ার করা অন্য যেকোনো কিছুর জন্য size করুন, ও CPU থেকে GPU গতি আশা করবেন না।

মডেলের যখন আসল memory দরকার, Pro লাইন একটি dedicated IP ও রাত্রিকালীন backup সহ 32 থেকে 80 GB চালায় — context-এর জায়গা সহ একটি গুরুতর quantized মডেল ধরে রাখতে যথেষ্ট।

FAQ

একটি GPU ছাড়া কি একটি LLM চালাতে পারি?

ছোট quantized মডেল, হ্যাঁ — আর ধীরে। 4-bit-এ quantized একটি 7–8B মডেল যথেষ্ট RAM সহ CPU-তে চলে, কিন্তু আপনি output মাপবেন সেকেন্ডে কয়েকটি token-এ, একটি API-র চটপটে stream-এ নয়। batch job ও background কাজের জন্য ঠিক, ইন্টারঅ্যাক্টিভ চ্যাটের জন্য যন্ত্রণাদায়ক।

local ইনফারেন্সের জন্য কত RAM?

মডেলকে memory-তে আঁটতে হবে plus overhead। একটি 7–8B 4-bit মডেল চায় ~6–8 GB; 13B প্রায় 10–16 GB; 30B-শ্রেণির মডেল quantized-এ 24–48 GB ঠেলে। context ও বক্সের অন্য যেকোনো কিছুর জন্য জায়গা যোগ করুন। এজন্যই local ইনফারেন্স দ্রুত high-memory এলাকায় পড়ে।

Ollama নাকি vLLM?

Ollama সহজ on-ramp — একটি কমান্ড, মডেল টানা, চলছে। vLLM throughput ও serving-এর জন্য, বেশি সেটআপ, লোডের নিচে ভালো। একটি প্রাইভেট single-user বক্সের জন্য, Ollama সাধারণত সঠিক পছন্দ; vLLM যখন আপনি আসলে ভলিউমে request পরিবেশন করছেন।

ধীর হলে আদৌ ইনফারেন্স সেলফ-হোস্ট কেন?

প্রাইভেসি। আপনার prompt ও output কখনও একটি প্রোভাইডারের সার্ভার বা log স্পর্শ করে না। সংবেদনশীল ডেটার জন্য — আইনি, চিকিৎসা, অভ্যন্তরীণ কোড, তৃতীয় পক্ষকে পাঠাতে-না-পারা যেকোনো কিছু — একটি ধীর প্রাইভেট মডেল সেই দ্রুত মডেলকে হারায় যা সবকিছু দেখে। no-KYC ক্রিপ্টো পেমেন্টের সাথে জুড়লে পুরো চেইন আপনার থাকে।

← Back to blogSee plans & pricing →

মন্তব্য

এখনো কোনো মন্তব্য নেই। প্রথম হোন।

একটি মন্তব্য দিন

মন্তব্য প্রকাশের আগে মডারেট করা হয়।