EQVPS

প্রাইভেট high-memory LLM ইনফারেন্সের জন্য VPS

বড় quantized মডেলের জন্য দরকার আসল RAM, এমন GPU নয় যা আপনার নেই। একটি high-memory CPU বক্স কোথায় 30B-শ্রেণির মডেল প্রাইভেটভাবে চালায়, বাস্তবে কী সম্ভব, আর কোথায় নয়। $70/মাস থেকে।

আমাদের Ollama ও ছোট মডেলের জন্য আলাদা একটি পেজ আছে — সেটি $12 CPU বক্স যা 1B–8B ও embeddings চালায়। এই পেজ অন্য প্রান্ত: সেই মডেলগুলো এত বড় যে CPU নয়, RAM-ই আপনাকে থামায়।

শুরুতেই সৎ থাকি, সব জায়গার মতোই: আমাদের সার্ভার CPU-only, কোনো GPU নেই। এখানে একটি বড় মডেল ধীরে চলে। একটি 30B মডেলে দ্রুত ইন্টারঅ্যাক্টিভ চ্যাট চাইলে GPU হোস্ট দরকার — ভিন্ন প্রোডাক্ট, ভিন্ন প্রোভাইডার। একটি high-memory CPU বক্স যা ভালো করে তা হলো একটি বড় quantized মডেল প্রাইভেটভাবে চালানো — এমন কাজের জন্য যা চ্যাট উইন্ডো নয়।

RAM-এর হিসাব

মডেলটি memory-তে বসে, quantized হোক বা না, plus context ও runtime-এর overhead:

এজন্যই "একটি বড় local মডেল চালাই" আসলে একটি high-memory প্রশ্ন। মডেলটি হলো memory footprint। একই হোস্টে একটি RAG index যোগ করুন — সংখ্যাগুলো জমতে থাকে।

যেখানে private-first সত্যিই জেতে

মূল কথাটা গতি নয়, খরচও নয় — কিছু ডেটা বেরোতেই পারে না। আইনি নথি। চিকিৎসা রেকর্ড। মালিকানাধীন কোড। যেখানে prompt একটি তৃতীয় পক্ষের API-তে পাঠানোই অসম্ভব। যে ধীর মডেল পুরোপুরি আপনার মেশিনে চলে, সে সেই দ্রুত মডেলকে হারায় যা আপনার পাঠানো সব log করে। আমরা পূর্ণ চিত্রটি এখানে লিখেছি

আর ডেটা যদি এতই সংবেদনশীল হয়, পেমেন্টও সম্ভবত প্রাইভেট হওয়া উচিত। বক্সটি ক্রিপ্টো ও no KYC-তে ভাড়া নিলে পুরো চেইন — সার্ভার, মডেল, prompt, বিলিং — কারো পরিচয়-রেকর্ডের বাইরে থাকে। এটাই মূল প্রস্তাব: সস্তা ইনফারেন্স নয়, বরং এমন ইনফারেন্স যা আর কেউ দেখতে পায় না।

কী বাছবেন

context-এর জায়গা সহ একটি 30B-শ্রেণির মডেলের জন্য Pro-64 (64 GB) আরামদায়ক পছন্দ; আঁটসাঁট quantization Pro-32 বা Pro-48-এ আঁটে, বড়টি যায় Pro-80-তে। আগে মডেল load করুন, resident memory দেখুন, মেপে-নেওয়া সংখ্যা থেকে size বাছুন। আর প্রত্যাশা ঠিক রাখুন: এটি প্রাইভেট batch ইনফারেন্স, দ্রুত চ্যাট উইন্ডো নয়।

স্থাপন করতে প্রস্তুত? ক্রিপ্টোতে পরিশোধ করুন, KYC ছাড়াই — প্রায় এক মিনিটে লাইভ।

এখনই ডেপ্লয় করুন →

সাধারণ প্রশ্ন

এটি আপনাদের Ollama use-case থেকে কীভাবে আলাদা?

Ollama পেজটি একটি $12 CPU বক্সে ছোট মডেল নিয়ে — 1B–8B, embeddings, হালকা কাজ। এটি high-memory প্রান্ত: 13B থেকে 30B-শ্রেণির quantized মডেল যাদের শুধু load হতেই 24–48 GB বা বেশি লাগে। একই CPU-only বাস্তবতা, অনেক বড় memory footprint, ভিন্ন প্ল্যান।

একটি নির্দিষ্ট মডেলের জন্য কত RAM?

মডেলটিকে memory-তে আঁটতে হবে, plus overhead। একটি 13B 4-bit মডেল চায় ~10–16 GB; 30B-শ্রেণির quantized ঠেলে দেয় 24–48 GB-তে; আরও বড় বা উচ্চ-নির্ভুলতায় গেলে 64–80 GB — তার বেশি হলে আমাদের কোনো একক বক্সে আঁটে না। উপরে context-এর জন্য জায়গা যোগ করুন।

এটি কি দ্রুত হবে?

না — নিজের সাথে সৎ থাকুন। একটি বড় মডেলে CPU ইনফারেন্স প্রতি সেকেন্ডে কয়েকটি token, ইন্টারঅ্যাক্টিভ স্ট্রিম নয়। batch ও background কাজের জন্য ঠিক আছে (রাতভর summarize করুন, একটি queue classify করুন)। একটি বড় মডেলে রিয়েল-টাইম চ্যাটের জন্য GPU দরকার, যা আমরা দিই না।

API-র বদলে এখানে চালাবেন কেন?

প্রাইভেসি। আপনার prompt ও output কখনও কোনো প্রোভাইডারের সার্ভার বা log স্পর্শ করে না। সংবেদনশীল ডেটার জন্য — আইনি, চিকিৎসা, অভ্যন্তরীণ কোড — একটি ধীর প্রাইভেট মডেল সেই দ্রুত মডেলের চেয়ে ভালো যে সবকিছু দেখে। no-KYC ক্রিপ্টো পেমেন্টের সাথে জুড়লে পুরো চেইন আপনার থাকে।

মন্তব্য

এখনো কোনো মন্তব্য নেই। প্রথম হোন।

একটি মন্তব্য দিন

মন্তব্য প্রকাশের আগে মডারেট করা হয়।