EQVPS

Ollama দিয়ে একটি VPS-এ একটি local LLM সেলফ-হোস্ট করা — আসলে যা কাজ করে

Jun 14, 2026 · 3 min read · EQVPS Team

প্রতিটি prompt কারো API-তে পাঠানো ঠিক — যতক্ষণ না নয়। হয়তো ডেটা সংবেদনশীল আর আপনি বরং এটি কখনও আপনার সার্ভার না-ছাড়ুক চান। হয়তো আপনি rate limit-এ ক্লান্ত, বা আপনার পায়ের নিচে একটি মডেল সংস্করণ বদলানোয়, বা একটি per-token মিটার টিক করায় যখন আপনি পরীক্ষা করছেন। কোনো এক পর্যায়ে "আমি যদি কেবল নিজেরটা চালাই?" একটি চিন্তা-পরীক্ষা হওয়া থামায়।

Ollama সেটি সত্যিই সহজ করে। কঠিনতর প্রশ্ন হলো একটি VPS-এ কী আঁটে — আর এখানে hype-এর চেয়ে সৎ উত্তর বেশি গুরুত্বপূর্ণ।

CPU-তে আপনি আসলে কী চালাতে পারেন

কোনো GPU নেই? তাহলে আপনি CPU ইনফারেন্স করছেন, আর মডেল-আকারই সব। Quantization (weight-কে 4-bit-এ চেপে) এটিকে ব্যবহারিক করে — আপনি সামান্য মান হারান ও এক গাদা memory বাঁচান।

মোটামুটি সংখ্যা, যেগুলো গুরুত্বপূর্ণ:

গতি, সৎভাবে: কয়েকটি vCPU-তে আপনি সেকেন্ডে মুষ্টিমেয় token দেখবেন। একটি chatbot বা একটি coding assistant-এর জন্য পুরোপুরি ঠিক যেখানে এটি টাইপ করার সাথে আপনি পড়েন। এক মিলিয়ন নথি batch-process করার জন্য ঠিক নয় — সেটি একটি GPU কাজ, আর আমরা অন্য ভান করি না। আমরা GPU ইনস্ট্যান্স দিই না। আপনার প্ল্যানের একটি 70B মডেল বা ভারী throughput লাগলে, একটি CPU VPS — আমাদের বা যে কারোর — ভুল টুল, আর একটি পয়সা খরচের আগে আপনার তা জানা উচিত।

কিন্তু একটি প্রাইভেট 7B যা আপনার প্রশ্নের উত্তর দেয় ও কখনও phone home করে না? সেটি একটি 6 GB বক্সে আরামে চলে।

Install — তিন কমান্ড

সার্ভার চালু করুন, SSH করে ঢুকুন, ও:

curl -fsSL https://ollama.com/install.sh | sh   # Ollama ইনস্টল করে
ollama run llama3.2:3b                            # একটি 3B মডেল টানে + চালায়

ব্যস — আপনি terminal-এ chat করছেন। নিজের কোড থেকে এটি ব্যবহার করতে, Ollama ইতিমধ্যেই পোর্ট 11434-এ একটি HTTP API পরিবেশন করে:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

আগে জানার একটি খটকা: ডিফল্টে সেই API localhost-এ bind করে। এটিকে সেভাবেই রাখুন ও SSH-এর ওপর tunnel করুন, নইলে এটি ইন্টারনেটে উন্মুক্ত। এটি পৌঁছানোযোগ্য চাইলে, এটিকে auth-এর পেছনে রাখুন — একটি পাবলিক IP-তে একটি খোলা মডেল-endpoint রাখবেন না।

বক্স বাছা

উল্টো নয়, মডেলের সাথে প্ল্যান মেলান:

আপনি যা চালাতে চানযত RAM দরকারবিবেচ্য প্ল্যান
3B মডেল, হালকা ব্যবহার~3 GBSmall (4 GB)
7B মডেল, আরামে~5-6 GBMedium (6 GB)
বড় / উচ্চ throughputGPU এলাকাএকটি CPU VPS নয়

বেশিরভাগ সেলফ-হোস্টারের জন্য, Medium (6 GB) সৎ সুপারিশ — একটি 7B মডেল plus আপনার app ও OS-এর জন্য যথেষ্ট headroom। Small (4 GB) কাজ করে যদি আপনি 3B-তে থাকেন। তার নিচে যেকোনো কিছু OS ও context খাওয়ার পরে খুব আঁটসাঁট।

এখানে কেন করবেন

আপনি একটি LLM সেলফ-হোস্ট করলে, প্রাইভেসি সাধারণত অর্ধেক কারণ — তাই বক্সটি ভাড়া নিতে আপনার ID দেওয়া অদ্ভুত হত। আপনাকে দিতে হয় না: আপনি USDC বা USDT-তে (বা on-ramp-এর মাধ্যমে একটি কার্ড) পরিশোধ করতে পারেন, no KYC, আর সার্ভার প্রায় এক মিনিটে আপনার। Crypto-native, agent-বান্ধব, আর ডেটা আপনার নিয়ন্ত্রিত একটি মেশিনে থাকে।

ট্রেডঅফ সেটাই যা নিয়ে আমরা সৎ ছিলাম: শুধু CPU, একটি 6 GB সীমা, ছোট মডেল। এর মধ্যে, সেলফ-হোস্টিং দারুণ। এর বাইরে, কেউ আপনাকে একটি GPU লাগে এমন কাজের জন্য একটি CPU বক্স বেচতে দেবেন না।

চেষ্টা করতে প্রস্তুত? একটি প্ল্যান বাছুন, পরিশোধ করুন, আর প্রায় 60 সেকেন্ডে root পাবেন — তারপর আপনার নিজের প্রাইভেট মডেল পর্যন্ত তিন কমান্ড।

FAQ

একটি GPU ছাড়া কি একটি LLM চালাতে পারি?

হ্যাঁ, ছোট মডেলের জন্য। 4-bit quantization-এ একটি 3B বা 7B মডেল CPU-তে চলে ও একটি পাঠযোগ্য গতিতে উত্তর দেয় — একটি chatbot, একটি coding helper, বা background কাজের জন্য ঠিক যেখানে আপনি cursor দেখছেন না। CPU-তে যা করতে পারবেন না তা হলো একটি বড় মডেল (13B ও তার ওপরে) পরিবেশন বা উচ্চ throughput ঠেলা; সেখানে একটি GPU ঐচ্ছিক হওয়া থামায়।

Llama 7B-র জন্য কত RAM দরকার?

একটি 4-bit 7B মডেলের জন্য context window ও OS যোগ করার পরে প্রায় 5 GB — তাই একটি 6 GB বক্স আরামদায়ক মেঝে। একটি 3B মডেল প্রায় 3 GB-তে আঁটে। ছোট quant (Q4) সামান্য মান ও অনেক কম memory বিনিময় করে, যা একটি VPS-এ সঠিক বিনিময়।

একটি LLM সেলফ-হোস্ট করা কি একটি API-র চেয়ে সস্তা?

এটি ভলিউমের ওপর নির্ভর। একটি hosted API per token চার্জ করে ও idle থাকলে কিছুই খরচ করে না; একটি VPS আপনি ব্যবহার করুন বা না একটি flat মাসিক বিল। আপনি একটি স্থির request-ধারা চালালে, বা মূলত প্রাইভেসি ও কোনো rate limit নেই চাইলে, সেলফ-হোস্টিং জেতে। মাঝেমধ্যে এককালীন prompt-এর জন্য, একটি মিটার-করা API সস্তা।

একটি cloud API-র বদলে সেলফ-হোস্ট কেন?

মানুষ আসলে তিনটি কারণে করে: ডেটা কখনও আপনার সার্ভার ছাড়ে না (আইনি, চিকিৎসা, বা কেবল প্রাইভেট নোটের জন্য আসল), কোনো rate limit বা per-token মিটার নেই, ও মডেল আপনার নিচে বদলাবে না বা deprecated হবে না। খরচ হলো আপনি বক্স manage করেন ও এর হার্ডওয়্যারের ভেতরে থাকেন।

একটি CPU VPS-এ আমি বাস্তবসম্মতভাবে সবচেয়ে বড় কোন মডেল চালাতে পারি?

একটি 6 GB বক্সে 4-bit-এ একটি 7B মডেল sweet spot। আপনি প্রযুক্তিগতভাবে যথেষ্ট RAM সহ একটি 13B load করতে পারেন, কিন্তু CPU-তে এটি এত ধীর হয় যে আপনি টের পাবেন। তার বেশি হলে আপনি একটি GPU চান, যা একটি ভিন্ন ধরনের হোস্ট।

← Back to blogSee plans & pricing →

মন্তব্য

এখনো কোনো মন্তব্য নেই। প্রথম হোন।

একটি মন্তব্য দিন

মন্তব্য প্রকাশের আগে মডারেট করা হয়।