EQVPS

Ollama ও Local LLM-এর জন্য VPS

একটি CPU সার্ভারে ছোট ভাষা-মডেল সেলফ-হোস্ট করুন — প্রাইভেট, unmetered, ক্রিপ্টোতে পরিশোধিত। CPU ইনফারেন্স কী করতে পারে ও পারে না সে বিষয়ে সৎ। $12/মাস থেকে।

হতাশাজনক অংশটা সরিয়ে ফেলি, কারণ ইন্টারনেট এমন পেজে ভরা যা করে না।

আমাদের সার্ভার CPU-only। আমরা GPU দিই না। মানে এখানে local LLM কাজের একটি কঠিন সীমা আছে, আর অন্য ভান করলে শুধু আপনার টাকা নষ্ট হবে।

CPU-তে আসলে যা কাজ করে

সর্বোচ্চ 6 vCPU ও 6 GB RAM সহ (আমাদের Medium প্ল্যান — $12/মাস), আপনি ছোট quantized মডেলের পরিসরে:

একটি দ্রুত, ইন্টারঅ্যাক্টিভ 70B চ্যাট লাগলে আপনার একটি GPU হোস্ট দরকার — সেটি একটি ভিন্ন প্রোভাইডারের ভিন্ন প্রোডাক্ট, আর আপনার $12 নেওয়ার চেয়ে আমরা তা বলাই ভালো মনে করি।

যেখানে একটি CPU বক্স সত্যিই জেতে

প্রাইভেসি। আপনার নথি, আপনার prompt, আপনার embedding — কখনও আপনার নিয়ন্ত্রিত একটি মেশিন ছাড়ে না, কখনও কারো training data হয় না। অনেকের জন্য ওটাই পুরো উদ্দেশ্য, আর সেকেন্ডে কয়েকটি token একটি গ্রহণযোগ্য বিনিময়।

খরচের অনুমেয়তা। কোনো per-token বিল নেই। পঞ্চাশ হাজার record classify করা একটি pipeline-এর খরচ পঞ্চাশটি classify করার সমান: $12।

Async কাজ। বেশিরভাগ দরকারি LLM কাজ একটি চ্যাট উইন্ডো নয়। এটি একটি queue: এগুলো summarize করো, ওগুলো tag করো, এই corpus embed করো। রাতভর একটি backlog চিবানো একটি CPU বক্স তাতে চমৎকার।

সেটআপ

# Ubuntu 24.04 — Medium প্ল্যান সুপারিশকৃত
curl -fsSL https://ollama.com/install.sh | sh

# ছোট কিছু দিয়ে শুরু করুন ও নিজে দেখুন
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embedding — CPU-র sweet spot
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama localhost:11434-এ একটি HTTP API পরিবেশন করে। এটিকে সেখানেই রাখুন। অন্যত্র থেকে পৌঁছানো লাগলে এটিকে একটি dedicated-IP প্ল্যানে authentication সহ একটি reverse proxy-র পেছনে রাখুন — কখনও একটি unauthenticated মডেল-endpoint খোলা ইন্টারনেটে উন্মুক্ত করবেন না।

একটি vector database-এর সাথে জুড়ুন (Docker-এ Qdrant বা pgvector) আর আপনার একটি $12 বক্সে একটি সম্পূর্ণ প্রাইভেট RAG stack হলো। সেই সংমিশ্রণ — ছোট local embedding, local vector store, শুধু ভারী জেনারেশন ধাপের জন্য বাইরের API — এই ধরনের হার্ডওয়্যারে যে সেটআপ আসলে যুক্তিসঙ্গত।

একটি প্ল্যান বাছা

ব্যবহারপ্ল্যানদাম
Embedding, 1–3B মডেল, RAG pipelineMedium$12/মাস
একই, plus auth-এর পেছনে একটি পাবলিক endpointMedium-IP$20/মাস
শুধু ছোট মডেল পরীক্ষাSmall$8/মাস

CPU-only, সর্বোচ্চ 6 vCPU ও 6 GB RAM। NVMe স্টোরেজ, unmetered ট্র্যাফিক, জার্মানি বা ফিনল্যান্ড। ক্রিপ্টো পেমেন্ট, no KYC। বার্ষিক বিলিং বারোটির বদলে একটি ট্রান্সফার।

সম্পর্কিত পাঠ


প্রস্তুত? একটি সার্ভার deploy করুন → — প্রায় এক মিনিটে চালু, ক্রিপ্টোতে পরিশোধিত, কোনো ID লাগে না।

স্থাপন করতে প্রস্তুত? ক্রিপ্টোতে পরিশোধ করুন, KYC ছাড়াই — প্রায় এক মিনিটে লাইভ।

এখনই ডেপ্লয় করুন →

সাধারণ প্রশ্ন

এতে কি Llama 70B চালাতে পারি?

না। আমাদের প্ল্যান CPU-only, সর্বোচ্চ 6 GB RAM সহ — সেটি ছোট quantized মডেলের পরিসর (4-bit-এ মোটামুটি 1B–8B)। একটি 70B মডেলের একটি GPU ও অনেক বেশি memory দরকার। আমরা GPU দিই না, আর একটি হতাশা বেচার চেয়ে তা বলাই ভালো মনে করি।

CPU ইনফারেন্স আসলে কত দ্রুত?

4-bit quantization-এ একটি 7–8B মডেলে সেকেন্ডে কয়েকটি token আশা করুন, আর 1–3B মডেলে লক্ষণীয়ভাবে ভালো। background job, embedding, classification ও async pipeline-এর জন্য ঠিক। একটি চটপটে ইন্টারঅ্যাক্টিভ চ্যাটের জন্য ঠিক নয়।

তাহলে এটি আসলে কী কাজে ভালো?

প্রাইভেট embedding, classification, summarization queue, RAG pipeline যেখানে latency গুরুত্বপূর্ণ নয়, আর তৃতীয় পক্ষের API থেকে ডেটা দূরে রাখা। এছাড়া: কোথাও একটি GPU ভাড়া নেওয়ার আগে শেখা, পরীক্ষা ও prototyping।

আপনি কি ID চান?

না। register করতে ইমেল, পরিশোধে USDC বা USDT। যেটা প্রায়ই মানুষের প্রথমেই একটি প্রাইভেট মডেল চাওয়ার কারণ।

মন্তব্য

এখনো কোনো মন্তব্য নেই। প্রথম হোন।

একটি মন্তব্য দিন

মন্তব্য প্রকাশের আগে মডারেট করা হয়।