হতাশাজনক অংশটা সরিয়ে ফেলি, কারণ ইন্টারনেট এমন পেজে ভরা যা করে না।
আমাদের সার্ভার CPU-only। আমরা GPU দিই না। মানে এখানে local LLM কাজের একটি কঠিন সীমা আছে, আর অন্য ভান করলে শুধু আপনার টাকা নষ্ট হবে।
CPU-তে আসলে যা কাজ করে
সর্বোচ্চ 6 vCPU ও 6 GB RAM সহ (আমাদের Medium প্ল্যান — $12/মাস), আপনি ছোট quantized মডেলের পরিসরে:
- 1B–3B মডেল (Q4): সত্যিই ব্যবহারযোগ্য। classification, tagging, routing ও সরল structured extraction-এর জন্য যথেষ্ট দ্রুত।
- 7B–8B মডেল (Q4): চলে, তবে সেকেন্ডে কয়েকটি token আশা করুন। রাতভর নথি চিবানো একটি queue-র জন্য ঠিক। একটি চ্যাট উইন্ডো হিসেবে যন্ত্রণাদায়ক।
- Embedding মডেল: চমৎকার মানানসই। এরা ছোট, CPU-তে দ্রুত, আর সম্ভবত এটাই আমাদের মতো একটি বক্সে Ollama চালানোর একক সেরা কারণ।
- 13B ও তার ওপরে: করবেন না। আপনি swap করবেন ও অপেক্ষা করবেন।
একটি দ্রুত, ইন্টারঅ্যাক্টিভ 70B চ্যাট লাগলে আপনার একটি GPU হোস্ট দরকার — সেটি একটি ভিন্ন প্রোভাইডারের ভিন্ন প্রোডাক্ট, আর আপনার $12 নেওয়ার চেয়ে আমরা তা বলাই ভালো মনে করি।
যেখানে একটি CPU বক্স সত্যিই জেতে
প্রাইভেসি। আপনার নথি, আপনার prompt, আপনার embedding — কখনও আপনার নিয়ন্ত্রিত একটি মেশিন ছাড়ে না, কখনও কারো training data হয় না। অনেকের জন্য ওটাই পুরো উদ্দেশ্য, আর সেকেন্ডে কয়েকটি token একটি গ্রহণযোগ্য বিনিময়।
খরচের অনুমেয়তা। কোনো per-token বিল নেই। পঞ্চাশ হাজার record classify করা একটি pipeline-এর খরচ পঞ্চাশটি classify করার সমান: $12।
Async কাজ। বেশিরভাগ দরকারি LLM কাজ একটি চ্যাট উইন্ডো নয়। এটি একটি queue: এগুলো summarize করো, ওগুলো tag করো, এই corpus embed করো। রাতভর একটি backlog চিবানো একটি CPU বক্স তাতে চমৎকার।
সেটআপ
# Ubuntu 24.04 — Medium প্ল্যান সুপারিশকৃত
curl -fsSL https://ollama.com/install.sh | sh
# ছোট কিছু দিয়ে শুরু করুন ও নিজে দেখুন
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embedding — CPU-র sweet spot
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama localhost:11434-এ একটি HTTP API পরিবেশন করে। এটিকে সেখানেই রাখুন। অন্যত্র থেকে পৌঁছানো লাগলে এটিকে একটি dedicated-IP প্ল্যানে authentication সহ একটি reverse proxy-র পেছনে রাখুন — কখনও একটি unauthenticated মডেল-endpoint খোলা ইন্টারনেটে উন্মুক্ত করবেন না।
একটি vector database-এর সাথে জুড়ুন (Docker-এ Qdrant বা pgvector) আর আপনার একটি $12 বক্সে একটি সম্পূর্ণ প্রাইভেট RAG stack হলো। সেই সংমিশ্রণ — ছোট local embedding, local vector store, শুধু ভারী জেনারেশন ধাপের জন্য বাইরের API — এই ধরনের হার্ডওয়্যারে যে সেটআপ আসলে যুক্তিসঙ্গত।
একটি প্ল্যান বাছা
| ব্যবহার | প্ল্যান | দাম |
|---|---|---|
| Embedding, 1–3B মডেল, RAG pipeline | Medium | $12/মাস |
| একই, plus auth-এর পেছনে একটি পাবলিক endpoint | Medium-IP | $20/মাস |
| শুধু ছোট মডেল পরীক্ষা | Small | $8/মাস |
CPU-only, সর্বোচ্চ 6 vCPU ও 6 GB RAM। NVMe স্টোরেজ, unmetered ট্র্যাফিক, জার্মানি বা ফিনল্যান্ড। ক্রিপ্টো পেমেন্ট, no KYC। বার্ষিক বিলিং বারোটির বদলে একটি ট্রান্সফার।
সম্পর্কিত পাঠ
- AI memory-র জন্য একটি vector DB হোস্ট করুন — একটি প্রাইভেট RAG stack-এর অন্য অর্ধেক
- AI agent-এর জন্য VPS — একই বক্সে orchestration
প্রস্তুত? একটি সার্ভার deploy করুন → — প্রায় এক মিনিটে চালু, ক্রিপ্টোতে পরিশোধিত, কোনো ID লাগে না।
মন্তব্য
এখনো কোনো মন্তব্য নেই। প্রথম হোন।