بگذارید بخش ناامیدکننده را از سر راه برداریم، چون اینترنت پر از صفحههایی است که این کار را نمیکنند.
سرورهای ما فقط CPU هستند. ما GPU ارائه نمیدهیم. این یعنی کار مدل زبانی محلی اینجا یک سقف سخت دارد، و وانمود کردن به خلافش فقط پول شما را هدر میدهد.
واقعاً چه چیزی روی CPU کار میکند
با حداکثر ۶ vCPU و ۶ گیگابایت RAM (پلن Medium ما — ۱۲ دلار در ماه)، شما در محدوده مدلهای کوانتیزه کوچک هستید:
- مدلهای ۱ تا ۳ میلیاردی (Q4): واقعاً قابلاستفاده. برای دستهبندی، برچسبگذاری، مسیریابی و استخراج ساختاریافته ساده بهقدر کافی سریع.
- مدلهای ۷ تا ۸ میلیاردی (Q4): اجرا میشوند، اما چند توکن در ثانیه انتظار داشته باشید. برای صفی که در طول شب اسناد را میجود خوب است. بهعنوان یک پنجره چت دردناک.
- مدلهای embedding: تطابق عالی. کوچکاند، روی CPU سریعاند، و این احتمالاً بهترین دلیل واحد برای اجرای Ollama روی سروری مثل ماست.
- ۱۳ میلیاردی و بالاتر: نه. مدام swap میکنید و منتظر میمانید.
اگر به یک چت تعاملی سریع ۷۰ میلیاردی نیاز دارید، به یک میزبان GPU نیاز دارید — این محصولی متفاوت از ارائهدهندهای دیگر است، و ترجیح میدهیم این را بگوییم تا اینکه ۱۲ دلارتان را بگیریم.
جایی که یک سرور CPU واقعاً برنده است
حریم خصوصی. اسناد شما، پرامپتهای شما، embeddingهای شما — هرگز از ماشینی که کنترلش میکنید خارج نمیشوند، هرگز به داده آموزشی کسی تبدیل نمیشوند. برای خیلیها این کل ماجراست، و چند توکن در ثانیه یک معامله قابلقبول است.
قابلپیشبینی بودن هزینه. بدون صورتحساب بهازای هر توکن. خطلولهای که پنجاههزار رکورد را دستهبندی میکند همانقدر هزینه دارد که یکی که پنجاهتا را: ۱۲ دلار.
کار ناهمگام. بیشتر کار مفید مدل زبانی یک پنجره چت نیست. یک صف است: اینها را خلاصه کن، آنها را برچسب بزن، این پیکره را embed کن. یک سرور CPU که در طول شب یک انباشته کار را میساید در این کار کاملاً خوب است.
راهاندازی
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama یک API از نوع HTTP روی localhost:11434 ارائه میدهد. همانجا نگهش دارید. اگر لازم است از جای دیگری به آن برسید، آن را پشت یک reverse proxy با احراز هویت روی یک پلن IP اختصاصی بگذارید — هرگز یک endpoint مدل بدون احراز هویت را به اینترنت باز عرضه نکنید.
آن را با یک vector database جفت کنید (Qdrant یا pgvector در Docker) و یک مجموعه RAG خصوصی کامل روی یک سرور ۱۲ دلاری دارید. آن ترکیب — embeddingهای محلی کوچک، vector store محلی، API خارجی فقط برای مرحله سنگین تولید — راهاندازیای است که روی سختافزاری مثل این واقعاً منطقی است.
انتخاب پلن
| کاربرد | پلن | قیمت |
|---|---|---|
| embedding، مدلهای ۱ تا ۳ میلیاردی، خطلوله RAG | Medium | ۱۲ دلار در ماه |
| همان، بهعلاوه یک endpoint عمومی پشت احراز هویت | Medium-IP | ۲۰ دلار در ماه |
| فقط تست مدلهای کوچک | Small | ۸ دلار در ماه |
فقط CPU، حداکثر ۶ vCPU و ۶ گیگابایت RAM. ذخیرهسازی NVMe، ترافیک بیشمارش، آلمان یا فنلاند. پرداخت با رمزارز، بدون KYC. صورتحساب سالانه یک انتقال است بهجای دوازده تا.
خواندنیهای مرتبط
- یک vector DB برای حافظه هوش مصنوعی میزبانی کنید — نیمه دیگر یک مجموعه RAG خصوصی
- VPS برای عاملهای هوش مصنوعی — ارکستراسیون روی همان سرور
آمادهاید؟ یک سرور بسازید ← — در حدود یک دقیقه فعال، پرداخت با رمزارز، بدون نیاز به مدرک.
نظرات
هنوز نظری نیست. اولین نفر باشید.