گرمای تابستان — همه‌چیز آب می‌شود، حتی قیمت‌های ما.−25%−۲۵٪ روی هر پلن سالانه، تا ۳۱ اوتدیدن پلن‌ها
EQVPS

VPS برای Ollama و مدل‌های زبانی محلی

مدل‌های زبانی کوچک را روی یک سرور CPU سلف‌هاست کنید — خصوصی، بی‌شمارش، پرداخت با رمزارز. صادق درباره اینکه استنتاج روی CPU چه می‌تواند و چه نمی‌تواند. از ۱۲ دلار در ماه.

بگذارید بخش ناامیدکننده را از سر راه برداریم، چون اینترنت پر از صفحه‌هایی است که این کار را نمی‌کنند.

سرورهای ما فقط CPU هستند. ما GPU ارائه نمی‌دهیم. این یعنی کار مدل زبانی محلی اینجا یک سقف سخت دارد، و وانمود کردن به خلافش فقط پول شما را هدر می‌دهد.

واقعاً چه چیزی روی CPU کار می‌کند

با حداکثر ۶ vCPU و ۶ گیگابایت RAM (پلن Medium ما — ۱۲ دلار در ماه)، شما در محدوده مدل‌های کوانتیزه کوچک هستید:

اگر به یک چت تعاملی سریع ۷۰ میلیاردی نیاز دارید، به یک میزبان GPU نیاز دارید — این محصولی متفاوت از ارائه‌دهنده‌ای دیگر است، و ترجیح می‌دهیم این را بگوییم تا اینکه ۱۲ دلارتان را بگیریم.

جایی که یک سرور CPU واقعاً برنده است

حریم خصوصی. اسناد شما، پرامپت‌های شما، embeddingهای شما — هرگز از ماشینی که کنترلش می‌کنید خارج نمی‌شوند، هرگز به داده آموزشی کسی تبدیل نمی‌شوند. برای خیلی‌ها این کل ماجراست، و چند توکن در ثانیه یک معامله قابل‌قبول است.

قابل‌پیش‌بینی بودن هزینه. بدون صورت‌حساب به‌ازای هر توکن. خط‌لوله‌ای که پنجاه‌هزار رکورد را دسته‌بندی می‌کند همان‌قدر هزینه دارد که یکی که پنجاه‌تا را: ۱۲ دلار.

کار ناهمگام. بیشتر کار مفید مدل زبانی یک پنجره چت نیست. یک صف است: این‌ها را خلاصه کن، آن‌ها را برچسب بزن، این پیکره را embed کن. یک سرور CPU که در طول شب یک انباشته کار را می‌ساید در این کار کاملاً خوب است.

راه‌اندازی

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama یک API از نوع HTTP روی localhost:11434 ارائه می‌دهد. همان‌جا نگهش دارید. اگر لازم است از جای دیگری به آن برسید، آن را پشت یک reverse proxy با احراز هویت روی یک پلن IP اختصاصی بگذارید — هرگز یک endpoint مدل بدون احراز هویت را به اینترنت باز عرضه نکنید.

آن را با یک vector database جفت کنید (Qdrant یا pgvector در Docker) و یک مجموعه RAG خصوصی کامل روی یک سرور ۱۲ دلاری دارید. آن ترکیب — embeddingهای محلی کوچک، vector store محلی، API خارجی فقط برای مرحله سنگین تولید — راه‌اندازی‌ای است که روی سخت‌افزاری مثل این واقعاً منطقی است.

انتخاب پلن

کاربردپلنقیمت
embedding، مدل‌های ۱ تا ۳ میلیاردی، خط‌لوله RAGMedium۱۲ دلار در ماه
همان، به‌علاوه یک endpoint عمومی پشت احراز هویتMedium-IP۲۰ دلار در ماه
فقط تست مدل‌های کوچکSmall۸ دلار در ماه

فقط CPU، حداکثر ۶ vCPU و ۶ گیگابایت RAM. ذخیره‌سازی NVMe، ترافیک بی‌شمارش، آلمان یا فنلاند. پرداخت با رمزارز، بدون KYC. صورت‌حساب سالانه یک انتقال است به‌جای دوازده تا.

خواندنی‌های مرتبط


آماده‌اید؟ یک سرور بسازید ← — در حدود یک دقیقه فعال، پرداخت با رمزارز، بدون نیاز به مدرک.

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

آیا می‌توانم Llama 70B را روی این اجرا کنم؟

نه. پلن‌های ما فقط CPU با حداکثر ۶ گیگابایت RAM هستند — این محدوده مدل‌های کوانتیزه کوچک است (تقریباً ۱ تا ۸ میلیارد پارامتر با ۴ بیت). یک مدل ۷۰ میلیاردی به GPU و حافظه‌ای بسیار بیشتر نیاز دارد. ما GPU ارائه نمی‌دهیم و ترجیح می‌دهیم این را بگوییم تا اینکه ناامیدی به شما بفروشیم.

استنتاج روی CPU واقعاً چقدر سریع است؟

روی یک مدل ۷ تا ۸ میلیاردی با کوانتیزاسیون ۴ بیت انتظار چند توکن در ثانیه را داشته باشید، و روی مدل‌های ۱ تا ۳ میلیاردی به‌طور محسوس بهتر. این برای کارهای پس‌زمینه، embedding، دسته‌بندی و خط‌لوله‌های ناهمگام خوب است. برای یک چت تعاملی سریع خوب نیست.

پس این واقعاً برای چه خوب است؟

embedding خصوصی، دسته‌بندی، صف‌های خلاصه‌سازی، خط‌لوله‌های RAG که تأخیر برایشان مهم نیست، و دور نگه‌داشتن داده از APIهای شخص ثالث. همچنین: یادگیری، تست و نمونه‌سازی پیش از اینکه جایی GPU اجاره کنید.

آیا مدرک شناسایی می‌خواهید؟

نه. ایمیل برای ثبت‌نام، USDC یا USDT برای پرداخت. که اغلب همان دلیلی است که مردم در وهله اول یک مدل خصوصی می‌خواهند.

نظرات

هنوز نظری نیست. اولین نفر باشید.

یک نظر بگذارید

نظرات پیش از نمایش بررسی می‌شوند.