گرمای تابستان — همه‌چیز آب می‌شود، حتی قیمت‌های ما.−25%−۲۵٪ روی هر پلن سالانه، تا ۳۱ اوتدیدن پلن‌ها
EQVPS

VPS برای استنتاج خصوصی مدل زبانی با حافظه بالا

مدل‌های کوانتیزه بزرگ‌تر به RAM واقعی نیاز دارند، نه به GPUای که ندارید. جایی که یک سرور CPU با حافظه بالا مدل‌های رده ۳۰ میلیاردی را خصوصی اجرا می‌کند، چه چیزی واقع‌بینانه است و کجا نیست. از ۷۰ دلار در ماه.

ما یک صفحه جداگانه برای Ollama و مدل‌های کوچک داریم — آن سرور CPU دوازده دلاری است که ۱ تا ۸ میلیارد و embedding را اجرا می‌کند. این صفحه انتهای دیگر است: مدل‌هایی به‌قدری بزرگ که RAM، نه CPU، چیزی است که جلوی شما را می‌گیرد.

از همان اول صادق باشیم، مثل همه‌جا: سرورهای ما فقط CPU هستند، بدون GPU. یک مدل بزرگ اینجا کند اجرا می‌شود. اگر چت تعاملی سریع روی یک مدل ۳۰ میلیاردی می‌خواهید، به یک میزبان GPU نیاز دارید — محصول متفاوت، ارائه‌دهنده متفاوت. کاری که یک سرور CPU با حافظه بالا خوب انجام می‌دهد این است که یک مدل کوانتیزه بزرگ را به‌صورت خصوصی برای کاری که پنجره چت نیست اجرا کند.

حساب RAM

مدل، کوانتیزه یا نه، در حافظه می‌نشیند، به‌علاوه سربار برای context و runtime:

به همین دلیل «یک مدل محلی بزرگ‌تر اجرا کن» واقعاً یک پرسش حافظه‌بالاست. مدل همان ردپای حافظه است. یک شاخص RAG روی همان میزبان اضافه کنید و اعداد روی هم انباشته می‌شوند.

جایی که خصوصی‌بودن-اول واقعاً برنده است

مسئله سرعت نیست و هزینه هم نیست — این است که بعضی داده‌ها نمی‌توانند خارج شوند. اسناد حقوقی. سوابق پزشکی. کد اختصاصی. هر چیزی که فرستادن پرامپت به یک API شخص ثالث درباره‌اش منتفی است. یک مدل کندتر که کاملاً روی ماشین شما اجرا می‌شود، بهتر از یک مدل سریع است که هر چیزی را که می‌فرستید لاگ می‌کند. ما تصویر کامل را اینجا نوشتیم.

و اگر داده آن‌قدر حساس است، احتمالاً پرداخت هم باید خصوصی باشد. اجاره سرور با رمزارز و بدون KYC کل زنجیره — سرور، مدل، پرامپت‌ها، صورت‌حساب — را از سوابق هویتی هرکسی دور نگه می‌دارد. این حرف اصلی است: نه استنتاج ارزان‌تر، بلکه استنتاجی که هیچ‌کس دیگری نمی‌تواند ببیند.

چه چیزی انتخاب کنیم

برای یک مدل رده ۳۰ میلیاردی با فضای کافی برای context، Pro-64 (۶۴ گیگابایت) انتخاب راحت است؛ یک کوانتیزاسیون فشرده‌تر در Pro-32 یا Pro-48 جا می‌شود، یک مدل بزرگ‌تر به Pro-80 می‌رود. اول مدل را بارگذاری کنید، حافظه مقیم را تماشا کنید، و از روی آنچه اندازه گرفتید ابعاد را تعیین کنید. و انتظارات را تنظیم کنید: این استنتاج دسته‌ای خصوصی است، نه یک پنجره چت سریع.

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

این با کاربرد Ollama شما چه فرقی دارد؟

صفحه Ollama درباره مدل‌های کوچک روی یک سرور CPU دوازده دلاری است — ۱ تا ۸ میلیارد، embedding، کار سبک. این انتهای حافظه‌بالاست: مدل‌های کوانتیزه رده ۱۳ تا ۳۰ میلیاردی که فقط برای بارگذاری به ۲۴ تا ۴۸ گیگابایت یا بیشتر نیاز دارند. همان واقعیت فقط-CPU، ردپای حافظه بسیار بزرگ‌تر، پلن متفاوت.

برای یک مدل معین چقدر RAM؟

مدل باید در حافظه به‌علاوه سربار جا شود. یک مدل ۱۳ میلیاردی ۴ بیت حدود ۱۰ تا ۱۶ گیگابایت می‌خواهد؛ رده ۳۰ میلیاردی کوانتیزه به ۲۴ تا ۴۸ گیگابایت می‌رسد؛ بزرگ‌تر یا با دقت بالاتر بروید و به ۶۴ تا ۸۰ گیگابایت می‌رسید — فراتر از آن، هیچ سرور واحدی از ما جا نمی‌شود. برای context هم فضای اضافه اضافه کنید.

آیا سریع خواهد بود؟

نه — اینجا با خودتان صادق باشید. استنتاج CPU روی یک مدل بزرگ چند توکن در ثانیه است، نه یک جریان تعاملی. برای کار دسته‌ای و پس‌زمینه خوب است (شبانه خلاصه کن، یک صف را دسته‌بندی کن). برای چت بلادرنگ روی یک مدل بزرگ به GPU نیاز دارید که ما ارائه نمی‌دهیم.

چرا اینجا اجرایش کنم به‌جای یک API؟

حریم خصوصی. پرامپت‌ها و خروجی‌های شما هرگز به سرورها یا لاگ‌های یک ارائه‌دهنده نمی‌رسند. برای داده حساس — حقوقی، پزشکی، کد داخلی — یک مدل خصوصی کندتر بهتر از یک مدل سریع است که همه چیز را می‌بیند. آن را با پرداخت رمزارز بدون KYC جفت کنید و کل زنجیره مال خودتان می‌ماند.

نظرات

هنوز نظری نیست. اولین نفر باشید.

یک نظر بگذارید

نظرات پیش از نمایش بررسی می‌شوند.