گرمای تابستان — همه‌چیز آب می‌شود، حتی قیمت‌های ما.−25%−۲۵٪ روی هر پلن سالانه، تا ۳۱ اوتدیدن پلن‌ها
EQVPS

میزبانی خصوصیِ استنتاج LLM محلی: یک VPS مبتنی بر CPU چه می‌تواند و چه نمی‌تواند

18 مرداد 1405 · 3 دقیقه مطالعه · EQVPS Team

بگذارید از همان اول صادق باشیم: اگر تولید سریع، ارزان و باکیفیت می‌خواهید، یک API را صدا بزنید. یک VPS مبتنی بر CPU از یک دیتاسنتر پر از GPU جلو نمی‌زند، و هرکس خلافش را بگوید دارد چیزی می‌فروشد.

پس اصلاً چرا استنتاج را خودمیزبان کنیم؟ یک دلیل، و دلیل خوبی است: مدلی که روی سرور شماست هرگز پرامپت‌هایتان را به جایی نمی‌فرستد.

استنتاج روی CPU واقعاً چه شکلی است

می‌توانید مدل‌های واقعی را با RAM کافی روی CPU اجرا کنید. یک مدل 7 تا 8 میلیاردی که به ۴-بیت کوانتیزه شده کار می‌کند. یک مدل 13 میلیاردی کار می‌کند. حتی می‌توانید یک مدل رده‌ی 30 میلیاردی را هم پیش ببرید اگر حافظه‌اش را داشته باشید. کاری که نمی‌توانید بکنید سریع کردنش است — خروجی با چند توکن در ثانیه می‌آید، نه آن جریان آنیِ یک API.

این معامله‌ی صادقانه است. برای چت تعاملی خسته‌کننده است. برای کار پس‌زمینه — خلاصه کردن اسناد در طول شب، دسته‌بندی یک صف، غنی‌سازی داده روی یک زمان‌بندی — چند توکن در ثانیه کاملاً خوب است، و هیچ‌کس چشمش به ساعت نیست.

ریاضیِ RAM

مدل باید در حافظه بنشیند، کوانتیزه‌شده یا نه، به‌علاوه‌ی سربار برای زمینه و زمان‌اجرا:

به همین دلیل است که «یک مدل محلی اجرا کن» بی‌سروصدا به یک پرسش پرحافظه بدل می‌شود. مدل همان ردپای حافظه است. یک ایندکس RAG یا عامل‌ها را روی همان جعبه اضافه کنید و اعداد روی هم می‌نشینند.

Ollama در برابر vLLM، کوتاه

‏Ollama درِ ورودیِ آسان است — نصب، ollama run، تمام. ابزار درست برای یک راه‌اندازی خصوصیِ تک‌کاربره است که فقط می‌خواهید مدل در دسترس باشد. ‏vLLM برای توان‌عملیاتیِ سرویس‌دهی ساخته شده: راه‌اندازی بیشتر، زیر بار همزمان بهتر، ارزش دارد وقتی که واقعاً حجم را مدیریت می‌کنید. با Ollama شروع کنید؛ سراغ vLLM بروید وقتی که ترافیک واقعی سرویس می‌دهید.

خصوصی-اول واقعاً کجا برنده است

استدلال به‌نفع استنتاج خودمیزبان سرعت یا هزینه نیست — این است که بعضی داده‌ها نمی‌توانند بیرون بروند. اسناد حقوقی. پرونده‌های پزشکی. کد اختصاصی. هرچه که فرستادن پرامپتش به یک API شخص‌ثالث به دلایل سیاست‌گذاری یا اعتماد از دستور خارج است. یک مدل کندتر که کاملاً روی ماشین شما اجرا می‌شود بر یک مدل سریع که همه‌چیزِ فرستاده‌شده به آن را لاگ می‌کند برتری دارد.

و اگر داده آن‌قدر حساس است، پرداخت هم احتمالاً باید خصوصی باشد. اجاره‌ی جعبه با رمزارز و بدون KYC کل زنجیره — سرور، مدل، پرامپت‌ها، صورت‌حساب — را از سوابق هویتیِ هرکسی دور نگه می‌دارد. این همان پیشنهاد واقعی است: نه «استنتاج ارزان‌تر»، بلکه «استنتاجی که هیچ‌کس دیگر نمی‌تواند ببیند.»

خط پایانی

برای سرعت و کیفیت، یک API به‌کار ببرید — ننگی در آن نیست. وقتی حریم خصوصی الزام است و کندتر قابل‌قبول است خودمیزبان کنید. برای مدل به‌علاوه‌ی زمینه‌اش به‌علاوه‌ی هرچه دیگری که جعبه را به اشتراک می‌گذارد اندازه بگیرید، و انتظار سرعت GPU از CPU نداشته باشید.

وقتی مدل به حافظه‌ی واقعی نیاز دارد، خط پرو از ۳۲ تا ۸۰ گیگابایت با یک IP اختصاصی و پشتیبان‌های شبانه اجرا می‌شود — به‌اندازه‌ی کافی برای نگه‌داشتن یک مدل کوانتیزه‌شده‌ی جدی با فضایی برای زمینه دورش.

سؤالات متداول

آیا می‌توانم بدون GPU یک LLM اجرا کنم؟

مدل‌های کوانتیزه‌شده‌ی کوچک، بله — و به‌کندی. یک مدل 7 تا 8 میلیاردی که به ۴-بیت کوانتیزه شده با RAM کافی روی CPU اجرا می‌شود، اما خروجی را با چند توکن در ثانیه می‌سنجید، نه آن جریان چابکی که از یک API می‌گیرید. برای کارهای دسته‌ای و وظایف پس‌زمینه خوب است، برای چت تعاملی دردناک.

برای استنتاج محلی چقدر RAM؟

مدل باید در حافظه به‌علاوه‌ی سربار جا شود. یک مدل 7 تا 8 میلیاردیِ ۴-بیتی حدود ۶ تا ۸ گیگابایت می‌خواهد؛ 13 میلیاردی حدود ۱۰ تا ۱۶ گیگابایت؛ مدل‌های رده‌ی 30 میلیاردی کوانتیزه‌شده تا ۲۴ تا ۴۸ گیگابایت می‌روند. برای زمینه و هرچه دیگری روی جعبه هست فضا اضافه کنید. به همین دلیل است که استنتاج محلی سریع به قلمرو پرحافظه می‌رسد.

‏Ollama یا vLLM؟

‏Ollama رمپ ورودی آسان است — یک دستور، مدل کشیده شد، در حال اجرا. ‏vLLM برای توان‌عملیاتی و سرویس‌دهی است، راه‌اندازی بیشتر، زیر بار بهتر. برای یک جعبه‌ی خصوصیِ تک‌کاربره، Ollama معمولاً انتخاب درست است؛ vLLM وقتی که واقعاً درخواست‌ها را در حجم بالا سرویس می‌دهید.

اگر کندتر است اصلاً چرا استنتاج را خودمیزبان کنیم؟

حریم خصوصی. پرامپت‌ها و خروجی‌های شما هرگز به سرورها یا لاگ‌های یک ارائه‌دهنده نمی‌خورند. برای داده‌ی حساس — حقوقی، پزشکی، کد داخلی، هرچه نمی‌توانید به شخص ثالث بفرستید — یک مدل خصوصیِ کندتر بر یک مدل سریع که همه‌چیز را می‌بیند برتری دارد. آن را با پرداخت رمزارزی بدون KYC جفت کنید و کل زنجیره مال خودتان می‌ماند.

← بازگشت به وبلاگ← پلن‌ها و قیمت‌ها

نظرات

هنوز نظری نیست. اولین نفر باشید.

یک نظر بگذارید

نظرات پیش از نمایش بررسی می‌شوند.