پاسخ صادقانه به «عامل هوش مصنوعی من به چه مقدار سرور نیاز دارد؟» این است: کمتر از آنچه فکر میکنید — درست تا لحظهای که ناگهان اینطور نیست. ترفند این است که بدانید بار کاری شما کدام طرف آن خط قرار دارد. پس به جای حدس زدن، اینجا میبینید هر نوع عامل واقعاً چه مقدار مصرف میکند.
آن یک سؤالی که همهچیز را تعیین میکند
آیا مدل روی سرور شما اجرا میشود، یا عامل شما یک مدل را از طریق API فراخوانی میکند؟
اگر عامل شما با یک LLM میزبانیشده صحبت میکند (مورد رایج)، بخش هوشمند و گرانقیمت روی سختافزار شخص دیگری اتفاق میافتد. باکس شما فقط یک حلقهی هماهنگی را اجرا میکند: ورودی را بگیر، API را فراخوانی کن، نتیجه را تجزیه کن، شاید به یک پایگاهداده بزن، تکرار کن. این سبک است. واقعاً سبک — یک باکس ۱ گیگابایتی بدون ذرهای عرقریختن انجامش میدهد.
اگر مدل را محلی اجرا کنید، همهچیز عوض میشود: حالا RAM را وزنهای مدل تسخیر میکنند، و هر هستهای که بتوانید گیر بیاورید میخواهید. بیشتر مردم به این نیاز ندارند. آنهایی که نیاز دارند معمولاً دقیقاً میدانند چرا (حریم خصوصی، بدون محدودیت نرخ، آفلاین). اگر این شمایید، ما یک راهنمای جداگانه دربارهی خودمیزبانی یک LLM محلی نوشتهایم.
انتخاب اندازه بر اساس بار کاری
اعداد واقعی، از آن نوعی که میتوانید بر اساسش عمل کنید:
| بار کاری | RAM | vCPU | دیسک | یادداشتها |
|---|---|---|---|---|
| عامل چت / دستیار (متکی به API) | ۱ گیگابایت | ۲ | ۱۵ گیگابایت | حلقه ریز است؛ مدل از راه دور است |
| اسکرپر / عامل داده | ۲ گیگابایت | ۲ | ۲۵ گیگابایت | فضای اضافی برای تجزیه + دادهی اسکرپشده |
| ربات معاملاتی | ۱ تا ۲ گیگابایت | ۲ | ۱۵ تا ۲۵ گیگابایت | تأخیر بیش از اندازه اهمیت دارد — راهنمای ربات معاملاتی را ببینید |
| چند عامل بهموازات | ۴ گیگابایت | ۴ | ۳۵ گیگابایت | هر عامل ارزان است؛ همزمانی جمع میشود |
| LLM محلی، ۳B تا ۷B (کوانتیزه) | ۴ تا ۶ گیگابایت | ۴ تا ۶ | ۲۵ تا ۴۵ گیگابایت | فقط-CPU، با سرعتی خواندنی اجرا میشود، نه انبوه |
الگو: عاملهای متکی به API ریز هستند؛ مدلهای محلی تنها چیز سنگیناند.
کجا یک باکس CPU تمام میشود
رک دربارهی سقف: پلنهای ما در ۶ گیگابایت RAM و ۶ هسته، فقط-CPU — بدون GPU به بالاترین حد میرسند. این همهچیز در جدول بالا را پوشش میدهد، از جمله یک مدل محلی ۷B برای استفادهی شخصی. آنچه پوشش نمیدهد: مدلهای ۱۳B به بالا، استنتاج محلی با توان عملیاتی بالا، یا هر چیزی که واقعاً به یک GPU نیاز دارد. اگر بار کاری شما این است، یک VPS از نوع CPU — چه مال ما چه مال هر کسی — ابزار اشتباه است، و بهتر است همین حالا این را بدانید تا بعد از اینکه مستقرش کردید.
برای آن ۹۵٪ عاملها که یک API را فراخوانی میکنند، هیچکدام از اینها مشکلی نیست. آنها روی کوچکترین باکس خوشحالاند.
یک قاعدهی سرانگشتیِ عملی
- فقط یک عامل که یک API را فراخوانی میکند؟ از ۱ گیگابایت / ۲ هسته شروع کنید. بعداً میتوانید تغییر اندازه دهید.
- اسکرپینگ یا ذخیرهی داده؟ ۲ گیگابایت و یک دیسک بزرگتر.
- اجرای چند عامل، یا یک مدل محلی کوچک؟ ۴ تا ۶ گیگابایت و ۴+ هسته.
- به یک GPU نیاز دارد؟ دستهی متفاوتی است — به زور روی CPU تحمیلش نکنید.
از سرِ نگرانی بیش از حد ظرفیتبندی نکنید. عاملها ذاتاً سبکوزناند؛ هزینهی یک باکس خیلی-کوچک یک بار تغییر اندازه است، در حالی که هزینهی یک باکس خیلی-بزرگ پرداختِ ماهانه برای RAM بیکار است.
وقتی یک اندازه انتخاب کردید، یک عامل میتواند خودش باکس را از طریق MCP اجاره کند، یا شما میتوانید ظرف یک دقیقه در سایت سفارشش دهید. در هر صورت، کوچک شروع کنید — تقریباً بهیقین به کمتر از آنچه انتظار داشتید نیاز خواهید داشت.
نظرات
هنوز نظری نیست. اولین نفر باشید.