گرمای تابستان — همه‌چیز آب می‌شود، حتی قیمت‌های ما.−25%−۲۵٪ روی هر پلن سالانه، تا ۳۱ اوتدیدن پلن‌ها
EQVPS

خودمیزبانی یک LLM محلی روی یک VPS با Ollama — چه چیزی واقعاً کار می‌کند

24 خرداد 1405 · 3 دقیقه مطالعه · EQVPS Team

فرستادن هر پرامپت به API کس دیگر خوب است — تا وقتی که نیست. شاید داده حساس است و ترجیح می‌دهید هرگز سرورتان را ترک نکند. شاید از محدودیت‌های نرخ خسته‌اید، یا از تغییرکردن نسخه‌ی یک مدل زیر پایتان، یا از کنتوری که به‌ازای هر توکن تیک‌تاک می‌کند در حالی که آزمایش می‌کنید. در یک نقطه «اگر خودم یکی اجرا کنم چه؟» دیگر یک آزمایش فکری نیست.

Ollama این را واقعاً آسان می‌کند. سؤال سخت‌تر این است که چه چیزی روی یک VPS جا می‌گیرد — و اینجا پاسخ صادقانه بیش از هیاهو اهمیت دارد.

واقعاً چه چیزی می‌توانید روی CPU اجرا کنید

بدون GPU؟ پس دارید استنتاج روی CPU انجام می‌دهید، و اندازه‌ی مدل همه‌چیز است. کوانتیزاسیون (فشردن وزن‌ها به ۴ بیت) همان چیزی است که این را عملی می‌کند — کمی کیفیت از دست می‌دهید و کلی حافظه صرفه‌جویی می‌کنید.

اعداد تقریبی، همان‌هایی که مهم‌اند:

سرعت، صادقانه: روی چند vCPU مشتی توکن در ثانیه می‌بینید. کاملاً مناسب برای یک چت‌بات یا دستیار کدنویسی که همان‌طور که تایپ می‌کند می‌خوانید. مناسب برای پردازش دسته‌ای یک میلیون سند نیست — آن کار GPU است، و ما وانمود نمی‌کنیم غیر از این باشد. ما نمونه‌های GPU ارائه نمی‌دهیم. اگر پلن شما به یک مدل 70B یا توان عملیاتی سنگین نیاز دارد، یک VPS با CPU — چه مال ما چه هر کس دیگر — ابزار اشتباه است، و باید این را قبل از اینکه یک سنت خرج کنید بدانید.

اما یک 7B خصوصی که به سؤال‌هایتان پاسخ می‌دهد و هرگز به خانه تلفن نمی‌زند؟ آن راحت روی یک دستگاه ۶ گیگابایتی اجرا می‌شود.

نصب — سه دستور

سرور را بالا بیاورید، با SSH وصل شوید، و:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

همین است — دارید در ترمینال چت می‌کنید. برای استفاده از آن از کد خودتان، Ollama همین‌حالا یک HTTP API روی پورت 11434 سرو می‌کند:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

یک نکته‌ی ارزش‌دانستن از همان اول: به‌طور پیش‌فرض آن API به localhost گره می‌خورد. همان‌طور نگهش دارید و از طریق SSH تونل بزنید، وگرنه در معرض اینترنت است. اگر می‌خواهید قابل‌دسترس باشد، پشت احراز هویت بگذاریدش — یک endpoint مدل باز را روی یک IP عمومی رها نکنید.

انتخاب دستگاه

پلن را با مدل تطبیق دهید، نه برعکس:

می‌خواهید اجرا کنیدRAM لازمپلن معقول
مدل 3B، استفاده‌ی سبکحدود ۳ گیگابایتSmall (۴ گیگابایت)
مدل 7B، راحتحدود ۵ تا ۶ گیگابایتMedium (۶ گیگابایت)
بزرگ‌تر / توان عملیاتی بالاقلمرو GPUنه یک VPS با CPU

برای اکثر خودمیزبان‌ها، Medium (۶ گیگابایت) پیشنهاد صادقانه است — فضای اضافی کافی برای یک مدل 7B به‌علاوه‌ی اپلیکیشن و سیستم‌عامل شما. Small (۴ گیگابایت) کار می‌کند اگر به 3B بچسبید. هر چیزی پایین‌تر از آن وقتی سیستم‌عامل و زمینه فضا می‌خورند خیلی تنگ است.

چرا اینجا انجامش دهید

اگر دارید یک LLM خودمیزبانی می‌کنید، حریم خصوصی معمولاً نیمی از دلیل است — پس عجیب بود که کارت شناسایی‌تان را تحویل دهید تا دستگاه را اجاره کنید. مجبور نیستید: می‌توانید با USDC یا USDT (یا یک کارت از طریق on-ramp) پرداخت کنید، بدون KYC، و سرور در حدود یک دقیقه مال شماست. رمزارز-محلی، دوستدار عامل، و داده روی دستگاهی که کنترلش می‌کنید می‌ماند.

معامله همان است که درباره‌اش صادق بوده‌ایم: فقط CPU، سقف ۶ گیگابایت، مدل‌های کوچک. در آن محدوده، خودمیزبانی عالی است. بیرون از آن، نگذارید کسی یک دستگاه CPU را برای کاری که GPU می‌خواهد به شما بفروشد.

آماده‌ی امتحان؟ یک پلن انتخاب کنید، پرداخت کنید، و در حدود ۶۰ ثانیه root خواهید داشت — بعد سه دستور تا مدل خصوصی خودتان.

سؤالات متداول

آیا می‌توانم بدون GPU یک LLM اجرا کنم؟

بله، برای مدل‌های کوچک. یک مدل 3B یا 7B با کوانتیزاسیون ۴ بیتی روی CPU اجرا می‌شود و با سرعتی خوانا پاسخ می‌دهد — مناسب برای یک چت‌بات، یک دستیار کدنویسی، یا کارهای پس‌زمینه‌ای که مکان‌نما را تماشا نمی‌کنید. کاری که روی CPU نمی‌توانید بکنید سرو یک مدل بزرگ (13B و بالاتر) یا فشار توان عملیاتی بالا است؛ آنجاست که GPU دیگر اختیاری نیست.

برای Llama 7B چقدر RAM نیاز دارم؟

حدود ۵ گیگابایت برای یک مدل 7B چهاربیتی وقتی پنجره‌ی زمینه و سیستم‌عامل را اضافه کنید — پس یک دستگاه ۶ گیگابایتی کف راحت است. یک مدل 3B در حدود ۳ گیگابایت جا می‌گیرد. کوانت کوچک‌تر (Q4) کمی کیفیت را با حافظه‌ی خیلی کمتر معامله می‌کند، که روی یک VPS معامله‌ی درستی است.

آیا خودمیزبانی یک LLM از یک API ارزان‌تر است؟

بستگی به حجم دارد. یک API میزبانی‌شده به‌ازای هر توکن هزینه می‌گیرد و در بی‌کاری هیچ هزینه‌ای ندارد؛ یک VPS یک صورتحساب ماهانه‌ی ثابت است چه استفاده کنید چه نکنید. اگر یک جریان پیوسته از درخواست‌ها اجرا می‌کنید، یا عمدتاً به حریم خصوصی و نبود محدودیت نرخ اهمیت می‌دهید، خودمیزبانی برنده است. برای پرامپت‌های گاه‌به‌گاه، یک API کنتوردار ارزان‌تر است.

چرا خودمیزبانی به‌جای استفاده از یک API ابری؟

سه دلیلی که مردم واقعاً این کار را می‌کنند: داده هرگز سرورتان را ترک نمی‌کند (واقعی برای موارد حقوقی، پزشکی، یا صرفاً یادداشت‌های خصوصی)، هیچ محدودیت نرخ یا کنتور به‌ازای هر توکنی نیست، و مدل زیر پایتان تغییر نمی‌کند یا منسوخ نمی‌شود. هزینه‌اش این است که دستگاه را مدیریت می‌کنید و در محدوده‌ی سخت‌افزارش زندگی می‌کنید.

بزرگ‌ترین مدلی که به‌طور واقع‌بینانه می‌توانم روی یک VPS با CPU اجرا کنم چیست؟

یک مدل 7B چهاربیتی نقطه‌ی طلایی روی یک دستگاه ۶ گیگابایتی است. از نظر فنی می‌توانید با RAM کافی یک 13B را بارگذاری کنید، اما روی CPU آن‌قدر کند می‌شود که حسش می‌کنید. فراتر از آن یک GPU می‌خواهید، که نوع دیگری از میزبان است.

← بازگشت به وبلاگ← پلن‌ها و قیمت‌ها

نظرات

هنوز نظری نیست. اولین نفر باشید.

یک نظر بگذارید

نظرات پیش از نمایش بررسی می‌شوند.