فرستادن هر پرامپت به API کس دیگر خوب است — تا وقتی که نیست. شاید داده حساس است و ترجیح میدهید هرگز سرورتان را ترک نکند. شاید از محدودیتهای نرخ خستهاید، یا از تغییرکردن نسخهی یک مدل زیر پایتان، یا از کنتوری که بهازای هر توکن تیکتاک میکند در حالی که آزمایش میکنید. در یک نقطه «اگر خودم یکی اجرا کنم چه؟» دیگر یک آزمایش فکری نیست.
Ollama این را واقعاً آسان میکند. سؤال سختتر این است که چه چیزی روی یک VPS جا میگیرد — و اینجا پاسخ صادقانه بیش از هیاهو اهمیت دارد.
واقعاً چه چیزی میتوانید روی CPU اجرا کنید
بدون GPU؟ پس دارید استنتاج روی CPU انجام میدهید، و اندازهی مدل همهچیز است. کوانتیزاسیون (فشردن وزنها به ۴ بیت) همان چیزی است که این را عملی میکند — کمی کیفیت از دست میدهید و کلی حافظه صرفهجویی میکنید.
اعداد تقریبی، همانهایی که مهماند:
- مدل 3B، چهاربیتی — حدود ۳ گیگابایت RAM. بهقدر کافی چابک برای چت و کارهای ساده.
- مدل 7B، چهاربیتی — حدود ۵ گیگابایت RAM. نقطهی طلایی: محسوساً باهوشتر، هنوز با سرعتی خوانا اجرا میشود.
- 13B و بالاتر — ۸ تا ۱۰ گیگابایت بهبالا و روی CPU کند. از نظر فنی ممکن، از نظر عملی آزاردهنده.
سرعت، صادقانه: روی چند vCPU مشتی توکن در ثانیه میبینید. کاملاً مناسب برای یک چتبات یا دستیار کدنویسی که همانطور که تایپ میکند میخوانید. مناسب برای پردازش دستهای یک میلیون سند نیست — آن کار GPU است، و ما وانمود نمیکنیم غیر از این باشد. ما نمونههای GPU ارائه نمیدهیم. اگر پلن شما به یک مدل 70B یا توان عملیاتی سنگین نیاز دارد، یک VPS با CPU — چه مال ما چه هر کس دیگر — ابزار اشتباه است، و باید این را قبل از اینکه یک سنت خرج کنید بدانید.
اما یک 7B خصوصی که به سؤالهایتان پاسخ میدهد و هرگز به خانه تلفن نمیزند؟ آن راحت روی یک دستگاه ۶ گیگابایتی اجرا میشود.
نصب — سه دستور
سرور را بالا بیاورید، با SSH وصل شوید، و:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
همین است — دارید در ترمینال چت میکنید. برای استفاده از آن از کد خودتان، Ollama همینحالا یک HTTP API روی پورت 11434 سرو میکند:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
یک نکتهی ارزشدانستن از همان اول: بهطور پیشفرض آن API به localhost گره میخورد. همانطور نگهش دارید و از طریق SSH تونل بزنید، وگرنه در معرض اینترنت است. اگر میخواهید قابلدسترس باشد، پشت احراز هویت بگذاریدش — یک endpoint مدل باز را روی یک IP عمومی رها نکنید.
انتخاب دستگاه
پلن را با مدل تطبیق دهید، نه برعکس:
| میخواهید اجرا کنید | RAM لازم | پلن معقول |
|---|---|---|
| مدل 3B، استفادهی سبک | حدود ۳ گیگابایت | Small (۴ گیگابایت) |
| مدل 7B، راحت | حدود ۵ تا ۶ گیگابایت | Medium (۶ گیگابایت) |
| بزرگتر / توان عملیاتی بالا | قلمرو GPU | نه یک VPS با CPU |
برای اکثر خودمیزبانها، Medium (۶ گیگابایت) پیشنهاد صادقانه است — فضای اضافی کافی برای یک مدل 7B بهعلاوهی اپلیکیشن و سیستمعامل شما. Small (۴ گیگابایت) کار میکند اگر به 3B بچسبید. هر چیزی پایینتر از آن وقتی سیستمعامل و زمینه فضا میخورند خیلی تنگ است.
چرا اینجا انجامش دهید
اگر دارید یک LLM خودمیزبانی میکنید، حریم خصوصی معمولاً نیمی از دلیل است — پس عجیب بود که کارت شناساییتان را تحویل دهید تا دستگاه را اجاره کنید. مجبور نیستید: میتوانید با USDC یا USDT (یا یک کارت از طریق on-ramp) پرداخت کنید، بدون KYC، و سرور در حدود یک دقیقه مال شماست. رمزارز-محلی، دوستدار عامل، و داده روی دستگاهی که کنترلش میکنید میماند.
معامله همان است که دربارهاش صادق بودهایم: فقط CPU، سقف ۶ گیگابایت، مدلهای کوچک. در آن محدوده، خودمیزبانی عالی است. بیرون از آن، نگذارید کسی یک دستگاه CPU را برای کاری که GPU میخواهد به شما بفروشد.
آمادهی امتحان؟ یک پلن انتخاب کنید، پرداخت کنید، و در حدود ۶۰ ثانیه root خواهید داشت — بعد سه دستور تا مدل خصوصی خودتان.
نظرات
هنوز نظری نیست. اولین نفر باشید.