EQVPS

چطور Ollama را روی VPS نصب کنیم (و API آن را فراخوانی کنیم)

Ollama را روی VPS نصب کن، یک مدل کوچک بکش و API HTTP آن را فراخوانی کن — با این یادداشت صادقانه که این‌ها ماشین‌های CPU هستند، پس به مدل‌های کوانتیزهٔ کوچک و امبدینگ‌ها بچسب. فرمان‌های کپی-پیست و اینکه چطور آن را ایمن در معرض قرار دهیم.

Ollama اجرای یک مدل محلی را به نصبی یک‌خطی تبدیل می‌کند. این راهنماست؛ برای تصویر صادقانه از آنچه استنتاجِ CPU می‌تواند و نمی‌تواند انجام دهد (و نقطهٔ شیرینِ RAG) کاربردِ VPS برای Ollama و خودمیزبانیِ Ollama را ببین.

۱. Ollama را نصب کن

curl -fsSL https://ollama.com/install.sh | sh

این Ollama را نصب می‌کند و آن را به‌عنوان یک سرویس systemd که روی localhost:11434 گوش می‌دهد اجرا می‌کند.

۲. یک مدل کوچک را بکش و اجرا کن

روی ماشین CPU، کوچک شروع کن:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

مدل‌های 3B روی CPU به‌راستی قابل‌استفاده‌اند؛ 7–8B با چند توکن/ثانیه اجرا می‌شوند (خوب برای دسته‌ای، دردناک برای چت)؛ 13B+ سواپ می‌کنند و می‌خزند — نکن.

۳. API HTTP را فراخوانی کن

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

امبدینگ‌ها نقطهٔ شیرینِ CPU هستند:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

۴. روی localhost نگه‌اش دار — در صورت نیاز ایمن در معرض بگذار

Ollama به‌طور پیش‌فرض به 127.0.0.1:11434 bind می‌شود. همان‌جا نگه‌اش دار. اگر لازم است از ماشین دیگری به آن برسی، جلویش یک reverse proxy با احراز هویت روی طرح IP اختصاصی بگذار (راهنمای nginx + HTTPS) یا از تونل SSH استفاده کن — هرگز نقطهٔ پایانی مدلِ بدون احراز هویت را عمومی در معرض نگذار.

بخش صادقانه

این‌ها نمونه‌های فقط-CPU هستند (بدون GPU). مدل‌های کوانتیزهٔ کوچک و امبدینگ‌ها خوب اجرا می‌شوند؛ بزرگ‌ها نه. Ollama را با یک پایگاه دادهٔ برداری برای یک پشتهٔ RAG خصوصی جفت کن — امبدینگ‌های محلی کوچک به‌همراه یک ذخیره‌سازِ برداری محلی، همان چیدمانی است که اینجا واقعاً می‌درخشد. Medium (۱۲ دلار در ماه، ۶ گیگابایت) طرح راحت است. root در حدود یک دقیقه، بدون KYC، پرداخت با ارز دیجیتال.

پرسش‌های متداول

چطور Ollama را روی VPS نصب کنم؟

یک فرمان: curl -fsSL https://ollama.com/install.sh | sh. سپس ollama pull یک مدل کوچک و ollama run آن، یا API HTTP را روی localhost:11434 فراخوانی کن. مراحل در پایین است. روی VPS با CPU به مدل‌های کوانتیزهٔ کوچک (1B–8B) و امبدینگ‌ها بچسب — مدل‌های بزرگ به GPU نیاز دارند.

آیا مدل‌ها روی VPS با CPU سریع خواهند بود؟

کوچک‌ها بله، بزرگ‌ها نه. روی یک مدل 7–8B با کوانتیزاسیون ۴ بیت چند توکن در ثانیه انتظار داشته باش، و کارایی به‌راستی چابک روی مدل‌های 1–3B و مدل‌های امبدینگ. عالی برای کارهای پس‌زمینه، دسته‌بندی و خط‌لوله‌های RAG — نه برای یک چت تعاملیِ سریع روی یک مدل بزرگ.

آیا باید API Ollama را به اینترنت در معرض بگذارم؟

نه. آن را روی localhost:11434 نگه دار. اگر به دسترسی از راه دور نیاز داری، آن را پشت یک reverse proxy با احراز هویت روی طرح IP اختصاصی بگذار، یا از طریق تونل SSH به آن برس. هرگز یک نقطهٔ پایانی مدلِ بدون احراز هویت را به اینترنت باز در معرض نگذار.

چه طرحی نیاز دارم؟

Medium ما (۱۲ دلار در ماه، ۶ گیگابایت) برای مدل‌های کوچک و امبدینگ‌ها به‌راحتی مناسب است؛ Small (۸ دلار) برای آزمایش مدل‌های 1–3B کار می‌کند. این‌ها نمونه‌های فقط-CPU هستند — بدون GPU — پس اندازه را با ردپای RAM مدل تعیین کن، نه با امید به سرعت.

آیا مدرک شناسایی یا کارت می‌خواهید؟

نه. یک ایمیل برای ثبت‌نام، پرداخت با USDC یا USDT — بدون مدرک، بدون کارت.

نظرات

هنوز نظری نیست. اولین نفر باشید.

یک نظر بگذارید

نظرات پیش از نمایش بررسی می‌شوند.