Ollama اجرای یک مدل محلی را به نصبی یکخطی تبدیل میکند. این راهنماست؛ برای تصویر صادقانه از آنچه استنتاجِ CPU میتواند و نمیتواند انجام دهد (و نقطهٔ شیرینِ RAG) کاربردِ VPS برای Ollama و خودمیزبانیِ Ollama را ببین.
۱. Ollama را نصب کن
curl -fsSL https://ollama.com/install.sh | sh
این Ollama را نصب میکند و آن را بهعنوان یک سرویس systemd که روی localhost:11434 گوش میدهد اجرا میکند.
۲. یک مدل کوچک را بکش و اجرا کن
روی ماشین CPU، کوچک شروع کن:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
مدلهای 3B روی CPU بهراستی قابلاستفادهاند؛ 7–8B با چند توکن/ثانیه اجرا میشوند (خوب برای دستهای، دردناک برای چت)؛ 13B+ سواپ میکنند و میخزند — نکن.
۳. API HTTP را فراخوانی کن
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
امبدینگها نقطهٔ شیرینِ CPU هستند:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
۴. روی localhost نگهاش دار — در صورت نیاز ایمن در معرض بگذار
Ollama بهطور پیشفرض به 127.0.0.1:11434 bind میشود. همانجا نگهاش دار. اگر لازم است از ماشین دیگری به آن برسی، جلویش یک reverse proxy با احراز هویت روی طرح IP اختصاصی بگذار (راهنمای nginx + HTTPS) یا از تونل SSH استفاده کن — هرگز نقطهٔ پایانی مدلِ بدون احراز هویت را عمومی در معرض نگذار.
بخش صادقانه
اینها نمونههای فقط-CPU هستند (بدون GPU). مدلهای کوانتیزهٔ کوچک و امبدینگها خوب اجرا میشوند؛ بزرگها نه. Ollama را با یک پایگاه دادهٔ برداری برای یک پشتهٔ RAG خصوصی جفت کن — امبدینگهای محلی کوچک بههمراه یک ذخیرهسازِ برداری محلی، همان چیدمانی است که اینجا واقعاً میدرخشد. Medium (۱۲ دلار در ماه، ۶ گیگابایت) طرح راحت است. root در حدود یک دقیقه، بدون KYC، پرداخت با ارز دیجیتال.
نظرات
هنوز نظری نیست. اولین نفر باشید.