Ollama הופך הרצת מודל מקומי להתקנה בשורה אחת. זה ה-how-to; לתמונה הכנה של מה ש-CPU inference יכול ולא יכול לעשות (ונקודת המתיקות של RAG), ראו את מקרה השימוש VPS ל-Ollama ו-אחסון עצמי של Ollama.
1. התקינו את Ollama
curl -fsSL https://ollama.com/install.sh | sh
זה מתקין את Ollama ומתחיל אותו כשירות systemd שמאזין על localhost:11434.
2. משכו והריצו מודל קטן
על מכונת CPU, התחילו קטן:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
מודלים של 3B שמישים באמת על CPU; 7–8B רצים בכמה טוקנים/שנ' (בסדר ל-batch, כואב לצ'אט); 13B+ יעשו swap ויזחלו — אל.
3. קראו ל-HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings הם נקודת המתיקות של ה-CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. שמרו אותו על localhost — חשפו בבטחה אם צריך
Ollama נקשר ל-127.0.0.1:11434 כברירת מחדל. השאירו אותו שם. אם אתם צריכים להגיע אליו ממכונה אחרת, שימו reverse proxy עם אימות מלפנים בתוכנית עם IP ייעודי (מדריך nginx + HTTPS) או השתמשו ב-SSH tunnel — לעולם אל תחשפו נקודת קצה של מודל ללא אימות באופן ציבורי.
החלק הכן
אלה מופעים CPU-בלבד (ללא GPU). מודלים קוונטיזיים קטנים ו-embeddings רצים טוב; מודלים גדולים לא. שלבו את Ollama עם vector DB לערימת RAG פרטית — embeddings מקומיים קטנים בתוספת אחסון וקטורי מקומי הם ההגדרה שבאמת זורחת כאן. Medium ($12/חודש, 6 GB) היא התוכנית הנוחה. root בערך תוך דקה, ללא KYC, שלמו בקריפטו.
תגובות
אין עדיין תגובות. היו הראשונים.