EQVPS

איך להתקין Ollama על VPS (ולקרוא ל-API שלו)

התקינו את Ollama על VPS, משכו מודל קטן, וקראו ל-HTTP API שלו — עם ההערה הכנה שאלה מכונות CPU, אז הישארו עם מודלים קוונטיזיים קטנים ו-embeddings. פקודות העתק-הדבק, ואיך לחשוף אותו בבטחה.

Ollama הופך הרצת מודל מקומי להתקנה בשורה אחת. זה ה-how-to; לתמונה הכנה של מה ש-CPU inference יכול ולא יכול לעשות (ונקודת המתיקות של RAG), ראו את מקרה השימוש VPS ל-Ollama ו-אחסון עצמי של Ollama.

1. התקינו את Ollama

curl -fsSL https://ollama.com/install.sh | sh

זה מתקין את Ollama ומתחיל אותו כשירות systemd שמאזין על localhost:11434.

2. משכו והריצו מודל קטן

על מכונת CPU, התחילו קטן:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

מודלים של 3B שמישים באמת על CPU; 7–8B רצים בכמה טוקנים/שנ' (בסדר ל-batch, כואב לצ'אט); 13B+ יעשו swap ויזחלו — אל.

3. קראו ל-HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings הם נקודת המתיקות של ה-CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. שמרו אותו על localhost — חשפו בבטחה אם צריך

Ollama נקשר ל-127.0.0.1:11434 כברירת מחדל. השאירו אותו שם. אם אתם צריכים להגיע אליו ממכונה אחרת, שימו reverse proxy עם אימות מלפנים בתוכנית עם IP ייעודי (מדריך nginx + HTTPS) או השתמשו ב-SSH tunnel — לעולם אל תחשפו נקודת קצה של מודל ללא אימות באופן ציבורי.

החלק הכן

אלה מופעים CPU-בלבד (ללא GPU). מודלים קוונטיזיים קטנים ו-embeddings רצים טוב; מודלים גדולים לא. שלבו את Ollama עם vector DB לערימת RAG פרטית — embeddings מקומיים קטנים בתוספת אחסון וקטורי מקומי הם ההגדרה שבאמת זורחת כאן. Medium ($12/חודש, 6 GB) היא התוכנית הנוחה. root בערך תוך דקה, ללא KYC, שלמו בקריפטו.

שאלות נפוצות

איך אני מתקין את Ollama על VPS?

פקודה אחת: curl -fsSL https://ollama.com/install.sh | sh. ואז ollama pull למודל קטן ו-ollama run אותו, או קראו ל-HTTP API על localhost:11434. הצעדים למטה. על VPS של CPU הישארו עם מודלים קוונטיזיים קטנים (1B–8B) ו-embeddings — מודלים גדולים צריכים GPU.

האם מודלים יהיו מהירים על VPS של CPU?

קטנים, כן; גדולים, לא. צפו לכמה טוקנים בשנייה על מודל 7–8B בקוונטיזציית 4-bit, וביצועים זריזים באמת על מודלים של 1–3B ומודלי embedding. זה מצוין למשימות רקע, סיווג ו-pipelines של RAG — לא לצ'אט אינטראקטיבי מהיר על מודל גדול.

האם כדאי לי לחשוף את ה-API של Ollama לאינטרנט?

לא. שמרו אותו על localhost:11434. אם אתם צריכים גישה מרחוק, שימו אותו מאחורי reverse proxy עם אימות בתוכנית עם IP ייעודי, או הגיעו אליו דרך SSH tunnel. לעולם אל תחשפו נקודת קצה של מודל ללא אימות לאינטרנט הפתוח.

איזו תוכנית אני צריך?

ה-Medium שלנו ($12/חודש, 6 GB) מתאים למודלים קטנים ו-embeddings בנוחות; Small ($8) עובד לבדיקת מודלים של 1–3B. אלה מופעים CPU-בלבד — ללא GPU — אז התאימו את הגודל לפי טביעת ה-RAM של המודל, לא מתוך תקווה למהירות.

האם אתם מבקשים תעודה או כרטיס?

לא. אימייל להרשמה, שלמו ב-USDC או USDT — ללא מסמכים, ללא כרטיס.

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.