לשלוח כל prompt ל-API של מישהו אחר זה בסדר — עד שזה לא. אולי הנתונים רגישים והייתם מעדיפים שהם לעולם לא יעזבו את השרת שלכם. אולי נמאס לכם ממגבלות קצב, או מגרסת מודל שמשתנה תחת הרגליים שלכם, או ממד לפי-טוקן שמתקתק בזמן שאתם מתנסים. בנקודה מסוימת "מה אם פשוט אריץ משלי?" מפסיק להיות ניסוי מחשבתי.
Ollama הופך את זה לקל באמת. השאלה הקשה יותר היא מה נכנס ל-VPS — וכאן התשובה הכנה חשובה יותר מההייפ.
מה אתם באמת יכולים להריץ על CPU
אין GPU? אז אתם עושים inference על CPU, וגודל המודל הוא הכל. קוונטיזציה (דחיסת המשקלים ל-4-bit) היא מה שהופך את זה למעשי — אתם מאבדים שבריר איכות וחוסכים ערמת זיכרון.
מספרים גסים, אלה שחשובים:
- מודל 3B, 4-bit — ~3 GB RAM. זריז מספיק לצ'אט ומשימות פשוטות.
- מודל 7B, 4-bit — ~5 GB RAM. הנקודה המתוקה: חכם באופן ניכר, עדיין רץ בקצב קריא.
- 13B ומעלה — 8-10 GB+ ואיטי על CPU. טכנית אפשרי, מעשית מעצבן.
מהירות, בכנות: על כמה vCPUs תראו קומץ טוקנים לשנייה. בסדר גמור לצ'אטבוט או עוזר קידוד שבהם אתם קוראים בזמן שהוא מקליד. לא בסדר לעיבוד-batch של מיליון מסמכים — זו עבודת GPU, ואנחנו לא מעמידים פנים אחרת. אנחנו לא מציעים מופעי GPU. אם התוכנית שלכם צריכה מודל 70B או תפוקה כבדה, VPS של CPU — שלנו או של כל אחד — הוא הכלי הלא נכון, וכדאי שתדעו את זה לפני שאתם מוציאים אגורה.
אבל 7B פרטי שעונה על השאלות שלכם ואף פעם לא מתקשר הביתה? זה רץ בנוחות על ארגז 6 GB.
ההתקנה — שלוש פקודות
הקימו את השרת, התחברו ב-SSH, ו:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
זהו — אתם מצ'טטים בטרמינל. כדי להשתמש בו מהקוד שלכם, Ollama כבר מגיש API של HTTP על פורט 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
מלכודת אחת ששווה לדעת מראש: כברירת מחדל ה-API הזה קשור ל-localhost. שמרו אותו ככה ותעלו דרך SSH, או שהוא חשוף לאינטרנט. אם אתם רוצים שהוא יהיה נגיש, שימו אותו מאחורי אימות — אל תשאירו נקודת קצה של מודל פתוחה על IP ציבורי.
בחירת הארגז
התאימו את התוכנית למודל, לא הפוך:
| מה שאתם רוצים להריץ | RAM שאתם צריכים | תוכנית הגיונית |
|---|---|---|
| מודל 3B, שימוש קל | ~3 GB | Small (4 GB) |
| מודל 7B, בנוחות | ~5-6 GB | Medium (6 GB) |
| גדול יותר / תפוקה גבוהה | שטח GPU | לא VPS של CPU |
לרוב מאחסני-העצמי, Medium (6 GB) היא ההמלצה הכנה — מספיק מרווח למודל 7B בתוספת האפליקציה ומערכת ההפעלה שלכם. Small (4 GB) עובד אם אתם נצמדים ל-3B. כל דבר מתחת לזה צפוף מדי ברגע שמערכת ההפעלה וה-context אוכלים.
למה לעשות את זה כאן
אם אתם מאחסנים-בעצמכם LLM, פרטיות בדרך כלל חצי מהסיבה — אז יהיה מוזר למסור את התעודה שלכם כדי לשכור את הארגז. אתם לא צריכים: אתם יכולים לשלם ב-USDC או USDT (או כרטיס דרך ה-on-ramp), ללא KYC, והשרת שלכם בערך תוך דקה. קריפטו-נייטיב, ידידותי-לסוכן, והנתונים נשארים על מכונה שאתם שולטים בה.
הפשרה היא זו שהיינו כנים לגביה: CPU בלבד, תקרת 6 GB, מודלים קטנים. בתוך זה, אחסון-עצמי נהדר. מחוץ לזה, אל תתנו לאף אחד למכור לכם ארגז CPU לעבודה שצריכה GPU.
מוכנים לנסות? בחרו תוכנית, שלמו, ויהיה לכם root בערך תוך 60 שניות — ואז זה שלוש פקודות למודל הפרטי שלכם.
תגובות
אין עדיין תגובות. היו הראשונים.