EQVPS

אחסון-עצמי של LLM מקומי על VPS עם Ollama — מה באמת עובד

14 ביוני 2026 · 3 דק' קריאה · EQVPS Team

לשלוח כל prompt ל-API של מישהו אחר זה בסדר — עד שזה לא. אולי הנתונים רגישים והייתם מעדיפים שהם לעולם לא יעזבו את השרת שלכם. אולי נמאס לכם ממגבלות קצב, או מגרסת מודל שמשתנה תחת הרגליים שלכם, או ממד לפי-טוקן שמתקתק בזמן שאתם מתנסים. בנקודה מסוימת "מה אם פשוט אריץ משלי?" מפסיק להיות ניסוי מחשבתי.

Ollama הופך את זה לקל באמת. השאלה הקשה יותר היא מה נכנס ל-VPS — וכאן התשובה הכנה חשובה יותר מההייפ.

מה אתם באמת יכולים להריץ על CPU

אין GPU? אז אתם עושים inference על CPU, וגודל המודל הוא הכל. קוונטיזציה (דחיסת המשקלים ל-4-bit) היא מה שהופך את זה למעשי — אתם מאבדים שבריר איכות וחוסכים ערמת זיכרון.

מספרים גסים, אלה שחשובים:

מהירות, בכנות: על כמה vCPUs תראו קומץ טוקנים לשנייה. בסדר גמור לצ'אטבוט או עוזר קידוד שבהם אתם קוראים בזמן שהוא מקליד. לא בסדר לעיבוד-batch של מיליון מסמכים — זו עבודת GPU, ואנחנו לא מעמידים פנים אחרת. אנחנו לא מציעים מופעי GPU. אם התוכנית שלכם צריכה מודל 70B או תפוקה כבדה, VPS של CPU — שלנו או של כל אחד — הוא הכלי הלא נכון, וכדאי שתדעו את זה לפני שאתם מוציאים אגורה.

אבל 7B פרטי שעונה על השאלות שלכם ואף פעם לא מתקשר הביתה? זה רץ בנוחות על ארגז 6 GB.

ההתקנה — שלוש פקודות

הקימו את השרת, התחברו ב-SSH, ו:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

זהו — אתם מצ'טטים בטרמינל. כדי להשתמש בו מהקוד שלכם, Ollama כבר מגיש API של HTTP על פורט 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

מלכודת אחת ששווה לדעת מראש: כברירת מחדל ה-API הזה קשור ל-localhost. שמרו אותו ככה ותעלו דרך SSH, או שהוא חשוף לאינטרנט. אם אתם רוצים שהוא יהיה נגיש, שימו אותו מאחורי אימות — אל תשאירו נקודת קצה של מודל פתוחה על IP ציבורי.

בחירת הארגז

התאימו את התוכנית למודל, לא הפוך:

מה שאתם רוצים להריץRAM שאתם צריכיםתוכנית הגיונית
מודל 3B, שימוש קל~3 GBSmall (4 GB)
מודל 7B, בנוחות~5-6 GBMedium (6 GB)
גדול יותר / תפוקה גבוההשטח GPUלא VPS של CPU

לרוב מאחסני-העצמי, Medium (6 GB) היא ההמלצה הכנה — מספיק מרווח למודל 7B בתוספת האפליקציה ומערכת ההפעלה שלכם. Small (4 GB) עובד אם אתם נצמדים ל-3B. כל דבר מתחת לזה צפוף מדי ברגע שמערכת ההפעלה וה-context אוכלים.

למה לעשות את זה כאן

אם אתם מאחסנים-בעצמכם LLM, פרטיות בדרך כלל חצי מהסיבה — אז יהיה מוזר למסור את התעודה שלכם כדי לשכור את הארגז. אתם לא צריכים: אתם יכולים לשלם ב-USDC או USDT (או כרטיס דרך ה-on-ramp), ללא KYC, והשרת שלכם בערך תוך דקה. קריפטו-נייטיב, ידידותי-לסוכן, והנתונים נשארים על מכונה שאתם שולטים בה.

הפשרה היא זו שהיינו כנים לגביה: CPU בלבד, תקרת 6 GB, מודלים קטנים. בתוך זה, אחסון-עצמי נהדר. מחוץ לזה, אל תתנו לאף אחד למכור לכם ארגז CPU לעבודה שצריכה GPU.

מוכנים לנסות? בחרו תוכנית, שלמו, ויהיה לכם root בערך תוך 60 שניות — ואז זה שלוש פקודות למודל הפרטי שלכם.

שאלות נפוצות

האם אני יכול להריץ LLM ללא GPU?

כן, למודלים קטנים. מודל 3B או 7B בקוונטיזציה של 4-bit רץ על CPU ועונה בקצב קריא — בסדר לצ'אטבוט, עוזר קידוד, או משימות רקע שבהן אתם לא צופים בסמן. מה שאתם לא יכולים לעשות על CPU זה להגיש מודל גדול (13B ומעלה) או לדחוף תפוקה גבוהה; שם GPU מפסיק להיות אופציונלי.

כמה RAM אני צריך ל-Llama 7B?

בערך 5 GB למודל 7B ב-4-bit ברגע שאתם מוסיפים את חלון ה-context ואת מערכת ההפעלה — אז ארגז 6 GB הוא הרצפה הנוחה. מודל 3B נכנס בערך ב-3 GB. quant קטן יותר (Q4) מחליף מעט איכות בהרבה פחות זיכרון, שזו העסקה הנכונה על VPS.

האם אחסון-עצמי של LLM זול יותר מ-API?

זה תלוי בנפח. API מאוחסן מחייב לפי טוקן ולא עולה כלום כשבטל; VPS הוא חשבון חודשי קבוע בין אם אתם משתמשים ובין אם לא. אם אתם מריצים זרם קבוע של בקשות, או שאתם בעיקר אכפת לכם מפרטיות וללא מגבלות קצב, אחסון-עצמי מנצח. ל-prompts חד-פעמיים מזדמנים, API נמדד זול יותר.

למה לאחסן-בעצמי במקום להשתמש ב-API של ענן?

שלוש סיבות שאנשים באמת עושים את זה: הנתונים לעולם לא עוזבים את השרת שלכם (אמיתי למשפטי, רפואי, או סתם הערות פרטיות), אין מגבלות קצב או מד לפי-טוקן, והמודל לא ישתנה או ייזנח תחתיכם. העלות היא שאתם מנהלים את הארגז וחיים בתוך החומרה שלו.

מה המודל הגדול ביותר שאני יכול באופן מציאותי להריץ על VPS של CPU?

מודל 7B ב-4-bit הוא הנקודה המתוקה על ארגז 6 GB. אתם יכולים טכנית לטעון 13B עם מספיק RAM, אבל על CPU הוא נעשה איטי מספיק שתרגישו את זה. מעבר לזה אתם רוצים GPU, שזה סוג אחר של מארח.

← חזרה לבלוגראו תוכניות ומחירים →

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.