EQVPS

אחסון inference מקומי של LLM בפרטיות: מה VPS של CPU כן ולא יכול לעשות

9 באוג׳ 2026 · 2 דק' קריאה · EQVPS Team

בואו נהיה כנים מראש: אם אתם רוצים יצירה מהירה, זולה ואיכותית, קראו ל-API. VPS של CPU לא ינצח דאטה-סנטר מלא ב-GPUs, וכל מי שאומר לכם אחרת מוכר משהו.

אז למה לאחסן-בעצמי inference בכלל? סיבה אחת, והיא טובה: המודל על השרת שלכם לעולם לא שולח את ה-prompts שלכם לשום מקום.

איך inference על CPU בעצם נראה

אתם יכולים להריץ מודלים אמיתיים על CPU עם מספיק RAM. מודל 7–8B קוונטיזי ל-4-bit עובד. 13B עובד. אתם יכולים אפילו לדחוף מודל בסדר-גודל 30B אם יש לכם את הזיכרון. מה שאתם לא יכולים לעשות זה להפוך אותו למהיר — פלט מגיע בכמה טוקנים לשנייה, לא הזרם המיידי ש-API נותן.

זו העסקה הכנה. לצ'אט אינטראקטיבי זה מתסכל. לעבודת רקע — סיכום מסמכים לאורך הלילה, סיווג תור, העשרת נתונים לפי לוח זמנים — כמה טוקנים לשנייה לגמרי בסדר, ואף אחד לא מסתכל על השעון.

חשבון ה-RAM

המודל צריך לשבת בזיכרון, קוונטיזי או לא, בתוספת overhead ל-context ול-runtime:

לכן "הרצת מודל מקומי" בשקט הופכת לשאלת זיכרון-גבוה. המודל הוא טביעת-רגל הזיכרון. הוסיפו אינדקס RAG או סוכנים על אותו ארגז והמספרים מצטברים.

Ollama מול vLLM, בקצרה

Ollama הוא הדלת הקלה פנימה — התקינו, ollama run, סיימתם. הוא הכלי הנכון להגדרת משתמש-יחיד פרטית שבה אתם פשוט רוצים שהמודל יהיה זמין. vLLM בנוי לתפוקת הגשה: יותר הגדרה, טוב יותר תחת עומס מקבילי, שווה כשאתם באמת מטפלים בנפח. התחילו עם Ollama; הושיטו יד ל-vLLM כשאתם מגישים תעבורה אמיתית.

היכן פרטיות-תחילה באמת מנצחת

הטיעון ל-inference באחסון-עצמי אינו מהירות או עלות — הוא שחלק מהנתונים לא יכולים לעזוב. מסמכים משפטיים. רשומות רפואיות. קוד קנייני. כל דבר שבו שליחת ה-prompt ל-API של צד שלישי מחוץ לתמונה מטעמי מדיניות או אמון. מודל איטי יותר שרץ לגמרי על המכונה שלכם מנצח מהיר שמתעד כל מה שאתם שולחים לו.

ואם הנתונים כל כך רגישים, כנראה שגם התשלום צריך להיות פרטי. שכירת הארגז עם קריפטו וללא KYC שומרת את כל השרשרת — שרת, מודל, prompts, חיוב — מחוץ לרשומות הזהות של כל אחד. זה המסר האמיתי: לא "inference זול יותר", אלא "inference שאף אחד אחר לא יכול לראות".

שורה תחתונה

למהירות ואיכות, השתמשו ב-API — אין בושה בזה. אחסנו-בעצמי כשפרטיות היא הדרישה ואיטי יותר מקובל. מדדו למודל בתוספת ה-context שלו בתוספת כל דבר אחר שחולק את הארגז, ואל תצפו למהירות GPU מ-CPU.

כשהמודל צריך זיכרון אמיתי, קו ה-Pro מריץ 32 עד 80 GB עם IP ייעודי וגיבויים לילִיים — מספיק כדי להחזיק מודל קוונטיזי רציני עם מקום ל-context סביבו.

שאלות נפוצות

האם אני יכול להריץ LLM ללא GPU?

מודלים קוונטיזיים קטנים, כן — ולאט. מודל 7–8B קוונטיזי ל-4-bit רץ על CPU עם מספיק RAM, אבל תמדדו פלט בכמה טוקנים לשנייה, לא הזרם הזריז שאתם מקבלים מ-API. בסדר ל-jobs של batch ומשימות רקע, כואב לצ'אט אינטראקטיבי.

כמה RAM ל-inference מקומי?

המודל צריך להיכנס לזיכרון בתוספת overhead. מודל 7–8B ב-4-bit רוצה ~6–8 GB; 13B בערך 10–16 GB; מודלים בסדר-גודל 30B דוחפים 24–48 GB קוונטיזי. הוסיפו מקום ל-context וכל דבר אחר על הארגז. לכן inference מקומי נוחת בשטח זיכרון-גבוה מהר.

Ollama או vLLM?

Ollama הוא הכניסה הקלה — פקודה אחת, מודל נמשך, רץ. vLLM הוא לתפוקה והגשה, יותר הגדרה, טוב יותר תחת עומס. לארגז פרטי של משתמש-יחיד, Ollama בדרך כלל הבחירה הנכונה; vLLM כשאתם באמת מגישים בקשות בנפח.

למה לאחסן-בעצמי inference בכלל אם זה איטי יותר?

פרטיות. ה-prompts והפלטים שלכם לעולם לא נוגעים בשרתים או בלוגים של ספק. לנתונים רגישים — משפטיים, רפואיים, קוד פנימי, כל דבר שאתם לא יכולים לשלוח לצד שלישי — מודל פרטי איטי יותר מנצח מהיר שרואה הכל. שדכו אותו עם תשלום קריפטו ללא-KYC וכל השרשרת נשארת שלכם.

← חזרה לבלוגראו תוכניות ומחירים →

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.