בואו נהיה כנים מראש: אם אתם רוצים יצירה מהירה, זולה ואיכותית, קראו ל-API. VPS של CPU לא ינצח דאטה-סנטר מלא ב-GPUs, וכל מי שאומר לכם אחרת מוכר משהו.
אז למה לאחסן-בעצמי inference בכלל? סיבה אחת, והיא טובה: המודל על השרת שלכם לעולם לא שולח את ה-prompts שלכם לשום מקום.
איך inference על CPU בעצם נראה
אתם יכולים להריץ מודלים אמיתיים על CPU עם מספיק RAM. מודל 7–8B קוונטיזי ל-4-bit עובד. 13B עובד. אתם יכולים אפילו לדחוף מודל בסדר-גודל 30B אם יש לכם את הזיכרון. מה שאתם לא יכולים לעשות זה להפוך אותו למהיר — פלט מגיע בכמה טוקנים לשנייה, לא הזרם המיידי ש-API נותן.
זו העסקה הכנה. לצ'אט אינטראקטיבי זה מתסכל. לעבודת רקע — סיכום מסמכים לאורך הלילה, סיווג תור, העשרת נתונים לפי לוח זמנים — כמה טוקנים לשנייה לגמרי בסדר, ואף אחד לא מסתכל על השעון.
חשבון ה-RAM
המודל צריך לשבת בזיכרון, קוונטיזי או לא, בתוספת overhead ל-context ול-runtime:
- 7–8B, 4-bit — בערך 6–8 GB. רץ על תוכנית בינונית.
- 13B, 4-bit — בערך 10–16 GB.
- בסדר-גודל 30B, קוונטיזי — 24–48 GB, תלוי בקוונטיזציה.
- גדול יותר, או דיוק גבוה יותר — אתם בתוך 64–80 GB מהר — ומעבר ל-80 GB אף ארגז Pro בודד לא מתאים, עדיין CPU-איטי.
לכן "הרצת מודל מקומי" בשקט הופכת לשאלת זיכרון-גבוה. המודל הוא טביעת-רגל הזיכרון. הוסיפו אינדקס RAG או סוכנים על אותו ארגז והמספרים מצטברים.
Ollama מול vLLM, בקצרה
Ollama הוא הדלת הקלה פנימה — התקינו, ollama run, סיימתם. הוא הכלי הנכון להגדרת משתמש-יחיד פרטית שבה אתם פשוט רוצים שהמודל יהיה זמין. vLLM בנוי לתפוקת הגשה: יותר הגדרה, טוב יותר תחת עומס מקבילי, שווה כשאתם באמת מטפלים בנפח. התחילו עם Ollama; הושיטו יד ל-vLLM כשאתם מגישים תעבורה אמיתית.
היכן פרטיות-תחילה באמת מנצחת
הטיעון ל-inference באחסון-עצמי אינו מהירות או עלות — הוא שחלק מהנתונים לא יכולים לעזוב. מסמכים משפטיים. רשומות רפואיות. קוד קנייני. כל דבר שבו שליחת ה-prompt ל-API של צד שלישי מחוץ לתמונה מטעמי מדיניות או אמון. מודל איטי יותר שרץ לגמרי על המכונה שלכם מנצח מהיר שמתעד כל מה שאתם שולחים לו.
ואם הנתונים כל כך רגישים, כנראה שגם התשלום צריך להיות פרטי. שכירת הארגז עם קריפטו וללא KYC שומרת את כל השרשרת — שרת, מודל, prompts, חיוב — מחוץ לרשומות הזהות של כל אחד. זה המסר האמיתי: לא "inference זול יותר", אלא "inference שאף אחד אחר לא יכול לראות".
שורה תחתונה
למהירות ואיכות, השתמשו ב-API — אין בושה בזה. אחסנו-בעצמי כשפרטיות היא הדרישה ואיטי יותר מקובל. מדדו למודל בתוספת ה-context שלו בתוספת כל דבר אחר שחולק את הארגז, ואל תצפו למהירות GPU מ-CPU.
כשהמודל צריך זיכרון אמיתי, קו ה-Pro מריץ 32 עד 80 GB עם IP ייעודי וגיבויים לילִיים — מספיק כדי להחזיק מודל קוונטיזי רציני עם מקום ל-context סביבו.
תגובות
אין עדיין תגובות. היו הראשונים.