יש לנו עמוד נפרד ל-Ollama ולמודלים קטנים — זה ארגז ה-CPU של $12 שמריץ 1B–8B ו-embeddings. הדף הזה הוא הקצה השני: המודלים גדולים מספיק ש-RAM, לא ה-CPU, הוא מה שעוצר אתכם.
בואו נהיה כנים מראש, כמו בכל מקום: השרתים שלנו הם CPU-בלבד, ללא GPU. מודל גדול כאן רץ לאט. אם אתם רוצים צ'אט אינטראקטיבי מהיר על מודל 30B, אתם צריכים מארח GPU — מוצר אחר, ספק אחר. מה שארגז CPU עם זיכרון-גבוה עושה טוב הוא להריץ מודל קוונטיזי גדול בפרטיות לעבודה שאינה חלון צ'אט.
חשבון ה-RAM
המודל יושב בזיכרון, קוונטיזי או לא, בתוספת overhead ל-context ול-runtime:
- 13B, 4-bit — בערך 10–16 GB. רץ על תוכנית בינונית כבר.
- בסדר-גודל 30B, קוונטיזי — 24–48 GB תלוי בקוונטיזציה. זה שטח Pro-32 עד Pro-64.
- גדול יותר או דיוק גבוה יותר — 64–80 GB, ומעבר ל-80 GB אף ארגז יחיד שלנו לא מתאים. Pro-80 היא התקרה כאן.
לכן "הריצו מודל מקומי גדול יותר" הוא באמת שאלת זיכרון-גבוה. המודל הוא טביעת-רגל הזיכרון. הוסיפו אינדקס RAG על אותו מארח והמספרים מצטברים.
היכן פרטיות-תחילה באמת מנצחת
הטיעון אינו מהירות ואינו עלות — הוא שחלק מהנתונים לא יכולים לעזוב. מסמכים משפטיים. רשומות רפואיות. קוד קנייני. כל דבר שבו שליחת ה-prompt ל-API של צד שלישי מחוץ לתמונה. מודל איטי יותר שרץ לגמרי על המכונה שלכם מנצח מהיר שמתעד כל מה שאתם שולחים לו. כתבנו את התמונה המלאה כאן.
ואם הנתונים כל כך רגישים, כנראה שגם התשלום צריך להיות פרטי. שכירת הארגז עם קריפטו וללא KYC שומרת את כל השרשרת — שרת, מודל, prompts, חיוב — מחוץ לרשומות הזהות של כל אחד. זה המסר: לא inference זול יותר, אלא inference שאף אחד אחר לא יכול לראות.
מה לבחור
למודל בסדר-גודל 30B עם מקום ל-context, Pro-64 (64 GB) היא הבחירה הנוחה; קוונטיזציה הדוקה יותר נכנסת ל-Pro-32 או Pro-48, גדולה יותר הולכת ל-Pro-80. טענו את המודל קודם, צפו בזיכרון-תושב, מדדו גודל ממה שמדדתם. וכוונו ציפיות: זה inference batch פרטי, לא חלון צ'אט מהיר.
תגובות
אין עדיין תגובות. היו הראשונים.