הטעות הנפוצה ביותר באחסון סוכנים היא מדידה לסוכן אחד. מישהו מריץ סוכן בודד, רואה אותו משתמש ב-400 MB, ומסיק שסוכנים זולים לאחסן. ואז הוא מתרחב לצוות אמיתי והארגז מתחיל לעשות swap ב-3 לפנות בוקר.
סוכן אחד אכן זול. זה לא המקרה המעניין.
לאן הזיכרון בעצם הולך
סוכן שרק יורה קריאות API למודל הוא קל — הוא בעיקר מחכה לרשת. הריצו תריסר כאלה על תוכנית קטנה ולא הייתם שמים לב.
ה-RAM נעלם כשסוכנים מחזיקים state. היסטוריה שגדלה בכל תור. working set שכמה סוכנים קוראים וכותבים. vector store לזיכרון ארוך-טווח באותו תהליך. ברגע שהארכיטקטורה מפסיקה להיות "קרא ל-API, שכח" והופכת ל"זכור, תאם, העבר," זיכרון הוא האילוץ — לא CPU. לולאות CrewAI, LangGraph, ובסגנון AutoGPT כולן נוטות לכיוון הזה ככל שהן נעשות רציניות. ה-framework לא אוכל את ה-RAM; ה-state כן. חפרנו במספרים כאן.
מדידה גסה
- סוכנים קלים, מוגבלי-API — אתם לא צריכים Pro; תוכנית NAT או IP-ייעודי ($3–20) שופעת. דלגו על שאר הדף הזה.
- צוות אמיתי (5–10 סוכנים) עם זיכרון משותף בתוספת vector store שימושי — Pro-32 (32 GB) היא הנקודה המתוקה. רוב הציים נוחתים כאן.
- ציים גדולים יותר, היסטוריות ארוכות יותר, אינדקס זיכרון במיליונים — Pro-64 (64 GB). כאן ארגז אחד מחליף את השלושה הקטנים יותר שאחרת הייתם מלהטטים בהם.
- צי בתוספת שירותים ממוקמים-יחד, או סוכנים בתוספת inference מקומי — עד Pro-80 (80 GB).
התחילו מתחת למקום שאתם חושבים שאתם צריכים להיות בו, צפו ב-htop ליום, שנו גודל למעלה כשאתם רואים swap. לנחש גבוה סתם מבזבז כסף.
למה הצורה הזו של מארח
צי שמקים או מנהל שרתים משלו רוצה API שהוא יכול להפעיל ללא אדם — ויותר ויותר, גם לשלם ללא אחד. זיכרון גבוה, IP ייעודי, תשלום בקריפטו, ללא KYC, וכל הדבר ניתן-להזמנה על ידי סוכן דרך MCP: הצירוף הזה נדיר, וזה מה שקו ה-Pro בנוי עבורו. זה לא הזול ביותר לכל גיגה-בייט, ואם הסוכנים שלכם קלים אתם באמת לא צריכים אותו. אבל למערכת רצינית שמחזיקה state ומעריכה פרטיות, זו ההתאמה הנכונה.
כשאתם שם, Pro-32 מכסה צוות אמיתי; עלו בגודל ל-64 או 80 GB ככל שהצי גדל.
תגובות
אין עדיין תגובות. היו הראשונים.