כל מדריך RAG רץ על מחשב נייד עם כמה מאות מסמכים, וזה מרגיש ללא מאמץ. ואז אתם מכוונים אותו לקורפוס אמיתי — המסמכים של חברה, שנים של תיקטים, בסיס-ידע — ופתאום זיכרון הוא כל השיחה.
RAG לא מתרחב לפי CPU. הוא מתרחב לפי RAM.
למה האינדקס רוצה זיכרון
אחזור עובד על ידי הפיכת כל chunk של טקסט ל-embedding — וקטור, כמה מאות עד כמה אלפי מספרים ארוך. חיפוש אומר להשוות את וקטור השאילתה שלכם מול כולם, מהר. "מהר" היא מילת המפתח: להשהיה נמוכה האינדקס צריך לחיות ב-RAM. על דיסק זה עובד, אבל כל שאילתה משלמת קנס, ואחזור בהשהיה-נמוכה היה הנקודה של אחסון-עצמי מלכתחילה.
אז חשבון הזיכרון מתרחב עם שני דברים: כמה chunks יש לכם, וכמה רחב כל וקטור.
מספרים אמיתיים, בערך
מדדו את שלכם — מימד וסוג אינדקס מזיזים את זה הרבה — אבל כתחושת התחלה:
- כמה מאות אלפי embeddings — נוח ב-2–4 GB. בסיס-ידע אישי, המסמכים של מוצר יחיד.
- מיליונים בודדים — עם האפליקציה, לקוח המודל, ומערכת ההפעלה סביבו, תכננו ל-16–32 GB. זה בסיס-ידע רציני של חברה או RAG רב-מקורי.
- עשרות מיליונים, או וקטורים בעלי מימד-גבוה — עכשיו אתם ב-48–80 GB, ומעבר לזה על פני כמה ארגזים. אחוזות מסמכים גדולות, אחזור רב-דיירים, או שאתם שומרים כמה אינדקסים חמים בבת אחת.
מערכת רב-סוכנית שגם מחזיקה אינדקס גדול עורמת את שתי העלויות על אותו ארגז — כך תוכנית של 32 GB הופכת ל-64 GB בשקט.
בחירת המנוע, בקצרה
אם אתם כבר מריצים Postgres, pgvector היא האופציה עם הכי פחות מאמץ — זו הרחבה, לא שירות חדש לעשות לו בייביסיטר. כשיש לכם מיליוני וקטורים ואתם רוצים חיפוש מסונן מהיר, מנוע ייעודי כמו Qdrant או Weaviate מרוויח את התהליך הנפרד. אל תעשו over-engineering ביום הראשון; הריצו את מה שאתם כבר מפעילים ופצלו כשהחיפוש באמת מאט.
למה בכלל לאחסן-בעצמי
שתי סיבות שאנשים באמת עושים את זה, ואף אחת מהן אינה "כדי לחסוך כמה דולרים":
פרטיות. embeddings אינם מופשטים — הם מקודדים את הטקסט שממנו באו. המסמכים שלכם, התוכן של הלקוחות שלכם, ההערות הפנימיות שלכם, הפכו לווקטורים ונשלחו לשרתים של צד שלישי. אחסון-עצמי שומר את זה על מכונה שאתם שולטים בה. אם הנתונים רגישים מספיק שאתם גם משלמים בקריפטו ללא KYC, ענן וקטורי מנוהל מבטל את כל הנקודה.
עלות קבועה. שירותים וקטוריים מנוהלים מחייבים לפי וקטורים מאוחסנים ושאילתות שרצות. VPS הוא מספר חודשי אחד ואתם יכולים להכות בו כמה שתרצו. בקנה-מידה, צפוי מנצח נמדד.
מה זה אומר למדידה
התחילו על ידי מדידת הקורפוס שלכם, לא על ידי ניחוש. השיגו את ספירת ה-embeddings והמימד שלכם, טענו מדגם, צפו בזיכרון-התושב, גזרו. ואז בחרו תוכנית עם מרווח לאינדקס בתוספת כל מה שסביבו — האפליקציה, לקוח המודל, מקום לגדול.
לכל דבר מעבר לכמה מיליוני וקטורים המוחזקים בפרטיות, קו ה-Pro מריץ 32 עד 80 GB עם IP ייעודי וגיבויים לילִיים, מה שחשוב כשהאינדקס הוא המוצר ואיבודו כואב.
תגובות
אין עדיין תגובות. היו הראשונים.