EQVPS

VPS ל-RAG באחסון-עצמי בקנה-מידה

Retrieval-augmented generation מפסיק להיות הדגמת מחשב-נייד ברגע שהקורפוס אמיתי. אינדקס וקטורי רוצה RAM, וה-embeddings שלכם הם הנתונים הפרטיים שלכם. הנה חשבון המדידה ולמה אחסון זיכרון-גבוה ללא-KYC מתאים. החל מ-$55/חודש.

הדגמת RAG על מחשב נייד עם מאתיים מסמכים מרגישה ללא מאמץ. ואז אתם מכוונים אותה לקורפוס אמיתי — המסמכים של חברה, שנים של תיקטים, בסיס-ידע ממשי — וכל הדבר הופך לבעיית זיכרון. לא בעיית CPU. בעיית זיכרון.

הנה החלק שרוב עמודי האחסון מדלגים עליו: אחזור מהיר רוצה את האינדקס ב-RAM. כל chunk של טקסט הופך ל-embedding — וקטור ברוחב כמה מאות עד כמה אלפי מספרים — וחיפוש אומר להשוות את השאילתה שלכם מול כולם, במהירות. על דיסק זה עובד, אבל כל שאילתה משלמת מס השהיה, ואחזור בהשהיה-נמוכה היה הסיבה שאיחסנתם-בעצמכם מלכתחילה.

חשבון המדידה, בכנות

מדדו את הקורפוס שלכם — מימד וסוג אינדקס מנדנדים את זה הרבה — אבל כתחושת התחלה:

כתבנו את עקומת ה-RAM המלאה כאן אם אתם רוצים את הפרטים.

למה זיכרון-גבוה וגם ללא-KYC יחד

לשכור 48 GB של RAM זה קל. לשכור אותם עם קריפטו וללא בדיקת זהות זה לא — רוב המארחים שמוכרים זיכרון רציני בזול עושים זאת מאחורי כרטיס וטופס KYC. ה-embeddings שלכם אינם מספרים מופשטים; הם מקודדים את הטקסט שממנו באו. המסמכים שלכם, התוכן של הלקוחות שלכם, הפכו לווקטורים. אם הנתונים האלה רגישים מספיק שאתם משלמים בפרטיות, ענן וקטורי מנוהל מבטל את כל הנקודה — וכך גם מארח שקושר את השרת לזהות שלכם.

הצירוף הזה — זיכרון גבוה, IP ייעודי, קריפטו, ללא KYC, גיבויים לילִיים — הוא מה שקו ה-Pro מיועד לו. זה לא הזול ביותר לכל גיגה-בייט, ואם אתם לא צריכים פרטיות אתם יכולים למצוא RAM זול יותר במקום אחר. אבל אם האינדקס הוא המוצר שלכם והוא לא יכול לעזוב, זו הצורה שמתאימה.

איפה להתחיל

בחרו תוכנית עם מרווח לאינדקס בתוספת כל מה שסביבו — האפליקציה, לקוח המודל, מקום לגדול. לרוב הקורפוסים האמיתיים זו Pro-48 (48 GB); גדול הולך ל-Pro-64 או Pro-80. טענו מדגם קודם, צפו בזיכרון, מדדו גודל מהמספר שמדדתם — לא מזה שחששתם ממנו.

אם האחזור שלכם הוא חלק ממערכת סוכנים גדולה יותר, אותו ארגז לעתים קרובות מחזיק גם את צי הסוכנים — כך תוכנית של 48 GB הופכת בשקט לאחת של 64 GB.

מוכנים להקים? שלמו בקריפטו, ללא KYC — חי בערך תוך דקה.

הקימו עכשיו →

שאלות נפוצות

כמה RAM הגדרת ה-RAG שלי באמת צריכה?

זה מתרחב עם מספר ה-embeddings ורוחב הווקטור. כמה מאות אלפי chunks נכנסים ב-2–4 GB; מיליונים בודדים, עם האפליקציה ומערכת ההפעלה סביבם, נוחתים ב-16–32 GB; עשרות מיליונים דוחפים 48 GB ומעלה. מדדו מדגם, צפו בזיכרון-תושב, גזרו — אל תנחשו גבוה, סתם תשלמו יותר מדי.

למה לא להשתמש בשירות וקטורי מנוהל?

שתי סיבות שאנשים באמת מאחסנים-בעצמם: ה-embeddings שלכם מקודדים נתונים פרטיים (מסמכים, הערות, תוכן לקוחות), אז לשמור אותם על מכונה שאתם שולטים בה חשוב; והעלות קבועה — שירות מנוהל מודד לפי וקטורים ושאילתות, VPS הוא מספר חודשי אחד שאתם יכולים להכות בו כמה שתרצו.

pgvector או מנוע ייעודי?

אם אתם כבר מריצים Postgres, pgvector הוא הנתיב עם הכי פחות מאמץ — הרחבה אחת. למיליוני וקטורים עם סינון כבד, מנוע בנוי-למטרה כמו Qdrant מרוויח שירות משלו. התחילו עם מה שאתם מפעילים; פצלו אותו החוצה כשהחיפוש מאט, לא לפני.

האם אני צריך GPU ל-RAG?

לא. אחזור הוא עבודת CPU + RAM — השוואת וקטורים, לא יצירת טקסט. שלב היצירה קורא ל-LLM שלכם (API, או מארח מודל נפרד). ארגז CPU עם זיכרון-גבוה הוא בדיוק הצורה הנכונה לחצי-האחזור.

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.