EQVPS

VPS ל-inference פרטי של LLM עם זיכרון-גבוה

מודלים קוונטיזיים גדולים יותר צריכים RAM אמיתי, לא GPU שאין לכם. איפה ארגז CPU עם זיכרון-גבוה מריץ מודלים בסדר-גודל 30B בפרטיות, מה מציאותי, ואיפה לא. החל מ-$70/חודש.

יש לנו עמוד נפרד ל-Ollama ולמודלים קטנים — זה ארגז ה-CPU של $12 שמריץ 1B–8B ו-embeddings. הדף הזה הוא הקצה השני: המודלים גדולים מספיק ש-RAM, לא ה-CPU, הוא מה שעוצר אתכם.

בואו נהיה כנים מראש, כמו בכל מקום: השרתים שלנו הם CPU-בלבד, ללא GPU. מודל גדול כאן רץ לאט. אם אתם רוצים צ'אט אינטראקטיבי מהיר על מודל 30B, אתם צריכים מארח GPU — מוצר אחר, ספק אחר. מה שארגז CPU עם זיכרון-גבוה עושה טוב הוא להריץ מודל קוונטיזי גדול בפרטיות לעבודה שאינה חלון צ'אט.

חשבון ה-RAM

המודל יושב בזיכרון, קוונטיזי או לא, בתוספת overhead ל-context ול-runtime:

לכן "הריצו מודל מקומי גדול יותר" הוא באמת שאלת זיכרון-גבוה. המודל הוא טביעת-רגל הזיכרון. הוסיפו אינדקס RAG על אותו מארח והמספרים מצטברים.

היכן פרטיות-תחילה באמת מנצחת

הטיעון אינו מהירות ואינו עלות — הוא שחלק מהנתונים לא יכולים לעזוב. מסמכים משפטיים. רשומות רפואיות. קוד קנייני. כל דבר שבו שליחת ה-prompt ל-API של צד שלישי מחוץ לתמונה. מודל איטי יותר שרץ לגמרי על המכונה שלכם מנצח מהיר שמתעד כל מה שאתם שולחים לו. כתבנו את התמונה המלאה כאן.

ואם הנתונים כל כך רגישים, כנראה שגם התשלום צריך להיות פרטי. שכירת הארגז עם קריפטו וללא KYC שומרת את כל השרשרת — שרת, מודל, prompts, חיוב — מחוץ לרשומות הזהות של כל אחד. זה המסר: לא inference זול יותר, אלא inference שאף אחד אחר לא יכול לראות.

מה לבחור

למודל בסדר-גודל 30B עם מקום ל-context, Pro-64 (64 GB) היא הבחירה הנוחה; קוונטיזציה הדוקה יותר נכנסת ל-Pro-32 או Pro-48, גדולה יותר הולכת ל-Pro-80. טענו את המודל קודם, צפו בזיכרון-תושב, מדדו גודל ממה שמדדתם. וכוונו ציפיות: זה inference batch פרטי, לא חלון צ'אט מהיר.

מוכנים להקים? שלמו בקריפטו, ללא KYC — חי בערך תוך דקה.

הקימו עכשיו →

שאלות נפוצות

במה זה שונה ממקרה-השימוש של Ollama שלכם?

עמוד ה-Ollama עוסק במודלים קטנים על ארגז CPU של $12 — 1B–8B, embeddings, עבודה קלה. זה הקצה של זיכרון-גבוה: מודלים קוונטיזיים בסדר-גודל 13B עד 30B שצריכים 24–48 GB או יותר רק כדי להיטען. אותה מציאות של CPU-בלבד, טביעת-רגל זיכרון גדולה בהרבה, תוכנית אחרת.

כמה RAM למודל נתון?

המודל צריך להיכנס לזיכרון בתוספת overhead. מודל 13B ב-4-bit רוצה ~10–16 GB; בסדר-גודל 30B קוונטיזי דוחף 24–48 GB; לכו גדול יותר או ברמת-דיוק גבוהה יותר ואתם בטווח 64–80 GB — מעבר לזה, אף ארגז יחיד שלנו לא מתאים. הוסיפו מקום ל-context מעל.

האם זה יהיה מהיר?

לא — היו כנים עם עצמכם כאן. inference על CPU על מודל גדול הוא כמה טוקנים לשנייה, לא זרם אינטראקטיבי. זה בסדר לעבודת batch ורקע (סכם לאורך הלילה, סווג תור). לצ'אט בזמן-אמת על מודל גדול אתם צריכים GPU, שאנחנו לא מציעים.

למה להריץ אותו כאן במקום API?

פרטיות. ה-prompts והפלטים שלכם לעולם לא נוגעים בשרתים או בלוגים של ספק. לנתונים רגישים — משפטיים, רפואיים, קוד פנימי — מודל פרטי איטי יותר מנצח מהיר שרואה הכל. שדכו אותו עם תשלום קריפטו ללא-KYC וכל השרשרת נשארת שלכם.

תגובות

אין עדיין תגובות. היו הראשונים.

השאירו תגובה

התגובות עוברות מודרציה לפני שהן מופיעות.