Кожен туторіал з RAG крутиться на ноутбуці з парою сотень документів, і здається, що все легко. Потім ви скеровуєте його на реальний корпус — доки компанії, роки тікетів, базу знань — і раптом уся розмова лише про памʼять.
RAG масштабується не за CPU. Він масштабується за RAM.
Чому індекс хоче памʼять
Пошук працює так: кожен шматок тексту перетворюється на ембеддинг — вектор із сотень-тисяч чисел. Пошук — це порівняння вашого вектора-запиту з усіма, швидко. «Швидко» — ключове: для низької латентності індекс має жити в RAM. На диску працює, але кожен запит платить штраф, а швидкий пошук і був сенсом self-host.
Тож рахунок за памʼять росте від двох речей: скільки у вас шматків і наскільки широкий кожен вектор.
Реальні числа, грубо
Міряйте своє — розмірність і тип індексу сильно рухають це, — але як стартове відчуття:
- Пара сотень тисяч ембеддингів — комфортно в 2–4 ГБ. Особиста база знань, доки одного продукту.
- Пара мільйонів — із застосунком, клієнтом моделі й ОС навколо закладайте 16–32 ГБ. Це серйозна корпоративна база знань чи мульти-джерельний RAG.
- Десятки мільйонів чи вектори великої розмірності — ось вам 48–80 ГБ, а далі — кілька машин. Великі масиви документів, мульти-тенантний пошук чи кілька індексів тримаються гарячими одразу.
Мульти-агентна система, що ще й тримає великий індекс, складає обидва рахунки на одну машину — ось так 32-гіговий тариф тихо перетворюється на 64-гіговий.
Вибір рушія, коротко
Якщо вже крутите Postgres, pgvector — варіант найменшого зусилля: розширення, а не новий сервіс на догляд. Коли векторів мільйони і потрібен швидкий фільтрований пошук, окремий рушій на кшталт Qdrant чи Weaviate виправдовує окремий процес. Не переускладнюйте в перший день; ганяйте що вже експлуатуєте й виділяйте, коли пошук реально загальмує.
Навіщо взагалі self-host
Дві причини, з яких це реально роблять, і жодна не «заощадити пару доларів»:
Приватність. Ембеддинги не абстрактні — вони кодують текст, з якого зроблені. Ваші доки, контент клієнтів, внутрішні нотатки, перетворені на вектори й відправлені на сервери третьої сторони. Self-host тримає це на машині під вашим контролем. Якщо дані досить чутливі, щоб ви ще й платили криптою без KYC, managed векторна хмара руйнує весь сенс.
Фіксована ціна. Managed векторні сервіси рахують за збереженими векторами й запитами. VPS — одне місячне число, і його можна довбати скільки завгодно. На масштабі передбачуване бʼє лічильник.
Що це означає для sizing
Почніть із заміру корпусу, а не з здогадки. Візьміть число ембеддингів і розмірність, завантажте вибірку, подивіться резидентну памʼять, екстраполюйте. Потім беріть тариф із запасом під індекс плюс усе навколо — застосунок, клієнт моделі, місце на ріст.
Для чого завгодно за парою мільйонів векторів, збережених приватно, лінійка Pro дає 32–80 ГБ з виділеним IP і нічними бекапами — що важливо, коли індекс і є продукт і втратити його боляче.
Коментарі
Поки немає коментарів. Будьте першим.