Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

Samodzielny RAG na dużą skalę: ile RAM naprawdę zjada indeks wektorowy

9 sie 2026 · 2 min czytania · Zespół EQVPS

Każdy tutorial RAG działa na laptopie z kilkuset dokumentami i wydaje się bezwysiłkowy. Potem kierujesz go na prawdziwy korpus — dokumentację firmy, lata zgłoszeń, bazę wiedzy — i nagle pamięć jest całą rozmową.

RAG nie skaluje się przez CPU. Skaluje się przez RAM.

Dlaczego indeks chce pamięci

Wyszukiwanie działa, zamieniając każdy chunk tekstu na osadzenie — wektor, od kilkuset do paru tysięcy liczb długi. Wyszukiwanie oznacza porównywanie Twojego wektora zapytania ze wszystkimi z nich, szybko. „Szybko” to słowo kluczowe: dla niskiej latencji indeks musi żyć w RAM. Na dysku działa, ale każde zapytanie płaci karę, a wyszukiwanie o niskiej latencji było sensem samodzielnego hostowania w pierwszej kolejności.

Więc rachunek pamięci skaluje się z dwiema rzeczami: iloma chunkami dysponujesz i jak szeroki jest każdy wektor.

Prawdziwe liczby, zgrubnie

Zmierz własne — wymiar i typ indeksu bardzo tym poruszają — ale jako punkt startu:

System wieloagentowy, który też trzyma duży indeks, piętrzy oba koszty na tej samej maszynie — tak plan 32 GB po cichu zamienia się w 64 GB.

Wybór silnika, krótko

Jeśli już prowadzisz Postgresa, pgvector to opcja najmniejszego wysiłku — to rozszerzenie, nie nowa usługa do pilnowania. Gdy masz miliony wektorów i chcesz szybkiego filtrowanego wyszukiwania, dedykowany silnik jak Qdrant lub Weaviate zarabia na osobny proces. Nie przeinżynieruj tego na dzień pierwszy; uruchamiaj to, co już obsługujesz, i wydziel to, gdy wyszukiwanie faktycznie zwalnia.

Po co się w ogóle trudzić samodzielnym hostowaniem

Dwa powody, dla których ludzie faktycznie to robią, i żaden nie jest „by zaoszczędzić kilka dolarów”:

Prywatność. Osadzenia nie są abstrakcyjne — kodują tekst, z którego pochodzą. Twoje dokumenty, treści Twoich klientów, Twoje wewnętrzne notatki, zamienione w wektory i wysłane na serwery osoby trzeciej. Samodzielny hosting trzyma to na maszynie, którą kontrolujesz. Jeśli dane są na tyle wrażliwe, że też płacisz kryptowalutą bez KYC, zarządzana chmura wektorowa niweczy cały sens.

Stały koszt. Zarządzane usługi wektorowe liczą za przechowywane wektory i wykonane zapytania. VPS to jedna miesięczna liczba, którą możesz młócić, jak chcesz. Na skali przewidywalne bije rozliczane po użyciu.

Co to oznacza dla doboru rozmiaru

Zacznij od zmierzenia korpusu, nie od zgadywania. Uzyskaj liczbę osadzeń i wymiar, załaduj próbkę, obserwuj pamięć rezydentną, ekstrapoluj. Potem wybierz plan z zapasem na indeks plus wszystko wokół — aplikację, klienta modelu, miejsce na wzrost.

Dla czegokolwiek powyżej paru milionów wektorów trzymanych prywatnie linia Pro obejmuje 32 do 80 GB z dedykowanym IP i nocnymi kopiami zapasowymi, co ma znaczenie, gdy indeks jest produktem, a jego utrata boli.

FAQ

Dlaczego RAG potrzebuje tyle RAM?

Szybkie wyszukiwanie wektorowe chce indeksu rezydentnego w pamięci. Każdy chunk dokumentu staje się osadzeniem — wektorem od kilkuset do paru tysięcy liczb zmiennoprzecinkowych — a przy milionach chunków to się sumuje. Zepchnij indeks na dysk, a latencja wyszukiwania skacze; utrzymanie całego powodu, dla którego hostowałeś samodzielnie (szybkość + kontrola), oznacza trzymanie go w RAM.

Ile RAM na dany korpus?

Zgrubne wyczucie: kilkaset tysięcy osadzeń mieści się dobrze w 2–4 GB. Niskie miliony, z aplikacją i systemem wokół, i jesteś na 16–32 GB. Dziesiątki milionów lub wektory o wysokim wymiarze i jesteś w 48–80 GB, a poza tym rozdzielasz między serwery. Wymiar i typ indeksu bardzo tym huśtają, więc zmierz własny.

pgvector czy dedykowany silnik jak Qdrant?

Jeśli już prowadzisz Postgresa, pgvector to droga najmniejszego wysiłku — jedno rozszerzenie, jedna baza. Dla milionów wektorów z ciężkim filtrowaniem dedykowany silnik zarabia na osobną usługę. Zacznij od tego, co już obsługujesz; przenieś się dopiero, gdy wyszukiwanie zwalnia.

Dlaczego hostować samodzielnie zamiast zarządzanej usługi wektorowej?

Dwa prawdziwe powody: Twoje osadzenia często kodują prywatne dane (dokumenty, notatki, treści klientów), a samodzielny hosting trzyma to na serwerze, który kontrolujesz. I to stały koszt — usługi zarządzane liczą za wektory i zapytania, VPS to jedna miesięczna liczba bez rachunku na zapytanie.

← Powrót do blogaZobacz plany i ceny →

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.