Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

VPS pod serwer RAG hostowany samodzielnie na dużą skalę

Generacja wspomagana wyszukiwaniem przestaje być demem na laptopie, gdy korpus jest prawdziwy. Indeks wektorowy chce RAM, a Twoje osadzenia to Twoje prywatne dane. Oto matematyka doboru i dlaczego pasuje hosting z dużą pamięcią bez KYC. Od 55 $/mies.

Demo RAG na laptopie z dwustoma dokumentami wydaje się bezwysiłkowe. Potem kierujesz je na prawdziwy korpus — dokumentację firmy, lata zgłoszeń, faktyczną bazę wiedzy — i cała rzecz staje się problemem pamięci. Nie problemem CPU. Problemem pamięci.

Oto część, którą większość stron hostingowych pomija: szybkie wyszukiwanie chce indeksu w RAM. Każdy chunk tekstu staje się osadzeniem — wektorem od kilkuset do paru tysięcy liczb szerokim — a wyszukiwanie oznacza porównywanie Twojego zapytania ze wszystkimi z nich, szybko. Na dysku działa, ale każde zapytanie płaci podatek latencji, a wyszukiwanie o niskiej latencji było powodem, dla którego w ogóle hostowałeś samodzielnie.

Matematyka doboru, uczciwie

Zmierz własny korpus — wymiar i typ indeksu bardzo tym huśtają — ale jako punkt startu:

Rozpisaliśmy pełną krzywą RAM tutaj, jeśli chcesz szczegółów.

Dlaczego duża pamięć i brak KYC razem

Wynajęcie 48 GB RAM jest łatwe. Wynajęcie go z krypto i bez weryfikacji tożsamości nie jest — większość hostów, które tanio sprzedają poważną pamięć, robi to za kartą i formularzem KYC. Twoje osadzenia nie są abstrakcyjnymi liczbami; kodują tekst, z którego pochodzą. Twoje dokumenty, treści Twoich klientów, zamienione w wektory. Jeśli te dane są na tyle wrażliwe, że płacisz prywatnie, zarządzana chmura wektorowa niweczy cały sens — podobnie jak host, który wiąże serwer z Twoją tożsamością.

Ta kombinacja — duża pamięć, dedykowane IP, krypto, bez KYC, nocne kopie zapasowe — jest tym, do czego służy linia Pro. To nie najtańsze na gigabajt, i jeśli nie potrzebujesz prywatności, RAM znajdziesz taniej gdzie indziej. Ale jeśli indeks jest Twoim produktem i nie może wyjść, to jest kształt, który pasuje.

Gdzie zacząć

Wybierz plan z zapasem na indeks plus wszystko wokół — aplikację, klienta modelu, miejsce na wzrost. Dla większości prawdziwych korpusów to Pro-48 (48 GB); duży idzie do Pro-64 lub Pro-80. Załaduj najpierw próbkę, obserwuj pamięć, dobierz rozmiar z liczby, którą zmierzyłeś — nie z tej, której się bałeś.

Jeśli Twoje wyszukiwanie jest częścią większego systemu agentowego, ta sama maszyna często trzyma też flotę agentów — tak plan 48 GB po cichu staje się 64 GB.

Gotowy na wdrożenie? Płać kryptowalutą, bez KYC — online w około minutę.

Wdróż teraz →

FAQ

Ile RAM faktycznie potrzebuje moja konfiguracja RAG?

Skaluje się z liczbą osadzeń i szerokością wektora. Kilkaset tysięcy chunków mieści się w 2–4 GB; niskie miliony, z aplikacją i systemem wokół nich, lądują na 16–32 GB; dziesiątki milionów dobijają 48 GB i dalej. Zmierz próbkę, obserwuj pamięć rezydentną, ekstrapoluj — nie zgaduj w górę, tylko przepłacisz.

Dlaczego nie użyć zarządzanej usługi wektorowej?

Dwa powody, dla których ludzie faktycznie hostują samodzielnie: Twoje osadzenia kodują prywatne dane (dokumenty, notatki, treści klientów), więc trzymanie ich na maszynie, którą kontrolujesz, ma znaczenie; a koszt jest stały — usługa zarządzana liczy za wektory i zapytania, VPS to jedna miesięczna liczba, którą możesz młócić, jak chcesz.

pgvector czy dedykowany silnik?

Jeśli już prowadzisz Postgresa, pgvector to droga najmniejszego wysiłku — jedno rozszerzenie. Dla milionów wektorów z ciężkim filtrowaniem dedykowany silnik jak Qdrant zarabia na własną usługę. Zacznij od tego, co obsługujesz; wydziel to, gdy wyszukiwanie zwalnia, nie wcześniej.

Czy potrzebuję GPU do RAG?

Nie. Wyszukiwanie to praca CPU + RAM — porównywanie wektorów, nie generowanie tekstu. Krok generacji woła Twój LLM (API lub osobny host modelu). Maszyna CPU z dużą pamięcią to dokładnie właściwy kształt dla połowy wyszukującej.

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.