Błędem, który widzę najczęściej przy hostowaniu agentów, jest dobieranie rozmiaru pod niewłaściwą rzecz. Ktoś uruchamia jednego agenta, zużywa 400 MB, i wnioskuje, że agenci są tani w hostowaniu. Potem skaluje do prawdziwej drużyny i maszyna zaczyna swapować o 3 nad ranem.
Jeden agent jest tani. To nie jest interesujący przypadek.
Gdzie faktycznie znika pamięć
Agent, który tylko wystrzeliwuje wywołania API do modelu, jest lekki — głównie czeka na sieć. Mógłbyś uruchomić kilkanaście takich na małym planie i nigdy nie zauważyć.
RAM znika, gdy agenci zaczynają trzymać stan. Historia rozmów rosnąca z każdą turą. Zbiór roboczy, który kilku agentów czyta i zapisuje. Magazyn wektorowy dla pamięci długoterminowej siedzący w tym samym procesie. W chwili, gdy Twoja architektura przestaje być „zawołaj API, zapomnij”, a staje się „pamiętaj, koordynuj, przekaż”, pamięć staje się ograniczeniem, nie CPU.
CrewAI, LangGraph, pętle w stylu AutoGPT — wszystkie zmierzają w tę stronę, gdy stają się poważne. Framework nie zjada RAM; zjada go stan.
Zgrubne dobieranie, uczciwie
Nie będę udawał, że jest wzór, bo go nie ma — zależy całkowicie od tego, ile każdy agent trzyma przy sobie. Ale praktyczne wyczucie z prowadzenia tych:
- Lekcy agenci ograniczeni przez API — nie potrzebujesz Pro w ogóle tutaj; plan NAT lub z dedykowanym IP (3–20 $) to obsłuży. Pro zarabia na swoje miejsce, gdy wspólny stan pcha Cię ponad ~32 GB.
- 32 GB — wygodny wybór dla prawdziwego systemu wieloagentowego: 5–10 agentów ze wspólną pamięcią plus baza wektorowa, która jest faktycznie użyteczna. Większość ludzi tu ląduje.
- 64 GB — większe floty, dłuższe historie, indeks pamięci w milionach wektorów lub kilka współlokowanych usług. To tu jedna maszyna zastępuje trzy mniejsze, którymi inaczej byś żonglował.
- 80 GB — ciężka, ograniczona pamięcią praca: duże zbiory danych w pamięci, wielu jednoczesnych agentów lub agenci plus lokalna inferencja modelu na tym samym hoście.
Zacznij poniżej tego, co myślisz, że potrzebujesz. Obserwuj htop przez dzień. Zwiększ rozmiar, gdy zobaczysz swap, nie wcześniej — zgadywanie w górę tylko marnuje pieniądze.
Część, którą trudno kupić
Oto rzecz, która czyni to niezręcznym: wynajęcie 64 GB RAM jest łatwe. Wynajęcie 64 GB z krypto i bez weryfikacji tożsamości nie jest. Większość hostów, które tanio sprzedają poważną pamięć, robi to za kartą i formularzem KYC.
Jeśli Twój agent przygotowuje własny serwer lub obciążenie dotyka danych, których wolałbyś nie wiązać z nazwiskiem, ta kombinacja — duża pamięć, krypto, bez KYC i zamawialna przez samego agenta przez MCP — jest faktycznym produktem. To nie tańsze na gigabajt, i napisałem osobno o tym, dlaczego to porównanie wprowadza w błąd. Jest dostępne na warunkach, których prawie nikt nie oferuje.
Więc co robisz
Jeśli Twoi agenci są lekcy i ograniczeni przez API, nie przemyśliwaj tego — mały plan NAT lub z dedykowanym IP w zupełności wystarczy, pomiń całe pytanie o dużą pamięć. Jeśli uruchamiasz prawdziwą flotę trzymającą stan, dobierz rozmiar według tego, co faktycznie jest w pamięci, zacznij od 32 GB i przechodź wyżej, gdy wykres Ci każe.
Gdy tam jesteś, linia Pro obejmuje 32 do 80 GB z dedykowanym IP i nocnymi kopiami zapasowymi. Wybierz warstwę pasującą do Twojego zbioru roboczego, nie ambicji.
Komentarze
Brak komentarzy. Bądź pierwszy.