Uczciwą odpowiedzią na „ile serwera potrzebuje mój agent AI?” jest: mniej, niż myślisz — dokładnie do chwili, gdy nagle nie. Sztuczką jest wiedza, po której stronie tej granicy siedzi Twoje obciążenie. Więc zamiast zgadywać, oto czego faktycznie używa każdy rodzaj agenta.
Jedno pytanie, które decyduje o wszystkim
Czy model działa na Twoim serwerze, czy Twój agent woła model przez API?
Jeśli Twój agent rozmawia z hostowanym LLM (częsty przypadek), sprytna, droga część dzieje się na czyimś sprzęcie. Twoja maszyna tylko uruchamia pętlę orkiestracji: weź wejście, zawołaj API, sparsuj wynik, może uderz w bazę danych, powtórz. To lekkie. Naprawdę lekkie — maszyna 1 GB robi to bez najmniejszego wysiłku.
Jeśli uruchamiasz model lokalnie, wszystko się zmienia: teraz RAM jest zdominowany przez wagi modelu i chcesz każdego rdzenia, jaki dostaniesz. Większość ludzi tego nie potrzebuje. Ci, którzy potrzebują, zwykle wiedzą dokładnie dlaczego (prywatność, brak limitów zapytań, offline). Jeśli to Ty, napisaliśmy osobny przewodnik o samodzielnym hostowaniu lokalnego LLM.
Dobór według obciążenia
Prawdziwe liczby, na których możesz działać:
| Obciążenie | RAM | vCPU | Dysk | Uwagi |
|---|---|---|---|---|
| Agent czatu / asystent (oparty na API) | 1 GB | 2 | 15 GB | Pętla jest malutka; model jest zdalny |
| Scraper / agent danych | 2 GB | 2 | 25 GB | Zapas na parsowanie + zescrapowane dane |
| Bot tradingowy | 1–2 GB | 2 | 15–25 GB | Latencja ma większe znaczenie niż rozmiar — zobacz przewodnik bota tradingowego |
| Kilku agentów równolegle | 4 GB | 4 | 35 GB | Każdy agent jest tani; współbieżność się sumuje |
| Lokalny LLM, 3B–7B (skwantyzowany) | 4–6 GB | 4–6 | 25–45 GB | Tylko CPU, działa w czytelnym tempie, nie masowo |
Wzorzec: agenci oparci na API są malutcy; lokalne modele to jedyna rzecz, która jest ciężka.
Gdzie maszyna CPU się kończy
Wprost o suficie: nasze plany kończą się na 6 GB RAM i 6 rdzeniach, tylko CPU — bez GPU. To obejmuje wszystko z tabeli powyżej, w tym lokalny model 7B do użytku osobistego. Czego to nie obejmuje: modele 13B+, lokalną inferencję o wysokiej przepustowości ani cokolwiek, co naprawdę potrzebuje GPU. Jeśli to Twoje obciążenie, VPS CPU — nasz czy kogokolwiek — jest złym narzędziem, i lepiej wiedzieć to teraz niż po wdrożeniu.
Dla 95% agentów wołających API nic z tego nie jest problemem. Są szczęśliwi na najmniejszej maszynie.
Praktyczna zasada kciuka
- Po prostu agent wołający API? Zacznij od 1 GB / 2 rdzenie. Możesz zmienić rozmiar później.
- Scrapujesz lub przechowujesz dane? 2 GB i większy dysk.
- Uruchamiasz kilku agentów lub mały lokalny model? 4–6 GB i 4+ rdzenie.
- Potrzebujesz GPU? Inna kategoria — nie wciskaj tego na CPU.
Nie przewymiarowuj z nerwów. Agenci są lekcy z natury; koszt zbyt małej maszyny to jedna zmiana rozmiaru, podczas gdy koszt zbyt dużej to płacenie za bezczynny RAM co miesiąc.
Gdy wybierzesz rozmiar, agent może wynająć maszynę sam przez MCP albo możesz zamówić ją w minutę na stronie. Tak czy owak, zacznij mało — prawie na pewno będziesz potrzebował mniej, niż oczekiwałeś.
Komentarze
Brak komentarzy. Bądź pierwszy.