O erro que vejo com mais frequência na hospedagem de agentes é dimensionar para a coisa errada. Alguém roda um agente, ele usa 400 MB, e conclui que agentes são baratos de hospedar. Depois escala para uma equipe de verdade e a máquina começa a fazer swap às 3 da manhã.
Um agente é barato. Não é esse o caso interessante.
Para onde a memória de fato vai
Um agente que só dispara chamadas de API para um modelo é leve — ele fica na maior parte esperando pela rede. Você poderia rodar uma dúzia desses num plano pequeno e nunca notar.
A RAM some quando os agentes começam a segurar estado. Histórico de conversa que cresce a cada turno. Um conjunto de trabalho que vários agentes leem e escrevem. Um vector store para memória de longo prazo dentro do mesmo processo. No momento em que sua arquitetura deixa de ser "chame a API, esqueça" e vira "lembre, coordene, repasse", a memória vira a restrição, não a CPU.
CrewAI, LangGraph, loops no estilo AutoGPT — todos tendem para esse lado à medida que ficam sérios. O framework não come a RAM; o estado come.
Dimensionamento aproximado, honestamente
Não vou fingir que há uma fórmula, porque não há — depende inteiramente de quanto cada agente mantém por perto. Mas uma sensação prática de quem roda isto:
- Agentes leves, ligados à API — você não precisa de Pro aqui; um plano NAT ou com IP dedicado (US$3–20) dá conta. O Pro ganha seu lugar quando o estado compartilhado te empurra além de ~32 GB.
- 32 GB — o ponto ideal para um sistema multi-agente de verdade: 5–10 agentes com memória compartilhada mais um banco de dados vetorial que é de fato útil. A maioria das pessoas para aqui.
- 64 GB — frotas maiores, históricos mais longos, um índice de memória na casa dos milhões de vetores, ou vários serviços co-localizados. É aqui que uma máquina substitui as três menores que você de outra forma malabaria.
- 80 GB — trabalho pesado e ligado à memória: grandes conjuntos de dados em memória, muitos agentes concorrentes, ou agentes mais inferência de modelo local no mesmo host.
Comece abaixo de onde você acha que precisa estar. Observe o htop por um dia. Redimensione para cima quando ver swap, não antes — chutar alto só desperdiça dinheiro.
A parte que é difícil de comprar
Eis a coisa que torna isto estranho: alugar 64 GB de RAM é fácil. Alugar 64 GB com cripto e sem verificação de identidade não é. A maioria dos hosts que vende memória séria barato o faz por trás de um cartão e um formulário de KYC.
Se o seu agente provisiona o próprio servidor, ou a carga toca dados que você preferiria não atrelar a um nome, essa combinação — alta memória, cripto, sem KYC e pedível pelo próprio agente via MCP — é o produto de verdade. Não é mais barato por gigabyte, e eu escrevi separadamente sobre por que essa comparação engana. Está disponível em termos que quase ninguém oferece.
Então o que você faz
Se seus agentes são leves e ligados à API, não pense demais — um plano NAT ou com IP dedicado pequeno é bastante, pule toda a questão de alta memória. Se você está rodando uma frota de verdade que segura estado, dimensione pelo que está de fato em memória, comece em 32 GB e suba quando o gráfico te disser.
Quando você estiver lá, a linha Pro cobre de 32 a 80 GB com um IP dedicado e backups noturnos. Escolha o tier que combina com o seu conjunto de trabalho, não com suas ambições.
Comentários
Nenhum comentário ainda. Seja o primeiro.