A resposta honesta para "quanto servidor meu agente de IA precisa?" é: menos do que você pensa — bem até de repente não ser. O truque é saber de que lado dessa linha a sua carga fica. Então, em vez de chutar, eis o que cada tipo de agente de fato usa.
A única pergunta que decide tudo
O modelo roda no seu servidor, ou o seu agente chama um modelo por uma API?
Se o seu agente conversa com um LLM hospedado (o caso comum), a parte esperta e cara acontece no hardware de outra pessoa. Sua máquina só roda um loop de orquestração: pega a entrada, chama a API, faz parse do resultado, talvez bata num banco de dados, repete. Isso é leve. Genuinamente leve — uma máquina de 1 GB faz sem suar.
Se você roda o modelo localmente, tudo muda: agora a RAM é dominada pelos pesos do modelo, e você vai querer cada núcleo que conseguir. A maioria das pessoas não precisa disso. As que precisam geralmente sabem exatamente por quê (privacidade, sem limites de taxa, offline). Se é o seu caso, escrevemos um guia separado sobre auto-hospedar um LLM local.
Dimensionamento por carga
Números reais, do tipo em que você pode agir:
| Carga | RAM | vCPU | Disco | Notas |
|---|---|---|---|---|
| Agente de chat / assistente (via API) | 1 GB | 2 | 15 GB | O loop é minúsculo; o modelo é remoto |
| Scraper / agente de dados | 2 GB | 2 | 25 GB | Folga para parsing + dados coletados |
| Bot de trading | 1–2 GB | 2 | 15–25 GB | A latência importa mais que o tamanho — veja o guia de bot de trading |
| Vários agentes em paralelo | 4 GB | 4 | 35 GB | Cada agente é barato; a concorrência soma |
| LLM local, 3B–7B (quantizado) | 4–6 GB | 4–6 | 25–45 GB | Só CPU, roda num ritmo legível, não em massa |
O padrão: agentes via API são minúsculos; modelos locais são a única coisa que é pesada.
Onde uma máquina de CPU para
Sendo direto sobre o teto: nossos planos vão até 6 GB de RAM e 6 núcleos, só CPU — sem GPU. Isso cobre tudo na tabela acima, incluindo um modelo local de 7B para uso pessoal. O que ele não cobre: modelos de 13B+, inferência local de alto throughput, ou qualquer coisa que genuinamente precise de uma GPU. Se essa é a sua carga, um VPS de CPU — nosso ou de qualquer um — é a ferramenta errada, e é melhor saber disso agora do que depois de ter implantado.
Para os 95% dos agentes que chamam uma API, nada disso é um problema. Eles são felizes na menor máquina.
Uma regra prática
- Só um agente que chama uma API? Comece em 1 GB / 2 núcleos. Você pode redimensionar depois.
- Fazendo scraping ou armazenando dados? 2 GB e um disco maior.
- Rodando vários agentes, ou um modelo local pequeno? 4–6 GB e 4+ núcleos.
- Precisa de uma GPU? Categoria diferente — não force para a CPU.
Não superprovisione por nervosismo. Agentes são leves por natureza; o custo de uma máquina pequena demais é um redimensionamento, enquanto o custo de uma grande demais é pagar por RAM ociosa todo mês.
Quando você escolher um tamanho, um agente pode alugar a máquina sozinho via MCP, ou você pode pedi-la em um minuto no site. De qualquer forma, comece pequeno — você quase certamente vai precisar de menos do que esperava.
Comentários
Nenhum comentário ainda. Seja o primeiro.