La respuesta honesta a «¿cuánto servidor necesita mi agente de IA?» es: menos de lo que crees — justo hasta que de repente no. El truco es saber en qué lado de esa línea se sitúa tu workload. Así que en lugar de adivinar, aquí está lo que cada tipo de agente usa realmente.
La única pregunta que lo decide todo
¿Corre el modelo en tu servidor, o tu agente llama a un modelo por una API?
Si tu agente habla con un LLM alojado (el caso común), la parte inteligente y cara pasa en el hardware de otro. Tu máquina solo ejecuta un bucle de orquestación: toma input, llama a la API, parsea el resultado, quizá accede a una base de datos, repite. Eso es ligero. Genuinamente ligero — una máquina de 1 GB lo hace sin sudar.
Si ejecutas el modelo localmente, todo cambia: ahora la RAM está dominada por los pesos del modelo, y querrás cada núcleo que puedas conseguir. La mayoría de la gente no necesita esto. Los que lo hacen suelen saber exactamente por qué (privacidad, sin límites de tasa, offline). Si ese eres tú, escribimos una guía aparte sobre autoalojar un LLM local.
Dimensionamiento por workload
Números reales, del tipo con el que puedes actuar:
| Workload | RAM | vCPU | Disco | Notas |
|---|---|---|---|---|
| Agente de chat / asistente (respaldado por API) | 1 GB | 2 | 15 GB | El bucle es diminuto; el modelo es remoto |
| Scraper / agente de datos | 2 GB | 2 | 25 GB | Margen para parsing + datos scrapeados |
| Bot de trading | 1–2 GB | 2 | 15–25 GB | La latencia importa más que el tamaño — mira la guía de bots de trading |
| Varios agentes en paralelo | 4 GB | 4 | 35 GB | Cada agente es barato; la concurrencia se acumula |
| LLM local, 3B–7B (quantizado) | 4–6 GB | 4–6 | 25–45 GB | Solo CPU, corre a un ritmo legible, no en masa |
El patrón: los agentes respaldados por API son diminutos; los modelos locales son lo único que es pesado.
Dónde se detiene una máquina de CPU
Siendo directos sobre el techo: nuestros planes acaban en 6 GB de RAM y 6 núcleos, solo CPU — sin GPU. Eso cubre todo lo de la tabla de arriba, incluido un modelo local de 7B para uso personal. Lo que no cubre: modelos de 13B+, inferencia local de alto throughput, o cualquier cosa que de verdad necesite una GPU. Si ese es tu workload, un VPS de CPU — el nuestro o el de nadie — es la herramienta equivocada, y es mejor saberlo ahora que después de haber desplegado.
Para el 95 % de los agentes que llaman a una API, nada de esto es un problema. Están contentos con la máquina más pequeña.
Una regla general práctica
- ¿Solo un agente que llama a una API? Empieza en 1 GB / 2 núcleos. Puedes cambiar el tamaño después.
- ¿Scrapeando o almacenando datos? 2 GB y un disco más grande.
- ¿Ejecutando varios agentes, o un pequeño modelo local? 4–6 GB y 4+ núcleos.
- ¿Necesita una GPU? Categoría distinta — no la fuerces en CPU.
No sobredimensiones por nerviosismo. Los agentes son ligeros por naturaleza; el coste de una máquina demasiado pequeña es un cambio de tamaño, mientras que el coste de una máquina demasiado grande es pagar por RAM ocioso cada mes.
Cuando hayas elegido un tamaño, un agente puede alquilar la máquina él mismo mediante MCP, o puedes pedirla en un minuto en el sitio. De cualquier forma, empieza pequeño — casi con seguridad necesitarás menos de lo que esperabas.
Comentarios
Aún no hay comentarios. Sé el primero.