Seamos honestos de entrada: si quieres generación rápida, barata y de alta calidad, llama a una API. Un VPS de CPU no ganará a un centro de datos lleno de GPUs, y cualquiera que te diga lo contrario está vendiendo algo.
Entonces, ¿por qué autoalojar inferencia? Una razón, y es buena: el modelo en tu servidor nunca envía tus prompts a ningún sitio.
Cómo se ve realmente la inferencia en CPU
Puedes ejecutar modelos de verdad en CPU con suficiente RAM. Un modelo de 7–8B quantizado a 4-bit funciona. Un 13B funciona. Incluso puedes empujar un modelo de clase 30B si tienes la memoria. Lo que no puedes hacer es que sea rápido — la salida llega a unos pocos tokens por segundo, no el flujo instantáneo que te da una API.
Ese es el trato honesto. Para chat interactivo es frustrante. Para trabajo en segundo plano — resumir documentos de noche, clasificar una cola, enriquecer datos según un horario — unos pocos tokens por segundo está completamente bien, y nadie mira el reloj.
La cuenta de RAM
El modelo tiene que estar en memoria, quantizado o no, más overhead para el contexto y el runtime:
- 7–8B, 4-bit — unos 6–8 GB. Corre en un plan medio.
- 13B, 4-bit — grosso modo 10–16 GB.
- Clase 30B, quantizado — 24–48 GB, según la quantización.
- Más grande, o mayor precisión — te metes en 64–80 GB rápido — y por encima de 80 GB no cabe ninguna máquina Pro, aún lenta en CPU.
Por esto «ejecutar un modelo local» se convierte en silencio en una cuestión de alta memoria. El modelo es el footprint de memoria. Añade un índice RAG o agentes en la misma máquina y los números se apilan.
Ollama vs vLLM, brevemente
Ollama es la puerta fácil — instala, ollama run, listo. Es la herramienta adecuada para una configuración privada de un solo usuario donde solo quieres el modelo disponible. vLLM está construido para el throughput de serving: más configuración, mejor bajo carga concurrente, vale la pena cuando de verdad manejas volumen. Empieza con Ollama; recurre a vLLM cuando estés sirviendo tráfico real.
Dónde gana de verdad privacy-first
El argumento para la inferencia autoalojada no es velocidad ni coste — es que algunos datos no pueden salir. Documentos legales. Registros médicos. Código propietario. Cualquier cosa donde enviar el prompt a una API de terceros está descartado por razones de política o confianza. Un modelo más lento que corre por completo en tu máquina gana a uno rápido que registra todo lo que le envías.
Y si los datos son así de sensibles, el pago probablemente también debería ser privado. Alquilar la máquina con cripto y sin KYC mantiene toda la cadena — servidor, modelo, prompts, facturación — fuera de los registros de identidad de nadie. Ese es el pitch de verdad: no «inferencia más barata», sino «inferencia que nadie más puede ver».
Conclusión
Para velocidad y calidad, usa una API — sin vergüenza. Autoaloja cuando la privacidad es el requisito y más lento es aceptable. Dimensiona para el modelo más su contexto más cualquier otra cosa que comparta la máquina, y no esperes velocidad de GPU de una CPU.
Cuando el modelo necesita memoria de verdad, la línea Pro corre de 32 a 80 GB con una IP dedicada y copias de seguridad nocturnas — suficiente para mantener un modelo quantizado serio con espacio para el contexto alrededor.
Comentarios
Aún no hay comentarios. Sé el primero.