Calor de verano — todo se derrite, hasta nuestros precios.−25%−25 % en cada plan anual, hasta el 31 de agostoVer planes
EQVPS
Empezar

Alojar inferencia de LLM local de forma privada: qué puede y qué no puede un VPS de CPU

9 ago 2026 · 3 min de lectura · EQVPS Team

Seamos honestos de entrada: si quieres generación rápida, barata y de alta calidad, llama a una API. Un VPS de CPU no ganará a un centro de datos lleno de GPUs, y cualquiera que te diga lo contrario está vendiendo algo.

Entonces, ¿por qué autoalojar inferencia? Una razón, y es buena: el modelo en tu servidor nunca envía tus prompts a ningún sitio.

Cómo se ve realmente la inferencia en CPU

Puedes ejecutar modelos de verdad en CPU con suficiente RAM. Un modelo de 7–8B quantizado a 4-bit funciona. Un 13B funciona. Incluso puedes empujar un modelo de clase 30B si tienes la memoria. Lo que no puedes hacer es que sea rápido — la salida llega a unos pocos tokens por segundo, no el flujo instantáneo que te da una API.

Ese es el trato honesto. Para chat interactivo es frustrante. Para trabajo en segundo plano — resumir documentos de noche, clasificar una cola, enriquecer datos según un horario — unos pocos tokens por segundo está completamente bien, y nadie mira el reloj.

La cuenta de RAM

El modelo tiene que estar en memoria, quantizado o no, más overhead para el contexto y el runtime:

Por esto «ejecutar un modelo local» se convierte en silencio en una cuestión de alta memoria. El modelo es el footprint de memoria. Añade un índice RAG o agentes en la misma máquina y los números se apilan.

Ollama vs vLLM, brevemente

Ollama es la puerta fácil — instala, ollama run, listo. Es la herramienta adecuada para una configuración privada de un solo usuario donde solo quieres el modelo disponible. vLLM está construido para el throughput de serving: más configuración, mejor bajo carga concurrente, vale la pena cuando de verdad manejas volumen. Empieza con Ollama; recurre a vLLM cuando estés sirviendo tráfico real.

Dónde gana de verdad privacy-first

El argumento para la inferencia autoalojada no es velocidad ni coste — es que algunos datos no pueden salir. Documentos legales. Registros médicos. Código propietario. Cualquier cosa donde enviar el prompt a una API de terceros está descartado por razones de política o confianza. Un modelo más lento que corre por completo en tu máquina gana a uno rápido que registra todo lo que le envías.

Y si los datos son así de sensibles, el pago probablemente también debería ser privado. Alquilar la máquina con cripto y sin KYC mantiene toda la cadena — servidor, modelo, prompts, facturación — fuera de los registros de identidad de nadie. Ese es el pitch de verdad: no «inferencia más barata», sino «inferencia que nadie más puede ver».

Conclusión

Para velocidad y calidad, usa una API — sin vergüenza. Autoaloja cuando la privacidad es el requisito y más lento es aceptable. Dimensiona para el modelo más su contexto más cualquier otra cosa que comparta la máquina, y no esperes velocidad de GPU de una CPU.

Cuando el modelo necesita memoria de verdad, la línea Pro corre de 32 a 80 GB con una IP dedicada y copias de seguridad nocturnas — suficiente para mantener un modelo quantizado serio con espacio para el contexto alrededor.

Preguntas frecuentes

¿Puedo ejecutar un LLM sin una GPU?

Modelos pequeños quantizados, sí — y lentamente. Un modelo de 7–8B quantizado a 4-bit corre en CPU con suficiente RAM, pero medirás la salida en unos pocos tokens por segundo, no el flujo ágil que obtienes de una API. Bien para trabajos por lotes y tareas en segundo plano, doloroso para chat interactivo.

¿Cuánta RAM para inferencia local?

El modelo tiene que caber en memoria más overhead. Un modelo de 7–8B 4-bit quiere ~6–8 GB; 13B unos 10–16 GB; los modelos de clase 30B empujan 24–48 GB quantizados. Añade espacio para el contexto y cualquier otra cosa en la máquina. Por esto la inferencia local aterriza en territorio de alta memoria rápido.

¿Ollama o vLLM?

Ollama es la rampa de acceso fácil — un comando, modelo descargado, funcionando. vLLM es para throughput y serving, más configuración, mejor bajo carga. Para una máquina privada de un solo usuario, Ollama suele ser la opción correcta; vLLM cuando de verdad estás sirviendo solicitudes en volumen.

¿Por qué autoalojar inferencia si es más lento?

Privacidad. Tus prompts y salidas nunca tocan los servidores o logs de un proveedor. Para datos sensibles — legal, médico, código interno, cualquier cosa que no puedas enviar a un tercero — un modelo privado más lento gana a uno rápido que lo ve todo. Combínalo con pago cripto sin KYC y toda la cadena sigue siendo tuya.

← Volver al blogVer planes y precios →

Comentarios

Aún no hay comentarios. Sé el primero.

Deja un comentario

Los comentarios se moderan antes de aparecer.