Tenemos una página aparte para Ollama y modelos pequeños — esa es la máquina de CPU de 12 $ ejecutando 1B–8B y embeddings. Esta página es el otro extremo: los modelos lo bastante grandes como para que la RAM, no la CPU, sea lo que te frena.
Seamos honestos por delante, igual que en todas partes: nuestros servidores son solo de CPU, sin GPU. Un modelo grande aquí corre despacio. Si quieres chat interactivo rápido sobre un modelo de 30B, necesitas un host con GPU — producto distinto, proveedor distinto. Lo que una máquina de CPU de alta memoria hace bien es ejecutar un modelo cuantizado grande en privado para trabajo que no es una ventana de chat.
La cuenta de la RAM
El modelo se sitúa en memoria, cuantizado o no, más overhead para el contexto y el runtime:
- 13B, 4 bits — aproximadamente 10–16 GB. Ya corre en un plan intermedio.
- Clase 30B, cuantizado — 24–48 GB según la cuantización. Esto es territorio Pro-32 a Pro-64.
- Más grande o mayor precisión — 64–80 GB, y pasando de 80 GB ninguna máquina nuestra individual encaja. Pro-80 es el techo aquí.
Por eso "ejecutar un modelo local más grande" es en realidad una cuestión de alta memoria. El modelo es la huella de memoria. Añade un índice RAG en el mismo host y los números se apilan.
Dónde gana de verdad lo privado primero
El argumento no es la velocidad y no es el coste — es que algunos datos no pueden salir. Documentos legales. Historiales médicos. Código propietario. Cualquier cosa donde enviar el prompt a una API de terceros esté descartado. Un modelo más lento que corre enteramente en tu máquina gana a uno rápido que registra todo lo que le envías. Escribimos el cuadro completo aquí.
Y si los datos son así de sensibles, el pago probablemente también debería ser privado. Alquilar la máquina con cripto y sin KYC mantiene toda la cadena — servidor, modelo, prompts, facturación — fuera de los registros de identidad de nadie. Ese es el argumento: no inferencia más barata, sino inferencia que nadie más puede ver.
Qué elegir
Para un modelo de clase 30B con sitio para el contexto, Pro-64 (64 GB) es la elección cómoda; una cuantización más ajustada cabe en Pro-32 o Pro-48, una más grande va a Pro-80. Carga el modelo primero, mira la memoria residente, dimensiona a partir de lo que mediste. Y ajusta las expectativas: esto es inferencia privada por lotes, no una ventana de chat rápida.
Comentarios
Aún no hay comentarios. Sé el primero.