Calor de verano — todo se derrite, hasta nuestros precios.−25%−25 % en cada plan anual, hasta el 31 de agostoVer planes
EQVPS
Empezar

VPS para inferencia LLM privada de alta memoria

Los modelos cuantizados más grandes necesitan RAM de verdad, no una GPU que no tienes. Dónde una máquina de CPU de alta memoria ejecuta modelos de clase 30B en privado, qué es realista, y dónde no. Desde 70 $/mes.

Tenemos una página aparte para Ollama y modelos pequeños — esa es la máquina de CPU de 12 $ ejecutando 1B–8B y embeddings. Esta página es el otro extremo: los modelos lo bastante grandes como para que la RAM, no la CPU, sea lo que te frena.

Seamos honestos por delante, igual que en todas partes: nuestros servidores son solo de CPU, sin GPU. Un modelo grande aquí corre despacio. Si quieres chat interactivo rápido sobre un modelo de 30B, necesitas un host con GPU — producto distinto, proveedor distinto. Lo que una máquina de CPU de alta memoria hace bien es ejecutar un modelo cuantizado grande en privado para trabajo que no es una ventana de chat.

La cuenta de la RAM

El modelo se sitúa en memoria, cuantizado o no, más overhead para el contexto y el runtime:

Por eso "ejecutar un modelo local más grande" es en realidad una cuestión de alta memoria. El modelo es la huella de memoria. Añade un índice RAG en el mismo host y los números se apilan.

Dónde gana de verdad lo privado primero

El argumento no es la velocidad y no es el coste — es que algunos datos no pueden salir. Documentos legales. Historiales médicos. Código propietario. Cualquier cosa donde enviar el prompt a una API de terceros esté descartado. Un modelo más lento que corre enteramente en tu máquina gana a uno rápido que registra todo lo que le envías. Escribimos el cuadro completo aquí.

Y si los datos son así de sensibles, el pago probablemente también debería ser privado. Alquilar la máquina con cripto y sin KYC mantiene toda la cadena — servidor, modelo, prompts, facturación — fuera de los registros de identidad de nadie. Ese es el argumento: no inferencia más barata, sino inferencia que nadie más puede ver.

Qué elegir

Para un modelo de clase 30B con sitio para el contexto, Pro-64 (64 GB) es la elección cómoda; una cuantización más ajustada cabe en Pro-32 o Pro-48, una más grande va a Pro-80. Carga el modelo primero, mira la memoria residente, dimensiona a partir de lo que mediste. Y ajusta las expectativas: esto es inferencia privada por lotes, no una ventana de chat rápida.

¿Listo para desplegar? Paga en cripto, sin KYC — en línea en aproximadamente un minuto.

Desplegar →

Preguntas frecuentes

¿En qué se diferencia esto de vuestro caso de uso de Ollama?

La página de Ollama trata de modelos pequeños en una máquina de CPU de 12 $ — 1B–8B, embeddings, trabajo ligero. Esto es el extremo de alta memoria: modelos cuantizados de 13B a clase 30B que necesitan 24–48 GB o más solo para cargar. La misma realidad de solo CPU, una huella de memoria mucho mayor, un plan distinto.

¿Cuánta RAM para un modelo dado?

El modelo tiene que caber en memoria más overhead. Un modelo de 13B a 4 bits quiere ~10–16 GB; los cuantizados de clase 30B empujan a 24–48 GB; sube más o a mayor precisión y estás en 64–80 GB — más allá de eso, ninguna máquina nuestra individual encaja. Añade sitio para el contexto encima.

¿Será rápido?

No — sé honesto contigo mismo aquí. La inferencia en CPU sobre un modelo grande es unos pocos tokens por segundo, no un flujo interactivo. Está bien para trabajo por lotes y en segundo plano (resume durante la noche, clasifica una cola). Para chat en tiempo real sobre un modelo grande necesitas una GPU, que no ofrecemos.

¿Por qué ejecutarlo aquí en lugar de una API?

Privacidad. Tus prompts y salidas nunca tocan los servidores o registros de un proveedor. Para datos sensibles — legales, médicos, código interno — un modelo privado más lento gana a uno rápido que lo ve todo. Combínalo con pago en cripto sin KYC y toda la cadena sigue siendo tuya.

Comentarios

Aún no hay comentarios. Sé el primero.

Deja un comentario

Los comentarios se moderan antes de aparecer.