Calor de verano — todo se derrite, hasta nuestros precios.−25%−25 % en cada plan anual, hasta el 31 de agostoVer planes
EQVPS
Empezar

VPS para RAG autoalojado a escala

La generación aumentada por recuperación deja de ser una demo de portátil en cuanto el corpus es real. Un índice vectorial quiere RAM, y tus embeddings son tus datos privados. Aquí tienes la cuenta del dimensionado y por qué encaja el hosting de alta memoria sin KYC. Desde 55 $/mes.

Una demo de RAG en un portátil con doscientos documentos se siente sin esfuerzo. Luego la apuntas a un corpus real — los documentos de una empresa, años de tickets, una base de conocimiento de verdad — y el conjunto entero se convierte en un problema de memoria. No un problema de CPU. Uno de memoria.

Aquí está la parte que la mayoría de las páginas de hosting se saltan: la recuperación rápida quiere el índice en RAM. Cada fragmento de texto se convierte en un embedding — un vector de unos cientos a un par de miles de números de ancho — y buscar significa comparar tu consulta contra todos ellos, rápido. En disco funciona, pero cada consulta paga un impuesto de latencia, y la recuperación de baja latencia era la razón por la que autoalojaste en primer lugar.

La cuenta del dimensionado, honestamente

Mide tu propio corpus — la dimensión y el tipo de índice mueven esto mucho — pero como sensación de partida:

Detallamos la curva completa de RAM aquí si quieres los detalles.

Por qué alta memoria y sin KYC juntos

Alquilar 48 GB de RAM es fácil. Alquilarla con cripto y sin verificación de identidad no lo es — la mayoría de los hosts que venden memoria seria barata lo hacen tras una tarjeta y un formulario KYC. Tus embeddings no son números abstractos; codifican el texto del que salieron. Tus documentos, el contenido de tus clientes, convertidos en vectores. Si esos datos son lo bastante sensibles como para que pagues en privado, una nube vectorial gestionada deshace todo el sentido — y también lo hace un host que ata el servidor a tu identidad.

Esa combinación — alta memoria, IP dedicada, cripto, sin KYC, backups nocturnos — es para lo que está la línea Pro. No es la más barata por gigabyte, y si no necesitas privacidad puedes encontrar RAM más barata en otro sitio. Pero si el índice es tu producto y no puede salir, esta es la forma que encaja.

Por dónde empezar

Elige un plan con margen para el índice más todo lo que hay alrededor — la app, el cliente del modelo, sitio para crecer. Para la mayoría de los corpus reales eso es Pro-48 (48 GB); uno grande va a Pro-64 o Pro-80. Carga una muestra primero, observa la memoria, dimensiona a partir del número que mediste — no del que temiste.

Si tu recuperación es parte de un sistema de agentes más grande, la misma máquina a menudo aloja también la flota de agentes — así es como un plan de 48 GB se convierte silenciosamente en uno de 64 GB.

¿Listo para desplegar? Paga en cripto, sin KYC — en línea en aproximadamente un minuto.

Desplegar →

Preguntas frecuentes

¿Cuánta RAM necesita de verdad mi configuración RAG?

Escala con el número de embeddings y el ancho del vector. Unos cientos de miles de fragmentos caben en 2–4 GB; unos pocos millones, con la app y el SO alrededor, aterrizan en 16–32 GB; decenas de millones empujan a 48 GB y más allá. Mide una muestra, observa la memoria residente, extrapola — no adivines alto, solo pagarás de más.

¿Por qué no usar un servicio vectorial gestionado?

Dos razones por las que la gente de verdad autoaloja: tus embeddings codifican datos privados (documentos, notas, contenido de clientes), así que mantenerlos en una máquina que controlas importa; y el coste es plano — un servicio gestionado mide por vectores y consultas, un VPS es un único número mensual que puedes martillear tanto como quieras.

¿pgvector o un motor dedicado?

Si ya ejecutas Postgres, pgvector es el camino de menor esfuerzo — una extensión. Para millones de vectores con filtrado intenso, un motor a medida como Qdrant se gana su propio servicio. Empieza con lo que operas; sepáralo cuando la búsqueda se ralentice, no antes.

¿Necesito una GPU para RAG?

No. La recuperación es trabajo de CPU + RAM — comparar vectores, no generar texto. El paso de generación llama a tu LLM (una API, o un host de modelo aparte). Una máquina de CPU de alta memoria es exactamente la forma adecuada para la mitad de recuperación.

Comentarios

Aún no hay comentarios. Sé el primero.

Deja un comentario

Los comentarios se moderan antes de aparecer.