Una demo de RAG en un portátil con doscientos documentos se siente sin esfuerzo. Luego la apuntas a un corpus real — los documentos de una empresa, años de tickets, una base de conocimiento de verdad — y el conjunto entero se convierte en un problema de memoria. No un problema de CPU. Uno de memoria.
Aquí está la parte que la mayoría de las páginas de hosting se saltan: la recuperación rápida quiere el índice en RAM. Cada fragmento de texto se convierte en un embedding — un vector de unos cientos a un par de miles de números de ancho — y buscar significa comparar tu consulta contra todos ellos, rápido. En disco funciona, pero cada consulta paga un impuesto de latencia, y la recuperación de baja latencia era la razón por la que autoalojaste en primer lugar.
La cuenta del dimensionado, honestamente
Mide tu propio corpus — la dimensión y el tipo de índice mueven esto mucho — pero como sensación de partida:
- Unos cientos de miles de embeddings — 2–4 GB. Una base de conocimiento personal. No necesitas Pro para esto; un plan más pequeño está bien.
- Unos pocos millones — con la app, el cliente del modelo y el SO alrededor, planifica 16–32 GB. Una base de conocimiento empresarial seria. Aquí es donde Pro-32 o Pro-48 empieza a tener sentido.
- Decenas de millones, o vectores de alta dimensión — 48 GB en adelante, y pasando de ~80 GB estás repartiendo el índice entre servidores. Grandes patrimonios documentales, recuperación multiinquilino, varios índices calientes a la vez.
Detallamos la curva completa de RAM aquí si quieres los detalles.
Por qué alta memoria y sin KYC juntos
Alquilar 48 GB de RAM es fácil. Alquilarla con cripto y sin verificación de identidad no lo es — la mayoría de los hosts que venden memoria seria barata lo hacen tras una tarjeta y un formulario KYC. Tus embeddings no son números abstractos; codifican el texto del que salieron. Tus documentos, el contenido de tus clientes, convertidos en vectores. Si esos datos son lo bastante sensibles como para que pagues en privado, una nube vectorial gestionada deshace todo el sentido — y también lo hace un host que ata el servidor a tu identidad.
Esa combinación — alta memoria, IP dedicada, cripto, sin KYC, backups nocturnos — es para lo que está la línea Pro. No es la más barata por gigabyte, y si no necesitas privacidad puedes encontrar RAM más barata en otro sitio. Pero si el índice es tu producto y no puede salir, esta es la forma que encaja.
Por dónde empezar
Elige un plan con margen para el índice más todo lo que hay alrededor — la app, el cliente del modelo, sitio para crecer. Para la mayoría de los corpus reales eso es Pro-48 (48 GB); uno grande va a Pro-64 o Pro-80. Carga una muestra primero, observa la memoria, dimensiona a partir del número que mediste — no del que temiste.
Si tu recuperación es parte de un sistema de agentes más grande, la misma máquina a menudo aloja también la flota de agentes — así es como un plan de 48 GB se convierte silenciosamente en uno de 64 GB.
Comentarios
Aún no hay comentarios. Sé el primero.