Um demo de RAG num laptop com duzentos documentos parece sem esforço. Então você o aponta para um corpus real — a documentação de uma empresa, anos de chamados, uma base de conhecimento de verdade — e a coisa toda vira um problema de memória. Não um problema de CPU. Um de memória.
Veja a parte que a maioria das páginas de hospedagem pula: recuperação rápida quer o índice em RAM. Cada chunk de texto vira um embedding — um vetor de algumas centenas a alguns milhares de números de largura — e buscar significa comparar sua consulta contra todos eles, rápido. No disco funciona, mas cada consulta paga um imposto de latência, e recuperação de baixa latência foi o motivo do self-hosting em primeiro lugar.
A conta de dimensionamento, honestamente
Meça seu próprio corpus — dimensão e tipo de índice balançam muito isso — mas como sensação de partida:
- Algumas centenas de milhares de embeddings — 2–4 GB. Uma base de conhecimento pessoal. Você não precisa de Pro para isto; um plano menor serve.
- Poucos milhões — com o app, o cliente do modelo e o SO ao redor, planeje 16–32 GB. Uma base de conhecimento séria de empresa. É aqui que Pro-32 ou Pro-48 começa a fazer sentido.
- Dezenas de milhões, ou vetores de alta dimensão — 48 GB e acima, e além de ~80 GB você está dividindo o índice entre servidores. Grandes acervos de documentos, recuperação multi-inquilino, vários índices quentes ao mesmo tempo.
Nós escrevemos a curva completa de RAM aqui se você quer os detalhes.
Por que muita memória e sem KYC juntos
Alugar 48 GB de RAM é fácil. Alugá-la com cripto e sem verificação de identidade não é — a maioria dos hosts que vendem memória séria barata fazem isso atrás de um cartão e um formulário de KYC. Seus embeddings não são números abstratos; codificam o texto de onde vieram. Seus documentos, o conteúdo dos seus clientes, transformados em vetores. Se esse dado é sensível o bastante para você pagar de forma privada, uma nuvem vetorial gerenciada desfaz o ponto inteiro — e um host que atrela o servidor à sua identidade também.
Essa combinação — muita memória, IP dedicado, cripto, sem KYC, backups noturnos — é para o que a linha Pro serve. Ela não é a mais barata por gigabyte, e se você não precisa de privacidade pode achar RAM mais barata em outro lugar. Mas se o índice é seu produto e não pode sair, este é o formato que encaixa.
Por onde começar
Escolha um plano com folga para o índice mais tudo ao redor — o app, o cliente do modelo, espaço para crescer. Para a maioria dos corpora reais isso é o Pro-48 (48 GB); um grande vai para o Pro-64 ou Pro-80. Carregue uma amostra primeiro, observe a memória, dimensione pelo número que você mediu — não o que você temeu.
Se sua recuperação é parte de um sistema de agentes maior, a mesma máquina muitas vezes segura a frota de agentes também — é assim que um plano de 48 GB silenciosamente vira um de 64 GB.
Comentários
Nenhum comentário ainda. Seja o primeiro.