Calor de verão — tudo derrete, até nossos preços.−25%−25% em todo plano anual, até 31 de agostoVer planos
EQVPS
Começar

VPS para RAG self-hosted em escala

A geração aumentada por recuperação deixa de ser um demo de laptop quando o corpus é real. Um índice vetorial quer RAM, e seus embeddings são seus dados privados. Veja a conta de dimensionamento e por que hospedagem com muita memória e sem KYC encaixa. A partir de US$55/mês.

Um demo de RAG num laptop com duzentos documentos parece sem esforço. Então você o aponta para um corpus real — a documentação de uma empresa, anos de chamados, uma base de conhecimento de verdade — e a coisa toda vira um problema de memória. Não um problema de CPU. Um de memória.

Veja a parte que a maioria das páginas de hospedagem pula: recuperação rápida quer o índice em RAM. Cada chunk de texto vira um embedding — um vetor de algumas centenas a alguns milhares de números de largura — e buscar significa comparar sua consulta contra todos eles, rápido. No disco funciona, mas cada consulta paga um imposto de latência, e recuperação de baixa latência foi o motivo do self-hosting em primeiro lugar.

A conta de dimensionamento, honestamente

Meça seu próprio corpus — dimensão e tipo de índice balançam muito isso — mas como sensação de partida:

Nós escrevemos a curva completa de RAM aqui se você quer os detalhes.

Por que muita memória e sem KYC juntos

Alugar 48 GB de RAM é fácil. Alugá-la com cripto e sem verificação de identidade não é — a maioria dos hosts que vendem memória séria barata fazem isso atrás de um cartão e um formulário de KYC. Seus embeddings não são números abstratos; codificam o texto de onde vieram. Seus documentos, o conteúdo dos seus clientes, transformados em vetores. Se esse dado é sensível o bastante para você pagar de forma privada, uma nuvem vetorial gerenciada desfaz o ponto inteiro — e um host que atrela o servidor à sua identidade também.

Essa combinação — muita memória, IP dedicado, cripto, sem KYC, backups noturnos — é para o que a linha Pro serve. Ela não é a mais barata por gigabyte, e se você não precisa de privacidade pode achar RAM mais barata em outro lugar. Mas se o índice é seu produto e não pode sair, este é o formato que encaixa.

Por onde começar

Escolha um plano com folga para o índice mais tudo ao redor — o app, o cliente do modelo, espaço para crescer. Para a maioria dos corpora reais isso é o Pro-48 (48 GB); um grande vai para o Pro-64 ou Pro-80. Carregue uma amostra primeiro, observe a memória, dimensione pelo número que você mediu — não o que você temeu.

Se sua recuperação é parte de um sistema de agentes maior, a mesma máquina muitas vezes segura a frota de agentes também — é assim que um plano de 48 GB silenciosamente vira um de 64 GB.

Pronto para implantar? Pague com cripto, sem KYC — online em cerca de um minuto.

Implantar agora →

FAQ

Quanta RAM minha configuração RAG de fato precisa?

Escala com a contagem de embeddings e a largura do vetor. Algumas centenas de milhares de chunks cabem em 2–4 GB; poucos milhões, com o app e o SO ao redor, chegam a 16–32 GB; dezenas de milhões empurram 48 GB e além. Meça uma amostra, observe a memória residente, extrapole — não chute alto, você só vai pagar a mais.

Por que não usar um serviço vetorial gerenciado?

Dois motivos pelos quais as pessoas de fato fazem self-hosting: seus embeddings codificam dados privados (documentos, notas, conteúdo de clientes), então mantê-los numa máquina que você controla importa; e o custo é fixo — um serviço gerenciado mede por vetores e consultas, um VPS é um número mensal que você pode martelar à vontade.

pgvector ou um motor dedicado?

Se você já roda Postgres, o pgvector é o caminho de menor esforço — uma extensão. Para milhões de vetores com filtragem pesada, um motor dedicado como o Qdrant ganha seu próprio serviço. Comece com o que você opera; separe quando a busca ficar lenta, não antes.

Preciso de uma GPU para RAG?

Não. Recuperação é trabalho de CPU + RAM — comparar vetores, não gerar texto. A etapa de geração chama seu LLM (uma API, ou um host de modelo separado). Uma máquina de CPU com muita memória é exatamente o formato certo para a metade de recuperação.

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.