Calor de verão — tudo derrete, até nossos preços.−25%−25% em todo plano anual, até 31 de agostoVer planos
EQVPS
Começar

VPS para inferência privada de LLM com muita memória

Modelos quantizados maiores precisam de RAM de verdade, não de uma GPU que você não tem. Onde uma máquina de CPU com muita memória roda modelos classe 30B de forma privada, o que é realista e o que não é. A partir de US$70/mês.

Temos uma página separada para Ollama e modelos pequenos — essa é a máquina de CPU de US$12 rodando 1B–8B e embeddings. Esta página é o outro lado: os modelos grandes o bastante para que a RAM, não a CPU, seja o que te para.

Sejamos honestos de cara, igual em todo lugar: nossos servidores são só CPU, sem GPU. Um modelo grande aqui roda devagar. Se você quer chat interativo rápido num modelo 30B, você precisa de um host com GPU — produto diferente, provedor diferente. O que uma máquina de CPU com muita memória faz bem é rodar um modelo quantizado grande de forma privada para trabalho que não é uma janela de chat.

A conta de RAM

O modelo fica na memória, quantizado ou não, mais overhead para contexto e o runtime:

É por isso que "rodar um modelo local maior" é na verdade uma questão de muita memória. O modelo é a pegada de memória. Adicione um índice RAG no mesmo host e os números empilham.

Onde a abordagem privacidade-primeiro genuinamente vence

O argumento não é velocidade nem custo — é que alguns dados não podem sair. Documentos jurídicos. Prontuários médicos. Código proprietário. Qualquer coisa em que enviar o prompt para uma API de terceiros está fora de questão. Um modelo mais lento que roda inteiramente na sua máquina bate um rápido que loga tudo o que você envia. Nós escrevemos o quadro completo aqui.

E se o dado é tão sensível, o pagamento provavelmente também deveria ser privado. Alugar a máquina com cripto e sem KYC mantém a cadeia inteira — servidor, modelo, prompts, cobrança — fora dos registros de identidade de qualquer um. Essa é a proposta: não inferência mais barata, mas inferência que ninguém mais consegue ver.

O que escolher

Para um modelo classe 30B com espaço para contexto, o Pro-64 (64 GB) é a escolha confortável; uma quantização mais apertada cabe no Pro-32 ou Pro-48, uma maior vai para o Pro-80. Carregue o modelo primeiro, observe a memória residente, dimensione pelo que você mediu. E ajuste as expectativas: isto é inferência privada em lote, não uma janela de chat rápida.

Pronto para implantar? Pague com cripto, sem KYC — online em cerca de um minuto.

Implantar agora →

FAQ

Como isto difere do seu caso de uso do Ollama?

A página do Ollama é sobre modelos pequenos numa máquina de CPU de US$12 — 1B–8B, embeddings, trabalho leve. Este é o lado de muita memória: modelos quantizados classe 13B a 30B que precisam de 24–48 GB ou mais só para carregar. A mesma realidade só CPU, pegada de memória muito maior, plano diferente.

Quanta RAM para um dado modelo?

O modelo tem que caber na memória mais overhead. Um modelo 13B 4-bit quer ~10–16 GB; classe 30B quantizada empurra 24–48 GB; vá maior ou de maior precisão e você chega a 64–80 GB — além disso, nenhuma máquina única nossa cabe. Adicione espaço para contexto por cima.

Vai ser rápido?

Não — seja honesto consigo aqui. Inferência em CPU num modelo grande é alguns tokens por segundo, não um stream interativo. É bom para trabalho em lote e em segundo plano (sumarizar durante a noite, classificar uma fila). Para chat em tempo real num modelo grande você precisa de GPU, que não oferecemos.

Por que rodar aqui em vez de uma API?

Privacidade. Seus prompts e saídas nunca tocam os servidores ou logs de um provedor. Para dados sensíveis — jurídicos, médicos, código interno — um modelo privado mais lento bate um rápido que vê tudo. Pareie com pagamento em cripto sem KYC e a cadeia inteira continua sua.

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.