Temos uma página separada para Ollama e modelos pequenos — essa é a máquina de CPU de US$12 rodando 1B–8B e embeddings. Esta página é o outro lado: os modelos grandes o bastante para que a RAM, não a CPU, seja o que te para.
Sejamos honestos de cara, igual em todo lugar: nossos servidores são só CPU, sem GPU. Um modelo grande aqui roda devagar. Se você quer chat interativo rápido num modelo 30B, você precisa de um host com GPU — produto diferente, provedor diferente. O que uma máquina de CPU com muita memória faz bem é rodar um modelo quantizado grande de forma privada para trabalho que não é uma janela de chat.
A conta de RAM
O modelo fica na memória, quantizado ou não, mais overhead para contexto e o runtime:
- 13B, 4-bit — mais ou menos 10–16 GB. Já roda num plano médio.
- Classe 30B, quantizada — 24–48 GB dependendo da quantização. Este é território Pro-32 a Pro-64.
- Maior ou de maior precisão — 64–80 GB, e além de 80 GB nenhuma máquina única nossa cabe. O Pro-80 é o teto aqui.
É por isso que "rodar um modelo local maior" é na verdade uma questão de muita memória. O modelo é a pegada de memória. Adicione um índice RAG no mesmo host e os números empilham.
Onde a abordagem privacidade-primeiro genuinamente vence
O argumento não é velocidade nem custo — é que alguns dados não podem sair. Documentos jurídicos. Prontuários médicos. Código proprietário. Qualquer coisa em que enviar o prompt para uma API de terceiros está fora de questão. Um modelo mais lento que roda inteiramente na sua máquina bate um rápido que loga tudo o que você envia. Nós escrevemos o quadro completo aqui.
E se o dado é tão sensível, o pagamento provavelmente também deveria ser privado. Alugar a máquina com cripto e sem KYC mantém a cadeia inteira — servidor, modelo, prompts, cobrança — fora dos registros de identidade de qualquer um. Essa é a proposta: não inferência mais barata, mas inferência que ninguém mais consegue ver.
O que escolher
Para um modelo classe 30B com espaço para contexto, o Pro-64 (64 GB) é a escolha confortável; uma quantização mais apertada cabe no Pro-32 ou Pro-48, uma maior vai para o Pro-80. Carregue o modelo primeiro, observe a memória residente, dimensione pelo que você mediu. E ajuste as expectativas: isto é inferência privada em lote, não uma janela de chat rápida.
Comentários
Nenhum comentário ainda. Seja o primeiro.