Sejamos honestos de cara: se você quer geração rápida, barata e de alta qualidade, chame uma API. Um VPS de CPU não vai bater um datacenter cheio de GPUs, e quem te diz o contrário está vendendo alguma coisa.
Então por que auto-hospedar inferência afinal? Uma razão, e é uma boa: o modelo no seu servidor nunca envia seus prompts a lugar nenhum.
Como a inferência em CPU de fato é
Você pode rodar modelos de verdade na CPU com RAM suficiente. Um modelo de 7–8B quantizado a 4-bit funciona. Um 13B funciona. Você pode até empurrar um modelo da classe 30B se tiver a memória. O que você não consegue fazer é deixá-lo rápido — a saída vem a alguns tokens por segundo, não o fluxo instantâneo que uma API dá.
Esse é o trade honesto. Para chat interativo é frustrante. Para trabalho de fundo — resumir documentos durante a noite, classificar uma fila, enriquecer dados num agendamento — alguns tokens por segundo estão completamente bem, e ninguém está olhando o relógio.
A conta da RAM
O modelo tem que ficar na memória, quantizado ou não, mais a sobrecarga de contexto e o runtime:
- 7–8B, 4-bit — cerca de 6–8 GB. Roda num plano médio.
- 13B, 4-bit — mais ou menos 10–16 GB.
- Classe 30B, quantizado — 24–48 GB, dependendo da quantização.
- Maior, ou precisão mais alta — você entra em 64–80 GB rápido — e além de 80 GB nenhuma máquina Pro única cabe, ainda lenta na CPU.
É por isso que "rodar um modelo local" silenciosamente vira uma questão de alta memória. O modelo é a pegada de memória. Adicione um índice RAG ou agentes na mesma máquina e os números se somam.
Ollama vs vLLM, brevemente
O Ollama é a porta de entrada fácil — instale, ollama run, pronto. É a ferramenta certa para um setup privado de um único usuário onde você só quer o modelo disponível. O vLLM é feito para throughput de serving: mais setup, melhor sob carga concorrente, vale a pena quando você está de fato lidando com volume. Comece com o Ollama; recorra ao vLLM quando estiver servindo tráfego de verdade.
Onde privacidade-primeiro genuinamente vence
O argumento para inferência auto-hospedada não é velocidade nem custo — é que alguns dados não podem sair. Documentos jurídicos. Registros médicos. Código proprietário. Qualquer coisa em que enviar o prompt a uma API de terceiros está fora de cogitação por política ou confiança. Um modelo mais lento que roda inteiramente na sua máquina bate um rápido que registra tudo o que você envia.
E se o dado é tão sensível, o pagamento provavelmente também deveria ser privado. Alugar a máquina com cripto e sem KYC mantém a cadeia inteira — servidor, modelo, prompts, faturamento — fora dos registros de identidade de qualquer um. Esse é o argumento de verdade: não "inferência mais barata", mas "inferência que mais ninguém pode ver".
Conclusão
Para velocidade e qualidade, use uma API — sem vergonha nisso. Auto-hospede quando privacidade é o requisito e mais lento é aceitável. Dimensione para o modelo mais o contexto dele mais qualquer outra coisa compartilhando a máquina, e não espere velocidade de GPU de uma CPU.
Quando o modelo precisa de memória de verdade, a linha Pro roda de 32 a 80 GB com um IP dedicado e backups noturnos — o suficiente para manter um modelo quantizado sério com espaço para contexto ao redor.
Comentários
Nenhum comentário ainda. Seja o primeiro.