Calor de verão — tudo derrete, até nossos preços.−25%−25% em todo plano anual, até 31 de agostoVer planos
EQVPS
Começar

Hospedar inferência de LLM local de forma privada: o que um VPS de CPU pode e não pode fazer

9 de ago. de 2026 · 3 min de leitura · Equipe EQVPS

Sejamos honestos de cara: se você quer geração rápida, barata e de alta qualidade, chame uma API. Um VPS de CPU não vai bater um datacenter cheio de GPUs, e quem te diz o contrário está vendendo alguma coisa.

Então por que auto-hospedar inferência afinal? Uma razão, e é uma boa: o modelo no seu servidor nunca envia seus prompts a lugar nenhum.

Como a inferência em CPU de fato é

Você pode rodar modelos de verdade na CPU com RAM suficiente. Um modelo de 7–8B quantizado a 4-bit funciona. Um 13B funciona. Você pode até empurrar um modelo da classe 30B se tiver a memória. O que você não consegue fazer é deixá-lo rápido — a saída vem a alguns tokens por segundo, não o fluxo instantâneo que uma API dá.

Esse é o trade honesto. Para chat interativo é frustrante. Para trabalho de fundo — resumir documentos durante a noite, classificar uma fila, enriquecer dados num agendamento — alguns tokens por segundo estão completamente bem, e ninguém está olhando o relógio.

A conta da RAM

O modelo tem que ficar na memória, quantizado ou não, mais a sobrecarga de contexto e o runtime:

É por isso que "rodar um modelo local" silenciosamente vira uma questão de alta memória. O modelo é a pegada de memória. Adicione um índice RAG ou agentes na mesma máquina e os números se somam.

Ollama vs vLLM, brevemente

O Ollama é a porta de entrada fácil — instale, ollama run, pronto. É a ferramenta certa para um setup privado de um único usuário onde você só quer o modelo disponível. O vLLM é feito para throughput de serving: mais setup, melhor sob carga concorrente, vale a pena quando você está de fato lidando com volume. Comece com o Ollama; recorra ao vLLM quando estiver servindo tráfego de verdade.

Onde privacidade-primeiro genuinamente vence

O argumento para inferência auto-hospedada não é velocidade nem custo — é que alguns dados não podem sair. Documentos jurídicos. Registros médicos. Código proprietário. Qualquer coisa em que enviar o prompt a uma API de terceiros está fora de cogitação por política ou confiança. Um modelo mais lento que roda inteiramente na sua máquina bate um rápido que registra tudo o que você envia.

E se o dado é tão sensível, o pagamento provavelmente também deveria ser privado. Alugar a máquina com cripto e sem KYC mantém a cadeia inteira — servidor, modelo, prompts, faturamento — fora dos registros de identidade de qualquer um. Esse é o argumento de verdade: não "inferência mais barata", mas "inferência que mais ninguém pode ver".

Conclusão

Para velocidade e qualidade, use uma API — sem vergonha nisso. Auto-hospede quando privacidade é o requisito e mais lento é aceitável. Dimensione para o modelo mais o contexto dele mais qualquer outra coisa compartilhando a máquina, e não espere velocidade de GPU de uma CPU.

Quando o modelo precisa de memória de verdade, a linha Pro roda de 32 a 80 GB com um IP dedicado e backups noturnos — o suficiente para manter um modelo quantizado sério com espaço para contexto ao redor.

FAQ

Posso rodar um LLM sem uma GPU?

Modelos quantizados pequenos, sim — e devagar. Um modelo de 7–8B quantizado a 4-bit roda na CPU com RAM suficiente, mas você vai medir a saída em alguns tokens por segundo, não o fluxo ágil que uma API te dá. Bom para jobs em lote e tarefas de fundo, doloroso para chat interativo.

Quanta RAM para inferência local?

O modelo tem que caber na memória mais a sobrecarga. Um modelo de 7–8B a 4-bit quer ~6–8 GB; 13B em torno de 10–16 GB; modelos da classe 30B empurram 24–48 GB quantizados. Adicione espaço para contexto e qualquer outra coisa na máquina. É por isso que a inferência local cai em território de alta memória rápido.

Ollama ou vLLM?

O Ollama é a porta de entrada fácil — um comando, modelo puxado, rodando. O vLLM é para throughput e serving, mais setup, melhor sob carga. Para uma máquina privada de um único usuário, o Ollama geralmente é a escolha certa; o vLLM quando você está de fato servindo requisições em volume.

Por que auto-hospedar inferência afinal se é mais lento?

Privacidade. Seus prompts e saídas nunca tocam os servidores ou logs de um provedor. Para dados sensíveis — jurídicos, médicos, código interno, qualquer coisa que você não possa enviar a um terceiro — um modelo privado mais lento bate um rápido que vê tudo. Combine-o com pagamento em cripto sem KYC e a cadeia inteira continua sua.

← Voltar ao blogVer planos e preços →

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.