Calor de verão — tudo derrete, até nossos preços.−25%−25% em todo plano anual, até 31 de agostoVer planos
EQVPS
Começar

Auto-hospedando um LLM local num VPS com o Ollama — o que de fato funciona

14 de jun. de 2026 · 4 min de leitura · Equipe EQVPS

Enviar todo prompt para a API de outra pessoa está bem — até não estar. Talvez o dado seja sensível e você preferisse que ele nunca saísse do seu servidor. Talvez você esteja cansado de limites de taxa, ou de uma versão de modelo mudando por baixo dos seus pés, ou de um medidor por token contando enquanto você experimenta. Em algum ponto "e se eu só rodasse o meu próprio?" deixa de ser um experimento mental.

O Ollama torna isso genuinamente fácil. A pergunta mais difícil é o que cabe num VPS — e aqui a resposta honesta importa mais que o hype.

O que você de fato consegue rodar na CPU

Sem GPU? Então você está fazendo inferência em CPU, e o tamanho do modelo é tudo. A quantização (espremer os pesos para 4-bit) é o que torna isto prático — você perde uma lasca de qualidade e economiza uma pilha de memória.

Números aproximados, os que importam:

Velocidade, honestamente: em algumas vCPUs você vai ver um punhado de tokens por segundo. Perfeitamente bom para um chatbot ou um assistente de código onde você lê conforme ele digita. Não bom para processar em lote um milhão de documentos — esse é um trabalho de GPU, e não fingimos o contrário. Não oferecemos instâncias com GPU. Se o seu plano precisa de um modelo de 70B ou throughput pesado, um VPS de CPU — nosso ou de quem quer que seja — é a ferramenta errada, e você deveria saber disso antes de gastar um centavo.

Mas um 7B privado que responde às suas perguntas e nunca liga para casa? Isso roda confortavelmente numa máquina de 6 GB.

A instalação — três comandos

Suba o servidor, faça SSH, e:

curl -fsSL https://ollama.com/install.sh | sh   # instala o Ollama
ollama run llama3.2:3b                            # puxa + roda um modelo de 3B

É isso — você está conversando no terminal. Para usá-lo do seu próprio código, o Ollama já serve uma API HTTP na porta 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Resuma este changelog em duas linhas: ...",
  "stream": false
}'

Uma pegadinha que vale saber de cara: por padrão essa API se vincula ao localhost. Mantenha assim e tunele por SSH, ou ela fica exposta à internet. Se você quer que ela seja alcançável, coloque-a atrás de autenticação — não deixe um endpoint de modelo aberto num IP público.

Escolhendo a máquina

Combine o plano com o modelo, não o contrário:

Você quer rodarRAM que você precisaPlano sensato
Modelo de 3B, uso leve~3 GBSmall (4 GB)
Modelo de 7B, confortavelmente~5-6 GBMedium (6 GB)
Maior / throughput altoterritório de GPUnão um VPS de CPU

Para a maioria dos auto-hospedadores, Medium (6 GB) é a recomendação honesta — folga suficiente para um modelo de 7B mais seu app e o SO. Small (4 GB) funciona se você fica no 3B. Qualquer coisa abaixo disso é apertado demais uma vez que o SO e o contexto comem espaço.

Por que fazer aqui

Se você está auto-hospedando um LLM, a privacidade geralmente é metade da razão — então seria estranho entregar seu documento para alugar a máquina. Você não precisa: você pode pagar em USDC ou USDT (ou um cartão via o on-ramp), sem KYC, e o servidor é seu em cerca de um minuto. Cripto-nativo, amigável a agentes, e os dados ficam numa máquina que você controla.

O trade-off é o mesmo sobre o qual fomos honestos: só CPU, um teto de 6 GB, modelos pequenos. Dentro disso, auto-hospedar é ótimo. Fora dele, não deixe ninguém te vender uma máquina de CPU para um trabalho que precisa de uma GPU.

Pronto para testar? Escolha um plano, pague, e você terá root em cerca de 60 segundos — depois são três comandos até o seu próprio modelo privado.

FAQ

Posso rodar um LLM sem uma GPU?

Sim, para modelos pequenos. Um modelo de 3B ou 7B em quantização 4-bit roda na CPU e responde num ritmo legível — bom para um chatbot, um ajudante de código ou tarefas de fundo em que você não está olhando o cursor. O que você não consegue fazer na CPU é servir um modelo grande (13B para cima) ou empurrar throughput alto; é aí que uma GPU deixa de ser opcional.

Quanta RAM eu preciso para o Llama 7B?

Cerca de 5 GB para um modelo 7B de 4-bit depois de você adicionar a janela de contexto e o SO — então uma máquina de 6 GB é o piso confortável. Um modelo de 3B cabe em cerca de 3 GB. Quant menor (Q4) troca um pouco de qualidade por muito menos memória, que é o trade certo num VPS.

Auto-hospedar um LLM é mais barato que uma API?

Depende do volume. Uma API hospedada cobra por token e custa nada quando ociosa; um VPS é uma conta mensal fixa quer você use ou não. Se você roda um fluxo constante de requisições, ou você principalmente liga para privacidade e sem limites de taxa, auto-hospedar vence. Para prompts ocasionais e avulsos, uma API medida é mais barata.

Por que auto-hospedar em vez de usar uma API de nuvem?

Três razões pelas quais as pessoas de fato fazem: os dados nunca saem do seu servidor (real para jurídico, médico, ou só notas privadas), não há limites de taxa nem medidor por token, e o modelo não vai mudar nem ser descontinuado por baixo de você. O custo é que você gerencia a máquina e vive dentro do hardware dela.

Qual é o maior modelo que consigo rodar realisticamente num VPS de CPU?

Um modelo de 7B em 4-bit é o ponto ideal numa máquina de 6 GB. Você tecnicamente pode carregar um 13B com RAM suficiente, mas na CPU ele fica lento o bastante para você sentir. Além disso você quer uma GPU, que é um tipo diferente de host.

← Voltar ao blogVer planos e preços →

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.