Enviar todo prompt para a API de outra pessoa está bem — até não estar. Talvez o dado seja sensível e você preferisse que ele nunca saísse do seu servidor. Talvez você esteja cansado de limites de taxa, ou de uma versão de modelo mudando por baixo dos seus pés, ou de um medidor por token contando enquanto você experimenta. Em algum ponto "e se eu só rodasse o meu próprio?" deixa de ser um experimento mental.
O Ollama torna isso genuinamente fácil. A pergunta mais difícil é o que cabe num VPS — e aqui a resposta honesta importa mais que o hype.
O que você de fato consegue rodar na CPU
Sem GPU? Então você está fazendo inferência em CPU, e o tamanho do modelo é tudo. A quantização (espremer os pesos para 4-bit) é o que torna isto prático — você perde uma lasca de qualidade e economiza uma pilha de memória.
Números aproximados, os que importam:
- Modelo de 3B, 4-bit — ~3 GB de RAM. Ágil o bastante para chat e tarefas simples.
- Modelo de 7B, 4-bit — ~5 GB de RAM. O ponto ideal: perceptivelmente mais esperto, ainda roda num ritmo legível.
- 13B para cima — 8-10 GB+ e lento na CPU. Tecnicamente possível, na prática irritante.
Velocidade, honestamente: em algumas vCPUs você vai ver um punhado de tokens por segundo. Perfeitamente bom para um chatbot ou um assistente de código onde você lê conforme ele digita. Não bom para processar em lote um milhão de documentos — esse é um trabalho de GPU, e não fingimos o contrário. Não oferecemos instâncias com GPU. Se o seu plano precisa de um modelo de 70B ou throughput pesado, um VPS de CPU — nosso ou de quem quer que seja — é a ferramenta errada, e você deveria saber disso antes de gastar um centavo.
Mas um 7B privado que responde às suas perguntas e nunca liga para casa? Isso roda confortavelmente numa máquina de 6 GB.
A instalação — três comandos
Suba o servidor, faça SSH, e:
curl -fsSL https://ollama.com/install.sh | sh # instala o Ollama
ollama run llama3.2:3b # puxa + roda um modelo de 3B
É isso — você está conversando no terminal. Para usá-lo do seu próprio código, o Ollama já serve uma API HTTP na porta 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Resuma este changelog em duas linhas: ...",
"stream": false
}'
Uma pegadinha que vale saber de cara: por padrão essa API se vincula ao localhost. Mantenha assim e tunele por SSH, ou ela fica exposta à internet. Se você quer que ela seja alcançável, coloque-a atrás de autenticação — não deixe um endpoint de modelo aberto num IP público.
Escolhendo a máquina
Combine o plano com o modelo, não o contrário:
| Você quer rodar | RAM que você precisa | Plano sensato |
|---|---|---|
| Modelo de 3B, uso leve | ~3 GB | Small (4 GB) |
| Modelo de 7B, confortavelmente | ~5-6 GB | Medium (6 GB) |
| Maior / throughput alto | território de GPU | não um VPS de CPU |
Para a maioria dos auto-hospedadores, Medium (6 GB) é a recomendação honesta — folga suficiente para um modelo de 7B mais seu app e o SO. Small (4 GB) funciona se você fica no 3B. Qualquer coisa abaixo disso é apertado demais uma vez que o SO e o contexto comem espaço.
Por que fazer aqui
Se você está auto-hospedando um LLM, a privacidade geralmente é metade da razão — então seria estranho entregar seu documento para alugar a máquina. Você não precisa: você pode pagar em USDC ou USDT (ou um cartão via o on-ramp), sem KYC, e o servidor é seu em cerca de um minuto. Cripto-nativo, amigável a agentes, e os dados ficam numa máquina que você controla.
O trade-off é o mesmo sobre o qual fomos honestos: só CPU, um teto de 6 GB, modelos pequenos. Dentro disso, auto-hospedar é ótimo. Fora dele, não deixe ninguém te vender uma máquina de CPU para um trabalho que precisa de uma GPU.
Pronto para testar? Escolha um plano, pague, e você terá root em cerca de 60 segundos — depois são três comandos até o seu próprio modelo privado.
Comentários
Nenhum comentário ainda. Seja o primeiro.