Vamos tirar a parte decepcionante do caminho, porque a internet está cheia de páginas que não fazem isso.
Nossos servidores são só CPU. Não oferecemos GPUs. Isso significa que trabalho de LLM local aqui tem um teto duro, e fingir o contrário só desperdiçaria seu dinheiro.
O que de fato funciona na CPU
Com até 6 vCPU e 6 GB de RAM (nosso plano Medium — US$12/mês), você está na faixa de modelos pequenos quantizados:
- Modelos 1B–3B (Q4): genuinamente usáveis. Rápidos o bastante para classificação, tagueamento, roteamento e extração estruturada simples.
- Modelos 7B–8B (Q4): rodam, mas espere alguns tokens por segundo. Bom para uma fila que mastiga documentos durante a noite. Doloroso como janela de chat.
- Modelos de embedding: ótimo encaixe. São pequenos, rápidos na CPU, e este é provavelmente o melhor motivo para rodar o Ollama numa máquina como a nossa.
- 13B e acima: não. Você vai ficar fazendo swap e esperando.
Se você precisa de um chat 70B rápido e interativo, você precisa de um host com GPU — esse é um produto diferente de um provedor diferente, e preferimos te dizer a pegar seus US$12.
Onde uma máquina de CPU genuinamente vence
Privacidade. Seus documentos, seus prompts, seus embeddings — nunca saindo de uma máquina que você controla, nunca virando dado de treino de alguém. Para muita gente esse é o ponto inteiro, e alguns tokens por segundo são uma troca aceitável.
Previsibilidade de custo. Sem conta por token. Um pipeline que classifica cinquenta mil registros custa o mesmo que um que classifica cinquenta: US$12.
Trabalho assíncrono. A maior parte do trabalho útil de LLM não é uma janela de chat. É uma fila: sumarize estes, tagueie aqueles, embede este corpus. Uma máquina de CPU triturando um backlog durante a noite é perfeitamente boa nisso.
Configuração
# Ubuntu 24.04 — plano Medium recomendado
curl -fsSL https://ollama.com/install.sh | sh
# Comece com algo pequeno e veja você mesmo
ollama pull llama3.2:3b
ollama run llama3.2:3b "Resuma isto em uma frase: ..."
# Embeddings — o ponto ideal para a CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
O Ollama serve uma API HTTP em localhost:11434. Mantenha ali. Se você precisa alcançá-lo de outro lugar, coloque-o atrás de um reverse proxy com autenticação num plano com IP dedicado — nunca exponha um endpoint de modelo sem autenticação à internet aberta.
Pareie-o com um banco vetorial (Qdrant ou pgvector no Docker) e você tem uma stack RAG privada completa numa máquina de US$12. Essa combinação — embeddings locais pequenos, armazenamento vetorial local, API externa só para a etapa pesada de geração — é a configuração que de fato faz sentido em hardware como este.
Escolhendo um plano
| Uso | Plano | Preço |
|---|---|---|
| Embeddings, modelos 1–3B, pipeline RAG | Medium | US$12/mês |
| O mesmo, mais um endpoint público atrás de auth | Medium-IP | US$20/mês |
| Só testando modelos pequenos | Small | US$8/mês |
Só CPU, até 6 vCPU e 6 GB RAM. Armazenamento NVMe, tráfego sem medição, Alemanha ou Finlândia. Pagamento em cripto, sem KYC. A cobrança anual é uma transferência em vez de doze.
Leitura relacionada
- Hospede um banco vetorial para memória de IA — a outra metade de uma stack RAG privada
- VPS para agentes de IA — orquestração na mesma máquina
Pronto? Implante um servidor → — online em cerca de um minuto, pago em cripto, sem documento.
Comentários
Nenhum comentário ainda. Seja o primeiro.