O Ollama torna rodar um modelo local uma instalação de uma linha. Este é o guia; para o retrato honesto do que a inferência em CPU pode e não pode fazer (e o ponto ideal do RAG), veja o caso de uso VPS para Ollama e auto-hospedar o Ollama.
1. Instale o Ollama
curl -fsSL https://ollama.com/install.sh | sh
Isso instala o Ollama e o inicia como serviço systemd escutando em localhost:11434.
2. Baixe e rode um modelo pequeno
Numa máquina de CPU, comece pequeno:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Modelos 3B são realmente usáveis em CPU; 7–8B rodam a alguns tokens/s (ok para batch, doloroso para chat); 13B+ vão fazer swap e rastejar — não faça.
3. Chame a API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings são o ponto ideal da CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Mantenha em localhost — exponha com segurança se necessário
O Ollama liga-se a 127.0.0.1:11434 por padrão. Deixe-o lá. Se precisar alcançá-lo de outra máquina, ponha na frente um reverse proxy com auth num plano de IP dedicado (guia nginx + HTTPS) ou use um túnel SSH — nunca exponha publicamente um endpoint de modelo sem autenticação.
A parte honesta
São instâncias só de CPU (sem GPU). Modelos quantizados pequenos e embeddings rodam bem; os grandes não. Combine o Ollama com um banco de dados vetorial para uma pilha RAG privada — embeddings locais pequenos mais um armazenamento vetorial local é o arranjo que realmente brilha aqui. Medium (US$ 12/mês, 6 GB) é o plano confortável. Root em cerca de um minuto, sem KYC, pagamento em cripto.
Comentários
Nenhum comentário ainda. Seja o primeiro.