EQVPS

Como instalar o Ollama num VPS (e chamar a sua API)

Instale o Ollama num VPS, baixe um modelo pequeno e chame a sua API HTTP — com a nota honesta de que são máquinas de CPU, então fique com modelos quantizados pequenos e embeddings. Comandos copiar-colar, e como expô-lo com segurança.

O Ollama torna rodar um modelo local uma instalação de uma linha. Este é o guia; para o retrato honesto do que a inferência em CPU pode e não pode fazer (e o ponto ideal do RAG), veja o caso de uso VPS para Ollama e auto-hospedar o Ollama.

1. Instale o Ollama

curl -fsSL https://ollama.com/install.sh | sh

Isso instala o Ollama e o inicia como serviço systemd escutando em localhost:11434.

2. Baixe e rode um modelo pequeno

Numa máquina de CPU, comece pequeno:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Modelos 3B são realmente usáveis em CPU; 7–8B rodam a alguns tokens/s (ok para batch, doloroso para chat); 13B+ vão fazer swap e rastejar — não faça.

3. Chame a API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings são o ponto ideal da CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Mantenha em localhost — exponha com segurança se necessário

O Ollama liga-se a 127.0.0.1:11434 por padrão. Deixe-o lá. Se precisar alcançá-lo de outra máquina, ponha na frente um reverse proxy com auth num plano de IP dedicado (guia nginx + HTTPS) ou use um túnel SSH — nunca exponha publicamente um endpoint de modelo sem autenticação.

A parte honesta

São instâncias só de CPU (sem GPU). Modelos quantizados pequenos e embeddings rodam bem; os grandes não. Combine o Ollama com um banco de dados vetorial para uma pilha RAG privada — embeddings locais pequenos mais um armazenamento vetorial local é o arranjo que realmente brilha aqui. Medium (US$ 12/mês, 6 GB) é o plano confortável. Root em cerca de um minuto, sem KYC, pagamento em cripto.

Perguntas frequentes

Como instalo o Ollama num VPS?

Um comando: curl -fsSL https://ollama.com/install.sh | sh. Depois ollama pull de um modelo pequeno e ollama run, ou chame a API HTTP em localhost:11434. Os passos estão abaixo. Num VPS de CPU fique com modelos quantizados pequenos (1B–8B) e embeddings — modelos grandes precisam de GPU.

Os modelos serão rápidos num VPS de CPU?

Os pequenos sim, os grandes não. Espere alguns tokens por segundo num modelo 7–8B com quantização de 4 bits, e desempenho realmente ágil em modelos 1–3B e modelos de embeddings. Ótimo para jobs em segundo plano, classificação e pipelines RAG — não para um chat interativo rápido num modelo grande.

Devo expor a API do Ollama à internet?

Não. Mantenha-a em localhost:11434. Se precisar de acesso remoto, coloque-a atrás de um reverse proxy com autenticação num plano de IP dedicado, ou alcance-a por um túnel SSH. Nunca exponha um endpoint de modelo sem autenticação à internet aberta.

De que plano preciso?

Nosso Medium (US$ 12/mês, 6 GB) serve confortavelmente para modelos pequenos e embeddings; Small (US$ 8) dá para testar modelos 1–3B. São instâncias só de CPU — sem GPU — então dimensione pela pegada de RAM do modelo, não na esperança de velocidade.

Vocês pedem documento ou cartão?

Não. Um e-mail para cadastrar, pagamento em USDC ou USDT — sem documentos, sem cartão.

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.