Calor de verão — tudo derrete, até nossos preços.−25%−25% em todo plano anual, até 31 de agostoVer planos
EQVPS
Começar

VPS para Ollama e LLMs locais

Faça self-hosting de modelos de linguagem pequenos num servidor de CPU — privado, sem medição, pago em cripto. Honesto sobre o que a inferência em CPU pode e não pode fazer. A partir de US$12/mês.

Vamos tirar a parte decepcionante do caminho, porque a internet está cheia de páginas que não fazem isso.

Nossos servidores são só CPU. Não oferecemos GPUs. Isso significa que trabalho de LLM local aqui tem um teto duro, e fingir o contrário só desperdiçaria seu dinheiro.

O que de fato funciona na CPU

Com até 6 vCPU e 6 GB de RAM (nosso plano Medium — US$12/mês), você está na faixa de modelos pequenos quantizados:

Se você precisa de um chat 70B rápido e interativo, você precisa de um host com GPU — esse é um produto diferente de um provedor diferente, e preferimos te dizer a pegar seus US$12.

Onde uma máquina de CPU genuinamente vence

Privacidade. Seus documentos, seus prompts, seus embeddings — nunca saindo de uma máquina que você controla, nunca virando dado de treino de alguém. Para muita gente esse é o ponto inteiro, e alguns tokens por segundo são uma troca aceitável.

Previsibilidade de custo. Sem conta por token. Um pipeline que classifica cinquenta mil registros custa o mesmo que um que classifica cinquenta: US$12.

Trabalho assíncrono. A maior parte do trabalho útil de LLM não é uma janela de chat. É uma fila: sumarize estes, tagueie aqueles, embede este corpus. Uma máquina de CPU triturando um backlog durante a noite é perfeitamente boa nisso.

Configuração

# Ubuntu 24.04 — plano Medium recomendado
curl -fsSL https://ollama.com/install.sh | sh

# Comece com algo pequeno e veja você mesmo
ollama pull llama3.2:3b
ollama run llama3.2:3b "Resuma isto em uma frase: ..."

# Embeddings — o ponto ideal para a CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

O Ollama serve uma API HTTP em localhost:11434. Mantenha ali. Se você precisa alcançá-lo de outro lugar, coloque-o atrás de um reverse proxy com autenticação num plano com IP dedicado — nunca exponha um endpoint de modelo sem autenticação à internet aberta.

Pareie-o com um banco vetorial (Qdrant ou pgvector no Docker) e você tem uma stack RAG privada completa numa máquina de US$12. Essa combinação — embeddings locais pequenos, armazenamento vetorial local, API externa só para a etapa pesada de geração — é a configuração que de fato faz sentido em hardware como este.

Escolhendo um plano

UsoPlanoPreço
Embeddings, modelos 1–3B, pipeline RAGMediumUS$12/mês
O mesmo, mais um endpoint público atrás de authMedium-IPUS$20/mês
Só testando modelos pequenosSmallUS$8/mês

Só CPU, até 6 vCPU e 6 GB RAM. Armazenamento NVMe, tráfego sem medição, Alemanha ou Finlândia. Pagamento em cripto, sem KYC. A cobrança anual é uma transferência em vez de doze.

Leitura relacionada


Pronto? Implante um servidor → — online em cerca de um minuto, pago em cripto, sem documento.

Pronto para implantar? Pague com cripto, sem KYC — online em cerca de um minuto.

Implantar agora →

FAQ

Posso rodar o Llama 70B nisto?

Não. Nossos planos são só CPU com até 6 GB de RAM — essa é a faixa de modelos pequenos quantizados (mais ou menos 1B–8B em 4-bit). Um modelo 70B precisa de GPU e muito mais memória. Não oferecemos GPUs, e preferimos dizer isso a te vender uma decepção.

Quão rápida é a inferência em CPU, de verdade?

Espere alguns tokens por segundo num modelo 7–8B com quantização de 4-bit, e visivelmente melhor em modelos 1–3B. Isso é bom para jobs em segundo plano, embeddings, classificação e pipelines assíncronos. Não é bom para um chat interativo ágil.

Então para que isto serve de verdade?

Embeddings privados, classificação, filas de sumarização, pipelines RAG em que a latência não importa, e manter dados fora de APIs de terceiros. Também: aprender, testar e prototipar antes de alugar uma GPU em algum lugar.

Vocês pedem documento?

Não. E-mail para registrar, USDC ou USDT para pagar. Que muitas vezes é o próprio motivo pelo qual as pessoas querem um modelo privado.

Comentários

Nenhum comentário ainda. Seja o primeiro.

Deixe um comentário

Os comentários são moderados antes de aparecerem.