EQVPS

Cómo instalar Ollama en un VPS (y llamar a su API)

Instala Ollama en un VPS, descarga un modelo pequeño y llama a su API HTTP — con la nota honesta de que son máquinas de CPU, así que quédate con modelos cuantizados pequeños y embeddings. Comandos copia-pega y cómo exponerlo con seguridad.

Ollama convierte ejecutar un modelo local en una instalación de una línea. Esta es la guía; para la imagen honesta de lo que la inferencia en CPU puede y no puede hacer (y el punto óptimo del RAG), consulta el caso de uso VPS para Ollama y autohospedar Ollama.

1. Instala Ollama

curl -fsSL https://ollama.com/install.sh | sh

Eso instala Ollama y lo arranca como servicio systemd escuchando en localhost:11434.

2. Descarga y ejecuta un modelo pequeño

En una máquina de CPU, empieza pequeño:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Los modelos 3B son realmente usables en CPU; los 7–8B corren a unos pocos tokens/seg (bien para batch, penoso para chat); los 13B+ harán swap y se arrastrarán — no lo hagas.

3. Llama a la API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Los embeddings son el punto óptimo de la CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Mantenlo en localhost — exponlo con seguridad si hace falta

Ollama se enlaza a 127.0.0.1:11434 por defecto. Déjalo ahí. Si necesitas alcanzarlo desde otra máquina, pon delante un reverse proxy con auth en un plan de IP dedicada (guía nginx + HTTPS) o usa un túnel SSH — nunca expongas públicamente un endpoint de modelo sin autenticación.

La parte honesta

Son instancias solo de CPU (sin GPU). Los modelos cuantizados pequeños y los embeddings corren bien; los grandes no. Combina Ollama con una base de datos vectorial para una pila RAG privada — embeddings locales pequeños más un almacén vectorial local es el montaje que de verdad brilla aquí. Medium (12 $/mes, 6 GB) es el plan cómodo. Root en un minuto aproximadamente, sin KYC, pago en cripto.

Preguntas frecuentes

¿Cómo instalo Ollama en un VPS?

Un comando: curl -fsSL https://ollama.com/install.sh | sh. Luego ollama pull un modelo pequeño y ollama run, o llama a la API HTTP en localhost:11434. Los pasos están abajo. En un VPS de CPU quédate con modelos cuantizados pequeños (1B–8B) y embeddings — los modelos grandes necesitan GPU.

¿Serán rápidos los modelos en un VPS de CPU?

Los pequeños sí; los grandes no. Espera unos pocos tokens por segundo en un modelo 7–8B con cuantización de 4 bits, y un rendimiento realmente ágil en modelos 1–3B y modelos de embeddings. Excelente para trabajos en segundo plano, clasificación y pipelines RAG — no para un chat interactivo rápido en un modelo grande.

¿Debo exponer la API de Ollama a internet?

No. Mantenla en localhost:11434. Si necesitas acceso remoto, ponla tras un reverse proxy con autenticación en un plan de IP dedicada, o alcánzala por un túnel SSH. Nunca expongas un endpoint de modelo sin autenticación a la internet abierta.

¿Qué plan necesito?

Nuestro Medium (12 $/mes, 6 GB) va cómodo para modelos pequeños y embeddings; Small (8 $) sirve para probar modelos 1–3B. Son instancias solo de CPU — sin GPU — así que dimensiona por la huella de RAM del modelo, no por esperar velocidad.

¿Piden documento de identidad o tarjeta?

No. Un correo para registrarte, pago en USDC o USDT — sin documentos, sin tarjeta.

Comentarios

Aún no hay comentarios. Sé el primero.

Deja un comentario

Los comentarios se moderan antes de aparecer.