Ollama convierte ejecutar un modelo local en una instalación de una línea. Esta es la guía; para la imagen honesta de lo que la inferencia en CPU puede y no puede hacer (y el punto óptimo del RAG), consulta el caso de uso VPS para Ollama y autohospedar Ollama.
1. Instala Ollama
curl -fsSL https://ollama.com/install.sh | sh
Eso instala Ollama y lo arranca como servicio systemd escuchando en localhost:11434.
2. Descarga y ejecuta un modelo pequeño
En una máquina de CPU, empieza pequeño:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Los modelos 3B son realmente usables en CPU; los 7–8B corren a unos pocos tokens/seg (bien para batch, penoso para chat); los 13B+ harán swap y se arrastrarán — no lo hagas.
3. Llama a la API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Los embeddings son el punto óptimo de la CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Mantenlo en localhost — exponlo con seguridad si hace falta
Ollama se enlaza a 127.0.0.1:11434 por defecto. Déjalo ahí. Si necesitas alcanzarlo desde otra máquina, pon delante un reverse proxy con auth en un plan de IP dedicada (guía nginx + HTTPS) o usa un túnel SSH — nunca expongas públicamente un endpoint de modelo sin autenticación.
La parte honesta
Son instancias solo de CPU (sin GPU). Los modelos cuantizados pequeños y los embeddings corren bien; los grandes no. Combina Ollama con una base de datos vectorial para una pila RAG privada — embeddings locales pequeños más un almacén vectorial local es el montaje que de verdad brilla aquí. Medium (12 $/mes, 6 GB) es el plan cómodo. Root en un minuto aproximadamente, sin KYC, pago en cripto.
Comentarios
Aún no hay comentarios. Sé el primero.