Quitemos de en medio la parte decepcionante, porque internet está lleno de páginas que no lo hacen.
Nuestros servidores son solo de CPU. No ofrecemos GPU. Eso significa que el trabajo con LLM local aquí tiene un techo duro, y fingir lo contrario solo malgastaría tu dinero.
Qué funciona de verdad en CPU
Con hasta 6 vCPU y 6 GB de RAM (nuestro plan Medium — 12 $/mes), estás en el rango de modelos pequeños cuantizados:
- Modelos de 1B–3B (Q4): genuinamente utilizables. Lo bastante rápidos para clasificación, etiquetado, enrutamiento y extracción estructurada simple.
- Modelos de 7B–8B (Q4): corren, pero espera unos pocos tokens por segundo. Bien para una cola que mastica documentos durante la noche. Doloroso como ventana de chat.
- Modelos de embeddings: encaje excelente. Son pequeños, rápidos en CPU, y esta es probablemente la mejor razón para ejecutar Ollama en una máquina como la nuestra.
- 13B y más: no. Estarás haciendo swap y esperando.
Si necesitas un chat de 70B rápido e interactivo, necesitas un host con GPU — ese es un producto distinto de un proveedor distinto, y preferimos decírtelo que quedarnos con tus 12 $.
Dónde gana de verdad una máquina de CPU
Privacidad. Tus documentos, tus prompts, tus embeddings — sin salir nunca de una máquina que controlas, sin convertirse nunca en los datos de entrenamiento de alguien. Para mucha gente ese es todo el sentido, y unos pocos tokens por segundo es un intercambio aceptable.
Previsibilidad del coste. Sin factura por token. Un pipeline que clasifica cincuenta mil registros cuesta lo mismo que uno que clasifica cincuenta: 12 $.
Trabajo asíncrono. El trabajo con LLM más útil no es una ventana de chat. Es una cola: resume estos, etiqueta aquellos, incrusta este corpus. Una máquina de CPU triturando un backlog durante la noche es perfectamente buena en eso.
Configuración
# Ubuntu 24.04 — plan Medium recomendado
curl -fsSL https://ollama.com/install.sh | sh
# Empieza con algo pequeño y compruébalo tú mismo
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — el punto ideal para la CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama sirve una API HTTP en localhost:11434. Mantenla ahí. Si necesitas alcanzarla desde otro sitio, ponla detrás de un proxy inverso con autenticación en un plan con IP dedicada — nunca expongas un endpoint de modelo sin autenticar al internet abierto.
Combínala con una base de datos vectorial (Qdrant o pgvector en Docker) y tienes un stack RAG privado completo en una máquina de 12 $. Esa combinación — embeddings locales pequeños, almacén vectorial local, API externa solo para el paso pesado de generación — es la configuración que de verdad tiene sentido en hardware como este.
Elegir un plan
| Uso | Plan | Precio |
|---|---|---|
| Embeddings, modelos de 1–3B, pipeline RAG | Medium | 12 $/mes |
| Lo mismo, más un endpoint público detrás de autenticación | Medium-IP | 20 $/mes |
| Solo probar modelos pequeños | Small | 8 $/mes |
Solo CPU, hasta 6 vCPU y 6 GB de RAM. Almacenamiento NVMe, tráfico sin medir, Alemania o Finlandia. Pago en cripto, sin KYC. La facturación anual es una transferencia en lugar de doce.
Lecturas relacionadas
- Aloja una BD vectorial para memoria de IA — la otra mitad de un stack RAG privado
- VPS para agentes de IA — orquestación en la misma máquina
¿Listo? Despliega un servidor → — en línea en aproximadamente un minuto, pagado en cripto, sin necesidad de documento de identidad.
Comentarios
Aún no hay comentarios. Sé el primero.