Calor de verano — todo se derrite, hasta nuestros precios.−25%−25 % en cada plan anual, hasta el 31 de agostoVer planes
EQVPS
Empezar

VPS para Ollama y LLM locales

Autoaloja modelos de lenguaje pequeños en un servidor de CPU — privado, sin medir, pagado en cripto. Honesto sobre lo que la inferencia en CPU puede y no puede hacer. Desde 12 $/mes.

Quitemos de en medio la parte decepcionante, porque internet está lleno de páginas que no lo hacen.

Nuestros servidores son solo de CPU. No ofrecemos GPU. Eso significa que el trabajo con LLM local aquí tiene un techo duro, y fingir lo contrario solo malgastaría tu dinero.

Qué funciona de verdad en CPU

Con hasta 6 vCPU y 6 GB de RAM (nuestro plan Medium — 12 $/mes), estás en el rango de modelos pequeños cuantizados:

Si necesitas un chat de 70B rápido e interactivo, necesitas un host con GPU — ese es un producto distinto de un proveedor distinto, y preferimos decírtelo que quedarnos con tus 12 $.

Dónde gana de verdad una máquina de CPU

Privacidad. Tus documentos, tus prompts, tus embeddings — sin salir nunca de una máquina que controlas, sin convertirse nunca en los datos de entrenamiento de alguien. Para mucha gente ese es todo el sentido, y unos pocos tokens por segundo es un intercambio aceptable.

Previsibilidad del coste. Sin factura por token. Un pipeline que clasifica cincuenta mil registros cuesta lo mismo que uno que clasifica cincuenta: 12 $.

Trabajo asíncrono. El trabajo con LLM más útil no es una ventana de chat. Es una cola: resume estos, etiqueta aquellos, incrusta este corpus. Una máquina de CPU triturando un backlog durante la noche es perfectamente buena en eso.

Configuración

# Ubuntu 24.04 — plan Medium recomendado
curl -fsSL https://ollama.com/install.sh | sh

# Empieza con algo pequeño y compruébalo tú mismo
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — el punto ideal para la CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama sirve una API HTTP en localhost:11434. Mantenla ahí. Si necesitas alcanzarla desde otro sitio, ponla detrás de un proxy inverso con autenticación en un plan con IP dedicada — nunca expongas un endpoint de modelo sin autenticar al internet abierto.

Combínala con una base de datos vectorial (Qdrant o pgvector en Docker) y tienes un stack RAG privado completo en una máquina de 12 $. Esa combinación — embeddings locales pequeños, almacén vectorial local, API externa solo para el paso pesado de generación — es la configuración que de verdad tiene sentido en hardware como este.

Elegir un plan

UsoPlanPrecio
Embeddings, modelos de 1–3B, pipeline RAGMedium12 $/mes
Lo mismo, más un endpoint público detrás de autenticaciónMedium-IP20 $/mes
Solo probar modelos pequeñosSmall8 $/mes

Solo CPU, hasta 6 vCPU y 6 GB de RAM. Almacenamiento NVMe, tráfico sin medir, Alemania o Finlandia. Pago en cripto, sin KYC. La facturación anual es una transferencia en lugar de doce.

Lecturas relacionadas


¿Listo? Despliega un servidor → — en línea en aproximadamente un minuto, pagado en cripto, sin necesidad de documento de identidad.

¿Listo para desplegar? Paga en cripto, sin KYC — en línea en aproximadamente un minuto.

Desplegar →

Preguntas frecuentes

¿Puedo ejecutar Llama 70B en esto?

No. Nuestros planes son solo de CPU con hasta 6 GB de RAM — ese es el rango de modelos pequeños cuantizados (aproximadamente 1B–8B a 4 bits). Un modelo de 70B necesita una GPU y mucha más memoria. No ofrecemos GPU, y preferimos decirlo que venderte una decepción.

¿Cómo de rápida es la inferencia en CPU, de verdad?

Espera unos pocos tokens por segundo en un modelo de 7–8B a cuantización de 4 bits, y notablemente mejor en modelos de 1–3B. Está bien para trabajos en segundo plano, embeddings, clasificación y pipelines asíncronas. No está bien para un chat interactivo ágil.

Entonces, ¿para qué sirve esto de verdad?

Embeddings privados, clasificación, colas de resumen, pipelines RAG donde la latencia no importa, y mantener los datos fuera de APIs de terceros. También: aprender, probar y prototipar antes de alquilar una GPU en algún sitio.

¿Piden documento de identidad?

No. Un correo para registrarte, USDC o USDT para pagar. Que a menudo es la razón por la que la gente quiere un modelo privado en primer lugar.

Comentarios

Aún no hay comentarios. Sé el primero.

Deja un comentario

Los comentarios se moderan antes de aparecer.