Togliamoci di torno la parte deludente, perché internet è pieno di pagine che non lo fanno.
I nostri server sono solo CPU. Non offriamo GPU. Questo significa che il lavoro con LLM locali qui ha un tetto rigido, e fingere il contrario sprecherebbe solo i tuoi soldi.
Cosa funziona davvero su CPU
Con fino a 6 vCPU e 6 GB di RAM (il nostro piano Medium — $12/mese), sei nel range dei modelli piccoli quantizzati:
- Modelli 1B–3B (Q4): genuinamente usabili. Abbastanza veloci per classificazione, tagging, routing e semplice estrazione strutturata.
- Modelli 7B–8B (Q4): girano, ma aspettati pochi token al secondo. Vanno bene per una coda che macina documenti durante la notte. Dolorosi come finestra di chat.
- Modelli di embedding: abbinamento eccellente. Sono piccoli, veloci su CPU, e questo è probabilmente il singolo miglior motivo per far girare Ollama su una macchina come la nostra.
- 13B in su: no. Farai swap e aspetterai.
Se ti serve una chat 70B veloce e interattiva, ti serve un host GPU — è un prodotto diverso da un provider diverso, e preferiamo dirtelo che prendere i tuoi $12.
Dove una macchina CPU vince davvero
Privacy. I tuoi documenti, i tuoi prompt, i tuoi embedding — che non lasciano mai una macchina che controlli, che non diventano mai i dati di addestramento di qualcuno. Per molte persone è quello tutto il senso, e pochi token al secondo sono uno scambio accettabile.
Prevedibilità del costo. Nessun conto per token. Una pipeline che classifica cinquantamila record costa lo stesso di una che ne classifica cinquanta: $12.
Lavoro asincrono. Il lavoro LLM più utile non è una finestra di chat. È una coda: riassumi questi, tagga quelli, incorpora questo corpus. Una macchina CPU che macina un arretrato durante la notte è perfettamente buona a quello.
Setup
# Ubuntu 24.04 — piano Medium consigliato
curl -fsSL https://ollama.com/install.sh | sh
# Inizia con qualcosa di piccolo e vedi di persona
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embedding — il punto ideale per la CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama serve un'API HTTP su localhost:11434. Tienila lì. Se hai bisogno di raggiungerla da altrove, mettila dietro un reverse proxy con autenticazione su un piano con IP dedicato — non esporre mai un endpoint di modello non autenticato su internet aperto.
Abbinalo a un database vettoriale (Qdrant o pgvector in Docker) e hai uno stack RAG privato completo su una macchina da $12. Quella combinazione — piccoli embedding locali, vector store locale, API esterna solo per il passo di generazione pesante — è il setup che ha davvero senso su hardware come questo.
Scegliere un piano
| Uso | Piano | Prezzo |
|---|---|---|
| Embedding, modelli 1–3B, pipeline RAG | Medium | $12/mese |
| Lo stesso, più un endpoint pubblico dietro auth | Medium-IP | $20/mese |
| Solo testare modelli piccoli | Small | $8/mese |
Solo CPU, fino a 6 vCPU e 6 GB RAM. Storage NVMe, traffico non contato, Germania o Finlandia. Pagamento in crypto, niente KYC. La fatturazione annuale è un trasferimento invece di dodici.
Letture correlate
- Ospita un DB vettoriale per la memoria AI — l'altra metà di uno stack RAG privato
- VPS per agenti AI — orchestrazione sulla stessa macchina
Pronto? Fai il deploy di un server → — in funzione in circa un minuto, pagato in crypto, nessun documento richiesto.
Commenti
Ancora nessun commento. Sii il primo.