EQVPS
Inizia

Ospitare l'inferenza LLM locale in privato: cosa può e cosa non può fare un VPS CPU

9 ago 2026 · 3 min di lettura · EQVPS Team

Siamo onesti da subito: se vuoi generazione veloce, economica e di alta qualità, chiama un'API. Un VPS CPU non batterà un datacenter pieno di GPU, e chiunque ti dica il contrario ti sta vendendo qualcosa.

Allora perché fare self-hosting dell'inferenza? Un motivo, ed è buono: il modello sul tuo server non manda mai i tuoi prompt da nessuna parte.

Che aspetto ha davvero l'inferenza su CPU

Puoi far girare modelli reali su CPU con abbastanza RAM. Un modello 7–8B quantizzato a 4-bit funziona. Un 13B funziona. Puoi persino spingere un modello classe 30B se hai la memoria. Ciò che non puoi fare è renderlo veloce — l'output arriva a pochi token al secondo, non lo stream istantaneo che dà un'API.

È lo scambio onesto. Per la chat interattiva è frustrante. Per il lavoro in background — riassumere documenti durante la notte, classificare una coda, arricchire dati su pianificazione — pochi token al secondo vanno benissimo, e nessuno sta guardando l'orologio.

La matematica della RAM

Il modello deve stare in memoria, quantizzato o no, più l'overhead per il contesto e il runtime:

È per questo che "far girare un modello locale" diventa silenziosamente una questione di alta memoria. Il modello è l'impronta di memoria. Aggiungi un indice RAG o agenti sulla stessa macchina e i numeri si accumulano.

Ollama vs vLLM, in breve

Ollama è la porta d'ingresso facile — installa, ollama run, fatto. È lo strumento giusto per un setup privato mono-utente dove vuoi solo il modello disponibile. vLLM è costruito per il throughput di servizio: più setup, migliore sotto carico concorrente, ne vale la pena quando gestisci davvero volume. Inizia con Ollama; ricorri a vLLM quando servi traffico reale.

Dove il privacy-first vince davvero

L'argomento per l'inferenza self-hosted non è velocità o costo — è che alcuni dati non possono uscire. Documenti legali. Cartelle mediche. Codice proprietario. Qualsiasi cosa dove mandare il prompt a un'API di terze parti è fuori discussione per motivi di policy o fiducia. Un modello più lento che gira interamente sulla tua macchina batte uno veloce che registra tutto ciò che gli mandi.

E se i dati sono così sensibili, probabilmente anche il pagamento dovrebbe essere privato. Affittare la macchina con crypto e niente KYC tiene l'intera catena — server, modello, prompt, fatturazione — fuori dai registri d'identità di chiunque. È questo il vero argomento: non "inferenza più economica", ma "inferenza che nessun altro può vedere".

In conclusione

Per velocità e qualità, usa un'API — nessuna vergogna. Fai self-hosting quando la privacy è il requisito e più lento è accettabile. Dimensiona per il modello più il suo contesto più qualsiasi altra cosa condivida la macchina, e non aspettarti velocità da GPU da una CPU.

Quando il modello ha bisogno di memoria vera, la linea Pro gira da 32 a 80 GB con un IP dedicato e backup notturni — abbastanza per tenere un serio modello quantizzato con spazio per il contesto attorno.

FAQ

Posso far girare un LLM senza una GPU?

Modelli piccoli quantizzati, sì — e lentamente. Un modello 7–8B quantizzato a 4-bit gira su CPU con abbastanza RAM, ma misurerai l'output in pochi token al secondo, non lo stream scattante che ottieni da un'API. Va bene per job in batch e task in background, doloroso per la chat interattiva.

Quanta RAM per l'inferenza locale?

Il modello deve stare in memoria più l'overhead. Un modello 7–8B a 4-bit vuole ~6–8 GB; 13B circa 10–16 GB; i modelli classe 30B spingono a 24–48 GB quantizzati. Aggiungi spazio per il contesto e qualsiasi altra cosa sulla macchina. È per questo che l'inferenza locale finisce in fretta in territorio ad alta memoria.

Ollama o vLLM?

Ollama è la rampa d'ingresso facile — un comando, modello scaricato, in funzione. vLLM è per throughput e servizio, più setup, migliore sotto carico. Per una macchina privata mono-utente, Ollama è di solito la scelta giusta; vLLM quando servi davvero richieste a volume.

Perché fare self-hosting dell'inferenza se è più lenta?

Privacy. I tuoi prompt e output non toccano mai i server o i log di un provider. Per dati sensibili — legali, medici, codice interno, qualsiasi cosa tu non possa mandare a una terza parte — un modello privato più lento batte uno veloce che vede tutto. Abbinalo al pagamento crypto no-KYC e l'intera catena resta tua.

← Torna al blogVedi piani e prezzi →

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.