Siamo onesti da subito: se vuoi generazione veloce, economica e di alta qualità, chiama un'API. Un VPS CPU non batterà un datacenter pieno di GPU, e chiunque ti dica il contrario ti sta vendendo qualcosa.
Allora perché fare self-hosting dell'inferenza? Un motivo, ed è buono: il modello sul tuo server non manda mai i tuoi prompt da nessuna parte.
Che aspetto ha davvero l'inferenza su CPU
Puoi far girare modelli reali su CPU con abbastanza RAM. Un modello 7–8B quantizzato a 4-bit funziona. Un 13B funziona. Puoi persino spingere un modello classe 30B se hai la memoria. Ciò che non puoi fare è renderlo veloce — l'output arriva a pochi token al secondo, non lo stream istantaneo che dà un'API.
È lo scambio onesto. Per la chat interattiva è frustrante. Per il lavoro in background — riassumere documenti durante la notte, classificare una coda, arricchire dati su pianificazione — pochi token al secondo vanno benissimo, e nessuno sta guardando l'orologio.
La matematica della RAM
Il modello deve stare in memoria, quantizzato o no, più l'overhead per il contesto e il runtime:
- 7–8B, 4-bit — circa 6–8 GB. Gira su un piano medio.
- 13B, 4-bit — grosso modo 10–16 GB.
- Classe 30B, quantizzato — 24–48 GB, a seconda della quantizzazione.
- Più grande, o precisione più alta — sei in fretta sui 64–80 GB — e oltre gli 80 GB nessuna singola macchina Pro ci sta, e resta comunque lenta su CPU.
È per questo che "far girare un modello locale" diventa silenziosamente una questione di alta memoria. Il modello è l'impronta di memoria. Aggiungi un indice RAG o agenti sulla stessa macchina e i numeri si accumulano.
Ollama vs vLLM, in breve
Ollama è la porta d'ingresso facile — installa, ollama run, fatto. È lo strumento giusto per un setup privato mono-utente dove vuoi solo il modello disponibile. vLLM è costruito per il throughput di servizio: più setup, migliore sotto carico concorrente, ne vale la pena quando gestisci davvero volume. Inizia con Ollama; ricorri a vLLM quando servi traffico reale.
Dove il privacy-first vince davvero
L'argomento per l'inferenza self-hosted non è velocità o costo — è che alcuni dati non possono uscire. Documenti legali. Cartelle mediche. Codice proprietario. Qualsiasi cosa dove mandare il prompt a un'API di terze parti è fuori discussione per motivi di policy o fiducia. Un modello più lento che gira interamente sulla tua macchina batte uno veloce che registra tutto ciò che gli mandi.
E se i dati sono così sensibili, probabilmente anche il pagamento dovrebbe essere privato. Affittare la macchina con crypto e niente KYC tiene l'intera catena — server, modello, prompt, fatturazione — fuori dai registri d'identità di chiunque. È questo il vero argomento: non "inferenza più economica", ma "inferenza che nessun altro può vedere".
In conclusione
Per velocità e qualità, usa un'API — nessuna vergogna. Fai self-hosting quando la privacy è il requisito e più lento è accettabile. Dimensiona per il modello più il suo contesto più qualsiasi altra cosa condivida la macchina, e non aspettarti velocità da GPU da una CPU.
Quando il modello ha bisogno di memoria vera, la linea Pro gira da 32 a 80 GB con un IP dedicato e backup notturni — abbastanza per tenere un serio modello quantizzato con spazio per il contesto attorno.
Commenti
Ancora nessun commento. Sii il primo.