EQVPS
Inizia

Self-hosting di un LLM locale su un VPS con Ollama — cosa funziona davvero

14 giu 2026 · 3 min di lettura · EQVPS Team

Inviare ogni prompt all'API di qualcun altro va bene — finché non lo è. Forse i dati sono sensibili e preferiresti che non lasciassero mai il tuo server. Forse sei stanco dei rate limit, o di una versione del modello che cambia sotto i tuoi piedi, o di un contatore per token che ticchetta mentre sperimenti. A un certo punto "e se ne facessi girare uno mio?" smette di essere un esperimento mentale.

Ollama rende la cosa davvero facile. La domanda più difficile è cosa ci sta su un VPS — e qui la risposta onesta conta più dell'hype.

Cosa puoi davvero far girare su CPU

Niente GPU? Allora stai facendo inferenza su CPU, e la dimensione del modello è tutto. La quantizzazione (comprimere i pesi a 4-bit) è ciò che rende pratica la cosa — perdi una briciola di qualità e risparmi un mucchio di memoria.

Numeri approssimativi, quelli che contano:

Velocità, onestamente: su qualche vCPU vedrai una manciata di token al secondo. Perfettamente adatto a un chatbot o un assistente di coding dove leggi mentre scrive. Non adatto a elaborare in batch un milione di documenti — quello è un lavoro da GPU, e non facciamo finta del contrario. Non offriamo istanze GPU. Se il tuo piano ha bisogno di un modello 70B o di throughput pesante, un VPS CPU — il nostro o di chiunque — è lo strumento sbagliato, e dovresti saperlo prima di spendere un centesimo.

Ma un 7B privato che risponde alle tue domande e non telefona mai a casa? Quello gira comodamente su una macchina da 6 GB.

L'installazione — tre comandi

Avvia il server, fai SSH, e:

curl -fsSL https://ollama.com/install.sh | sh   # installa Ollama
ollama run llama3.2:3b                            # scarica + esegue un modello 3B

Ecco fatto — stai chattando nel terminale. Per usarlo dal tuo codice, Ollama serve già un'API HTTP sulla porta 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Una trappola da conoscere in anticipo: di default quell'API si lega a localhost. Tienila così e fai il tunnel via SSH, o è esposta a internet. Se vuoi che sia raggiungibile, mettila dietro autenticazione — non lasciare un endpoint del modello aperto su un IP pubblico.

Scegliere la macchina

Abbina il piano al modello, non il contrario:

Vuoi far girareRAM che ti servePiano sensato
Modello 3B, uso leggero~3 GBSmall (4 GB)
Modello 7B, comodamente~5-6 GBMedium (6 GB)
Più grande / alto throughputTerritorio GPUnon un VPS CPU

Per la maggior parte di chi fa self-hosting, Medium (6 GB) è la raccomandazione onesta — abbastanza margine per un modello 7B più la tua app e l'OS. Small (4 GB) funziona se ti attieni al 3B. Qualsiasi cosa sotto è troppo stretta una volta che OS e contesto mangiano dentro.

Perché farlo qui

Se stai facendo self-hosting di un LLM, la privacy è di solito metà del motivo — quindi sarebbe strano consegnare il tuo ID per noleggiare la macchina. Non devi: puoi pagare in USDC o USDT (o una carta tramite l'on-ramp), no KYC, e il server è tuo in circa un minuto. Crypto-native, agent-friendly, e i dati restano su una macchina che controlli.

Il compromesso è quello su cui siamo stati onesti: solo CPU, un tetto di 6 GB, modelli piccoli. Entro quello, il self-hosting è ottimo. Fuori, non lasciare che nessuno ti venda una macchina CPU per un lavoro che ha bisogno di una GPU.

Pronto a provarlo? Scegli un piano, paga, e avrai root in circa 60 secondi — poi sono tre comandi al tuo modello privato.

FAQ

Posso far girare un LLM senza una GPU?

Sì, per i modelli piccoli. Un modello 3B o 7B in quantizzazione a 4-bit gira su CPU e risponde a un ritmo leggibile — va bene per un chatbot, un aiutante di coding o task in background dove non stai guardando il cursore. Ciò che non puoi fare su CPU è servire un modello grande (13B in su) o spingere alto throughput; è lì che una GPU smette di essere opzionale.

Quanta RAM mi serve per Llama 7B?

Circa 5 GB per un modello 7B a 4-bit una volta che aggiungi la finestra di contesto e l'OS — quindi una macchina da 6 GB è il pavimento comodo. Un modello 3B sta in circa 3 GB. Una quantizzazione più piccola (Q4) scambia un po' di qualità per molta meno memoria, che è lo scambio giusto su un VPS.

Fare self-hosting di un LLM è più economico di un'API?

Dipende dal volume. Un'API ospitata addebita per token e non costa nulla quando è inattiva; un VPS è un conto mensile fisso che tu lo usi o no. Se esegui un flusso costante di richieste, o ti interessa soprattutto la privacy e nessun rate limit, il self-hosting vince. Per prompt occasionali una tantum, un'API a consumo è più economica.

Perché fare self-hosting invece di usare un'API cloud?

Tre motivi per cui la gente lo fa davvero: i dati non lasciano mai il tuo server (reale per uso legale, medico, o note semplicemente private), non ci sono rate limit né contatore per token, e il modello non cambierà né verrà deprecato sotto di te. Il costo è che gestisci la macchina e vivi entro il suo hardware.

Qual è il modello più grande che posso realisticamente far girare su un VPS CPU?

Un modello 7B a 4-bit è il punto ideale su una macchina da 6 GB. Puoi tecnicamente caricare un 13B con abbastanza RAM, ma su CPU diventa abbastanza lento da farti sentire. Oltre vuoi una GPU, che è un tipo di host diverso.

← Torna al blogVedi piani e prezzi →

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.