La risposta onesta a "quanto server serve al mio agente IA?" è: meno di quanto pensi — fino a quando all'improvviso non è così. Il trucco è sapere su quale lato di quella linea si trova il tuo carico. Quindi invece di indovinare, ecco cosa usa davvero ogni tipo di agente.
L'unica domanda che decide tutto
Il modello gira sul tuo server, o il tuo agente chiama un modello tramite un'API?
Se il tuo agente parla con un LLM ospitato (il caso comune), la parte intelligente e costosa avviene sull'hardware di qualcun altro. La tua macchina esegue solo un ciclo di orchestrazione: prendi l'input, chiama l'API, analizza il risultato, magari colpisci un database, ripeti. È leggero. Davvero leggero — una macchina da 1 GB lo fa senza battere ciglio.
Se esegui il modello localmente, tutto cambia: ora la RAM è dominata dai pesi del modello, e vorrai tutti i core che puoi avere. La maggior parte delle persone non ne ha bisogno. Chi ne ha bisogno di solito sa esattamente perché (privacy, nessun rate limit, offline). Se sei tu, abbiamo scritto una guida separata sul self-hosting di un LLM locale.
Dimensionamento per carico
Numeri reali, del tipo su cui puoi agire:
| Carico | RAM | vCPU | Disco | Note |
|---|---|---|---|---|
| Agente di chat / assistente (basato su API) | 1 GB | 2 | 15 GB | Il ciclo è minuscolo; il modello è remoto |
| Scraper / agente dati | 2 GB | 2 | 25 GB | Margine per parsing + dati scrapati |
| Bot di trading | 1–2 GB | 2 | 15–25 GB | La latenza conta più della dimensione — vedi la guida ai bot di trading |
| Diversi agenti in parallelo | 4 GB | 4 | 35 GB | Ogni agente è economico; la concorrenza si somma |
| LLM locale, 3B–7B (quantizzato) | 4–6 GB | 4–6 | 25–45 GB | Solo-CPU, gira a un ritmo leggibile, non in massa |
Lo schema: gli agenti basati su API sono minuscoli; i modelli locali sono l'unica cosa pesante.
Dove una macchina CPU si ferma
Essendo chiari sul tetto: i nostri piani arrivano al massimo a 6 GB RAM e 6 core, solo-CPU — senza GPU. Questo copre tutto nella tabella sopra, incluso un modello locale 7B per uso personale. Ciò che non copre: modelli da 13B+, inferenza locale ad alto throughput, o qualsiasi cosa che abbia davvero bisogno di una GPU. Se è il tuo carico, un VPS CPU — il nostro o di chiunque — è lo strumento sbagliato, ed è meglio saperlo ora che dopo aver fatto il deploy.
Per il 95% degli agenti che chiamano un'API, niente di tutto ciò è un problema. Sono felici sulla macchina più piccola.
Una regola pratica
- Solo un agente che chiama un'API? Parti da 1 GB / 2 core. Puoi ridimensionare dopo.
- Scraping o conservazione di dati? 2 GB e un disco più grande.
- Fai girare diversi agenti, o un piccolo modello locale? 4–6 GB e 4+ core.
- Serve una GPU? Categoria diversa — non forzarlo sulla CPU.
Non sovradimensionare per nervosismo. Gli agenti sono leggeri per natura; il costo di una macchina troppo piccola è un ridimensionamento, mentre il costo di una troppo grande è pagare per RAM inutilizzata ogni mese.
Quando hai scelto una dimensione, un agente può noleggiare la macchina da solo tramite MCP, o puoi ordinarla in un minuto sul sito. In entrambi i casi, parti in piccolo — ti servirà quasi certamente meno di quanto ti aspettassi.
Commenti
Ancora nessun commento. Sii il primo.