Abbiamo una pagina separata per Ollama e i modelli piccoli — è la macchina CPU da $12 che fa girare 1B–8B ed embedding. Questa pagina è l'altro estremo: i modelli abbastanza grandi che la RAM, non la CPU, è ciò che ti ferma.
Siamo onesti in anticipo, come ovunque: i nostri server sono solo CPU, niente GPU. Un modello grande qui gira lentamente. Se vuoi chat veloce e interattiva su un modello 30B, ti serve un host GPU — prodotto diverso, provider diverso. Ciò che una macchina CPU ad alta memoria fa bene è far girare un grande modello quantizzato in privato per lavoro che non è una finestra di chat.
La matematica della RAM
Il modello sta in memoria, quantizzato o no, più l'overhead per il contesto e il runtime:
- 13B, 4-bit — grosso modo 10–16 GB. Gira già su un piano medio.
- Classe 30B, quantizzato — 24–48 GB a seconda della quantizzazione. È territorio Pro-32 a Pro-64.
- Più grande o precisione più alta — 64–80 GB, e oltre gli 80 GB nessuna singola macchina nostra ci sta. Pro-80 è il tetto qui.
È per questo che "far girare un modello locale più grande" è davvero una questione di alta memoria. Il modello è l'impronta di memoria. Aggiungi un indice RAG sulla stessa macchina e i numeri si accumulano.
Dove il privacy-first vince davvero
L'argomento non è la velocità e non è il costo — è che alcuni dati non possono uscire. Documenti legali. Cartelle mediche. Codice proprietario. Qualsiasi cosa dove mandare il prompt a un'API di terze parti è fuori discussione. Un modello più lento che gira interamente sulla tua macchina batte uno veloce che registra tutto ciò che gli mandi. Abbiamo scritto il quadro completo qui.
E se il dato è così sensibile, probabilmente anche il pagamento dovrebbe essere privato. Affittare la macchina con crypto e niente KYC tiene l'intera catena — server, modello, prompt, fatturazione — fuori dai registri d'identità di chiunque. È questo l'argomento: non inferenza più economica, ma inferenza che nessun altro può vedere.
Cosa scegliere
Per un modello classe 30B con spazio per il contesto, Pro-64 (64 GB) è la scelta comoda; una quantizzazione più stretta sta in Pro-32 o Pro-48, una più grande va a Pro-80. Carica prima il modello, guarda la memoria residente, dimensiona da ciò che hai misurato. E imposta le aspettative: questa è inferenza privata in batch, non una finestra di chat veloce.
Commenti
Ancora nessun commento. Sii il primo.