EQVPS
Inizia

VPS per inferenza LLM privata ad alta memoria

I modelli quantizzati più grandi hanno bisogno di RAM vera, non di una GPU che non hai. Dove una macchina CPU ad alta memoria fa girare modelli classe 30B in privato, cosa è realistico, e dove non lo è. Da $70/mese.

Abbiamo una pagina separata per Ollama e i modelli piccoli — è la macchina CPU da $12 che fa girare 1B–8B ed embedding. Questa pagina è l'altro estremo: i modelli abbastanza grandi che la RAM, non la CPU, è ciò che ti ferma.

Siamo onesti in anticipo, come ovunque: i nostri server sono solo CPU, niente GPU. Un modello grande qui gira lentamente. Se vuoi chat veloce e interattiva su un modello 30B, ti serve un host GPU — prodotto diverso, provider diverso. Ciò che una macchina CPU ad alta memoria fa bene è far girare un grande modello quantizzato in privato per lavoro che non è una finestra di chat.

La matematica della RAM

Il modello sta in memoria, quantizzato o no, più l'overhead per il contesto e il runtime:

È per questo che "far girare un modello locale più grande" è davvero una questione di alta memoria. Il modello è l'impronta di memoria. Aggiungi un indice RAG sulla stessa macchina e i numeri si accumulano.

Dove il privacy-first vince davvero

L'argomento non è la velocità e non è il costo — è che alcuni dati non possono uscire. Documenti legali. Cartelle mediche. Codice proprietario. Qualsiasi cosa dove mandare il prompt a un'API di terze parti è fuori discussione. Un modello più lento che gira interamente sulla tua macchina batte uno veloce che registra tutto ciò che gli mandi. Abbiamo scritto il quadro completo qui.

E se il dato è così sensibile, probabilmente anche il pagamento dovrebbe essere privato. Affittare la macchina con crypto e niente KYC tiene l'intera catena — server, modello, prompt, fatturazione — fuori dai registri d'identità di chiunque. È questo l'argomento: non inferenza più economica, ma inferenza che nessun altro può vedere.

Cosa scegliere

Per un modello classe 30B con spazio per il contesto, Pro-64 (64 GB) è la scelta comoda; una quantizzazione più stretta sta in Pro-32 o Pro-48, una più grande va a Pro-80. Carica prima il modello, guarda la memoria residente, dimensiona da ciò che hai misurato. E imposta le aspettative: questa è inferenza privata in batch, non una finestra di chat veloce.

Pronto a fare il deploy? Paga in crypto, niente KYC — online in circa un minuto.

Fai il deploy ora →

FAQ

In cosa è diverso dal vostro caso d'uso Ollama?

La pagina Ollama parla di modelli piccoli su una macchina CPU da $12 — 1B–8B, embedding, lavoro leggero. Questo è l'estremo ad alta memoria: modelli quantizzati da 13B a classe 30B che hanno bisogno di 24–48 GB o più anche solo per caricarsi. Stessa realtà solo-CPU, impronta di memoria molto più grande, piano diverso.

Quanta RAM per un dato modello?

Il modello deve stare in memoria più l'overhead. Un modello 13B a 4-bit vuole ~10–16 GB; classe 30B quantizzato spinge a 24–48 GB; vai più grande o a precisione più alta e sei sui 64–80 GB — oltre, nessuna singola macchina nostra ci sta. Aggiungi spazio per il contesto sopra.

Sarà veloce?

No — sii onesto con te stesso qui. L'inferenza CPU su un modello grande è di pochi token al secondo, non uno stream interattivo. Va bene per lavoro in batch e in background (riassumi durante la notte, classifica una coda). Per chat in tempo reale su un modello grande ti serve una GPU, che non offriamo.

Perché farlo girare qui invece di un'API?

Privacy. I tuoi prompt e output non toccano mai i server o i log di un provider. Per dati sensibili — legali, medici, codice interno — un modello privato più lento batte uno veloce che vede tutto. Abbinalo al pagamento crypto no-KYC e l'intera catena resta tua.

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.