EQVPS
Inizia

VPS per Ollama e LLM locali

Fai self-hosting di modelli linguistici piccoli su un server CPU — privato, non contato, pagato in crypto. Onesti su cosa l'inferenza CPU può e non può fare. Da $12/mese.

Togliamoci di torno la parte deludente, perché internet è pieno di pagine che non lo fanno.

I nostri server sono solo CPU. Non offriamo GPU. Questo significa che il lavoro con LLM locali qui ha un tetto rigido, e fingere il contrario sprecherebbe solo i tuoi soldi.

Cosa funziona davvero su CPU

Con fino a 6 vCPU e 6 GB di RAM (il nostro piano Medium — $12/mese), sei nel range dei modelli piccoli quantizzati:

Se ti serve una chat 70B veloce e interattiva, ti serve un host GPU — è un prodotto diverso da un provider diverso, e preferiamo dirtelo che prendere i tuoi $12.

Dove una macchina CPU vince davvero

Privacy. I tuoi documenti, i tuoi prompt, i tuoi embedding — che non lasciano mai una macchina che controlli, che non diventano mai i dati di addestramento di qualcuno. Per molte persone è quello tutto il senso, e pochi token al secondo sono uno scambio accettabile.

Prevedibilità del costo. Nessun conto per token. Una pipeline che classifica cinquantamila record costa lo stesso di una che ne classifica cinquanta: $12.

Lavoro asincrono. Il lavoro LLM più utile non è una finestra di chat. È una coda: riassumi questi, tagga quelli, incorpora questo corpus. Una macchina CPU che macina un arretrato durante la notte è perfettamente buona a quello.

Setup

# Ubuntu 24.04 — piano Medium consigliato
curl -fsSL https://ollama.com/install.sh | sh

# Inizia con qualcosa di piccolo e vedi di persona
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embedding — il punto ideale per la CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama serve un'API HTTP su localhost:11434. Tienila lì. Se hai bisogno di raggiungerla da altrove, mettila dietro un reverse proxy con autenticazione su un piano con IP dedicato — non esporre mai un endpoint di modello non autenticato su internet aperto.

Abbinalo a un database vettoriale (Qdrant o pgvector in Docker) e hai uno stack RAG privato completo su una macchina da $12. Quella combinazione — piccoli embedding locali, vector store locale, API esterna solo per il passo di generazione pesante — è il setup che ha davvero senso su hardware come questo.

Scegliere un piano

UsoPianoPrezzo
Embedding, modelli 1–3B, pipeline RAGMedium$12/mese
Lo stesso, più un endpoint pubblico dietro authMedium-IP$20/mese
Solo testare modelli piccoliSmall$8/mese

Solo CPU, fino a 6 vCPU e 6 GB RAM. Storage NVMe, traffico non contato, Germania o Finlandia. Pagamento in crypto, niente KYC. La fatturazione annuale è un trasferimento invece di dodici.

Letture correlate


Pronto? Fai il deploy di un server → — in funzione in circa un minuto, pagato in crypto, nessun documento richiesto.

Pronto a fare il deploy? Paga in crypto, niente KYC — online in circa un minuto.

Fai il deploy ora →

FAQ

Posso far girare Llama 70B su questo?

No. I nostri piani sono solo CPU con fino a 6 GB di RAM — è il range dei modelli piccoli quantizzati (grosso modo 1B–8B a 4-bit). Un modello 70B ha bisogno di una GPU e molta più memoria. Non offriamo GPU, e preferiamo dirlo che venderti una delusione.

Quanto è veloce l'inferenza CPU, davvero?

Aspettati pochi token al secondo su un modello 7–8B a quantizzazione 4-bit, e notevolmente meglio su modelli 1–3B. Va bene per job in background, embedding, classificazione e pipeline asincrone. Non va bene per una chat interattiva scattante.

Quindi per cosa è davvero buono?

Embedding privati, classificazione, code di riassunto, pipeline RAG dove la latenza non conta, e tenere i dati fuori dalle API di terze parti. Anche: imparare, testare e prototipare prima di affittare una GPU da qualche parte.

Chiedete un documento?

No. Email per registrarti, USDC o USDT per pagare. Che è spesso il motivo per cui la gente vuole un modello privato in primo luogo.

Commenti

Ancora nessun commento. Sii il primo.

Lascia un commento

I commenti sono moderati prima di comparire.