EQVPS

VPS för privat high-memory LLM-inferens

Större kvantiserade modeller behöver riktigt RAM, inte en GPU du inte har. Var en high-memory CPU-box kör 30B-klass-modeller privat, vad som är realistiskt, och var det inte är det. Från $70/mån.

Vi har en separat sida för Ollama och små modeller — det är $12 CPU-boxen som kör 1B–8B och embeddings. Den här sidan är den andra änden: modellerna som är stora nog att RAM, inte CPU:n, är det som stoppar dig.

Låt oss vara ärliga i förväg, som överallt: våra servrar är CPU-only, ingen GPU. En stor modell körs långsamt här. Om du vill ha snabb interaktiv chatt på en 30B-modell behöver du en GPU-host — annan produkt, annan leverantör. Vad en high-memory CPU-box gör bra är att köra en stor kvantiserad modell privat för arbete som inte är ett chattfönster.

RAM-matematiken

Modellen sitter i minnet, kvantiserad eller inte, plus overhead för kontext och runtimen:

Det är därför "kör en större lokal modell" egentligen är en high-memory-fråga. Modellen är minnesfotavtrycket. Lägg till en RAG-index på samma host och siffrorna staplas.

Var privat-först verkligen vinner

Argumentet är inte hastighet och inte kostnad — det är att viss data inte kan lämna. Juridiska dokument. Medicinska journaler. Proprietär kod. Allt där att skicka prompten till en tredjeparts-API är uteslutet. En långsammare modell som körs helt på din maskin slår en snabb som loggar allt du skickar den. Vi skrev hela bilden här.

Och om datan är så känslig borde betalningen förmodligen också vara privat. Att hyra boxen med krypto och ingen KYC håller hela kedjan — server, modell, prompter, fakturering — borta från någons identitetsregister. Det är pitchen: inte billigare inferens, utan inferens ingen annan kan se.

Vad du ska välja

För en 30B-klass-modell med utrymme för kontext är Pro-64 (64 GB) det bekväma valet; en snävare kvantisering får plats på Pro-32 eller Pro-48, en större går till Pro-80. Ladda modellen först, titta på resident memory, dimensionera från vad du mätte. Och sätt förväntningarna: detta är privat batch-inferens, inte ett snabbt chattfönster.

Redo att distribuera? Betala med krypto, ingen KYC — igång på ungefär en minut.

Distribuera nu →

FAQ

Hur skiljer sig detta från er Ollama-användningsfall?

Ollama-sidan handlar om små modeller på en $12 CPU-box — 1B–8B, embeddings, lätt arbete. Detta är high-memory-änden: 13B till 30B-klass kvantiserade modeller som behöver 24–48 GB eller mer för att ens laddas. Samma CPU-only-verklighet, mycket större minnesfotavtryck, annat plan.

Hur mycket RAM för en given modell?

Modellen måste få plats i minnet plus overhead. En 13B 4-bit-modell vill ha ~10–16 GB; 30B-klass kvantiserad driver 24–48 GB; gå större eller högre precision och du är på 64–80 GB — bortom det får ingen enskild box av oss plats. Lägg till utrymme för kontext ovanpå.

Blir det snabbt?

Nej — var ärlig mot dig själv här. CPU-inferens på en stor modell är ett par tokens i sekunden, ingen interaktiv ström. Det är bra för batch- och bakgrundsarbete (sammanfatta över natten, klassificera en kö). För realtidschatt på en stor modell behöver du en GPU, som vi inte erbjuder.

Varför köra den här istället för en API?

Integritet. Dina prompter och utdata rör aldrig en leverantörs servrar eller loggar. För känslig data — juridik, medicin, intern kod — slår en långsammare privat modell en snabb som ser allt. Para ihop den med no-KYC kryptobetalning och hela kedjan förblir din.

Kommentarer

Inga kommentarer än. Bli först.

Lämna en kommentar

Kommentarer modereras innan de visas.