EQVPS

VPS til privat høj-hukommelses-LLM-inferens

Større kvantiserede modeller har brug for rigtig RAM, ikke en GPU du ikke har. Hvor en høj-hukommelses-CPU-boks kører 30B-klasse-modeller privat, hvad der er realistisk, og hvor det ikke er. Fra $70/md.

Vi har en separat side til Ollama og små modeller — det er $12-CPU-boksen, der kører 1B–8B og embeddings. Denne side er den anden ende: modellerne store nok til, at RAM, ikke CPU'en, er det, der stopper dig.

Lad os være ærlige fra starten, samme som overalt: vores servere er kun-CPU, ingen GPU. En stor model her kører langsomt. Hvis du vil have hurtig interaktiv chat på en 30B-model, har du brug for en GPU-vært — andet produkt, anden udbyder. Hvad en høj-hukommelses-CPU-boks gør godt, er at køre en stor kvantiseret model privat til arbejde, der ikke er et chatvindue.

RAM-regnestykket

Modellen sidder i hukommelsen, kvantiseret eller ej, plus overhead til kontekst og runtime:

Derfor er "kør en større lokal model" i virkeligheden et høj-hukommelses-spørgsmål. Modellen er hukommelsesfodaftrykket. Tilføj et RAG-indeks på samme vært, og tallene stabler sig.

Hvor privat-først for alvor vinder

Argumentet er ikke hastighed, og det er ikke omkostning — det er, at nogle data ikke kan forlade stedet. Juridiske dokumenter. Journaler. Proprietær kode. Alt, hvor det at sende prompten til et tredjeparts-API er udelukket. En langsommere model, der kører helt på din maskine, slår en hurtig, der logger alt, du sender den. Vi skrev det fulde billede her.

Og hvis dataene er så følsomme, bør betalingen sandsynligvis også være privat. At leje boksen med krypto og ingen KYC holder hele kæden — server, model, prompts, fakturering — væk fra nogens identitetsposter. Det er argumentet: ikke billigere inferens, men inferens, ingen andre kan se.

Hvad du skal vælge

Til en 30B-klasse-model med plads til kontekst er Pro-64 (64 GB) det komfortable valg; en strammere kvantisering passer til Pro-32 eller Pro-48, en større går til Pro-80. Load modellen først, hold øje med resident hukommelse, dimensionér ud fra det, du målte. Og sæt forventninger: dette er privat batch-inferens, ikke et hurtigt chatvindue.

Klar til at deploye? Betal med krypto, ingen KYC — live på cirka et minut.

Deploy nu →

FAQ

Hvordan adskiller dette sig fra jeres Ollama-brugsscenarie?

Ollama-siden handler om små modeller på en $12-CPU-boks — 1B–8B, embeddings, let arbejde. Dette er høj-hukommelses-enden: 13B til 30B-klasse kvantiserede modeller, der har brug for 24–48 GB eller mere for overhovedet at loade. Samme CPU-kun-virkelighed, meget større hukommelsesfodaftryk, anden plan.

Hvor meget RAM til en given model?

Modellen skal passe i hukommelsen plus overhead. En 13B 4-bit-model vil have ~10–16 GB; 30B-klasse kvantiseret presser 24–48 GB; gå større eller højere-præcision, og du er i 64–80 GB — derudover passer ingen enkelt boks af vores. Læg plads til kontekst oveni.

Vil den være hurtig?

Nej — vær ærlig over for dig selv her. CPU-inferens på en stor model er et par tokens i sekundet, ikke en interaktiv stream. Det er fint til batch- og baggrundsarbejde (opsummér natten over, klassificér en kø). Til realtidschat på en stor model har du brug for en GPU, som vi ikke tilbyder.

Hvorfor køre den her i stedet for et API?

Privatliv. Dine prompts og outputs rører aldrig en udbyders servere eller logs. Til følsomme data — juridiske, medicinske, intern kode — slår en langsommere privat model en hurtig, der ser alt. Kombinér den med no-KYC-kryptobetaling, og hele kæden forbliver din.

Kommentarer

Ingen kommentarer endnu. Vær den første.

Skriv en kommentar

Kommentarer modereres, før de vises.