Vi har en separat side til Ollama og små modeller — det er $12-CPU-boksen, der kører 1B–8B og embeddings. Denne side er den anden ende: modellerne store nok til, at RAM, ikke CPU'en, er det, der stopper dig.
Lad os være ærlige fra starten, samme som overalt: vores servere er kun-CPU, ingen GPU. En stor model her kører langsomt. Hvis du vil have hurtig interaktiv chat på en 30B-model, har du brug for en GPU-vært — andet produkt, anden udbyder. Hvad en høj-hukommelses-CPU-boks gør godt, er at køre en stor kvantiseret model privat til arbejde, der ikke er et chatvindue.
RAM-regnestykket
Modellen sidder i hukommelsen, kvantiseret eller ej, plus overhead til kontekst og runtime:
- 13B, 4-bit — cirka 10–16 GB. Kører på en mellemplan allerede.
- 30B-klasse, kvantiseret — 24–48 GB afhængigt af kvantisering. Dette er Pro-32 til Pro-64-territorium.
- Større eller højere præcision — 64–80 GB, og efter 80 GB passer ingen enkelt boks af vores. Pro-80 er loftet her.
Derfor er "kør en større lokal model" i virkeligheden et høj-hukommelses-spørgsmål. Modellen er hukommelsesfodaftrykket. Tilføj et RAG-indeks på samme vært, og tallene stabler sig.
Hvor privat-først for alvor vinder
Argumentet er ikke hastighed, og det er ikke omkostning — det er, at nogle data ikke kan forlade stedet. Juridiske dokumenter. Journaler. Proprietær kode. Alt, hvor det at sende prompten til et tredjeparts-API er udelukket. En langsommere model, der kører helt på din maskine, slår en hurtig, der logger alt, du sender den. Vi skrev det fulde billede her.
Og hvis dataene er så følsomme, bør betalingen sandsynligvis også være privat. At leje boksen med krypto og ingen KYC holder hele kæden — server, model, prompts, fakturering — væk fra nogens identitetsposter. Det er argumentet: ikke billigere inferens, men inferens, ingen andre kan se.
Hvad du skal vælge
Til en 30B-klasse-model med plads til kontekst er Pro-64 (64 GB) det komfortable valg; en strammere kvantisering passer til Pro-32 eller Pro-48, en større går til Pro-80. Load modellen først, hold øje med resident hukommelse, dimensionér ud fra det, du målte. Og sæt forventninger: dette er privat batch-inferens, ikke et hurtigt chatvindue.
Kommentarer
Ingen kommentarer endnu. Vær den første.