Имаме отделна страница за Ollama и малки модели — това е машината за $12 CPU, пускаща 1B–8B и embeddings. Тази страница е другият край: моделите, достатъчно големи, че RAM-ът, не CPU-то, е това, което те спира.
Нека сме честни отпред, същото като навсякъде: сървърите ни са само-CPU, без GPU. Голям модел тук работи бавно. Ако искаш бърз интерактивен чат на 30B модел, се нуждаеш от GPU хост — различен продукт, различен доставчик. Това, което high-memory CPU машина прави добре, е да пуска голям quantized модел частно за работа, която не е чат прозорец.
RAM математиката
Моделът седи в паметта, quantized или не, плюс overhead за контекст и runtime-а:
- 13B, 4-bit — грубо 10–16 GB. Работи на среден план вече.
- 30B-клас, quantized — 24–48 GB в зависимост от quantization. Това е територия на Pro-32 до Pro-64.
- По-голям или по-висока прецизност — 64–80 GB, и отвъд 80 GB никоя единствена наша машина не се събира. Pro-80 е таванът тук.
Затова „пусни по-голям локален модел“ е реално high-memory въпрос. Моделът е отпечатъкът в паметта. Добави RAG индекс на същия хост и числата се трупат.
Къде private-first генуинно печели
Аргументът не е скорост и не е цена — а че някои данни не могат да напуснат. Правни документи. Медицински записи. Собственически код. Всичко, където изпращането на промпта към API на трета страна е немислимо. По-бавен модел, който работи изцяло на машината ти, бие бърз, който логва всичко, което му изпращаш. Написахме пълната картина тук.
И ако данните са толкова чувствителни, плащането вероятно също трябва да е частно. Наемането на машината с crypto и без KYC държи цялата верига — сървър, модел, промптове, фактуриране — извън чиито и да е записи за самоличност. Това е предложението: не по-евтин inference, а inference, който никой друг не може да види.
Какво да избереш
За модел от 30B клас с място за контекст, Pro-64 (64 GB) е комфортният избор; по-стегната quantization се събира в Pro-32 или Pro-48, по-голяма отива на Pro-80. Зареди модела първо, гледай resident паметта, оразмери от това, което си измерил. И задай очаквания: това е частен batch inference, не бърз чат прозорец.
Коментари
Още няма коментари. Бъди първият.