EQVPS

VPS за частен high-memory LLM inference

По-големите quantized модели се нуждаят от реален RAM, не от GPU, който нямаш. Къде high-memory CPU машина пуска модели от 30B клас частно, какво е реалистично, и къде не. От $70/месец.

Имаме отделна страница за Ollama и малки модели — това е машината за $12 CPU, пускаща 1B–8B и embeddings. Тази страница е другият край: моделите, достатъчно големи, че RAM-ът, не CPU-то, е това, което те спира.

Нека сме честни отпред, същото като навсякъде: сървърите ни са само-CPU, без GPU. Голям модел тук работи бавно. Ако искаш бърз интерактивен чат на 30B модел, се нуждаеш от GPU хост — различен продукт, различен доставчик. Това, което high-memory CPU машина прави добре, е да пуска голям quantized модел частно за работа, която не е чат прозорец.

RAM математиката

Моделът седи в паметта, quantized или не, плюс overhead за контекст и runtime-а:

Затова „пусни по-голям локален модел“ е реално high-memory въпрос. Моделът е отпечатъкът в паметта. Добави RAG индекс на същия хост и числата се трупат.

Къде private-first генуинно печели

Аргументът не е скорост и не е цена — а че някои данни не могат да напуснат. Правни документи. Медицински записи. Собственически код. Всичко, където изпращането на промпта към API на трета страна е немислимо. По-бавен модел, който работи изцяло на машината ти, бие бърз, който логва всичко, което му изпращаш. Написахме пълната картина тук.

И ако данните са толкова чувствителни, плащането вероятно също трябва да е частно. Наемането на машината с crypto и без KYC държи цялата верига — сървър, модел, промптове, фактуриране — извън чиито и да е записи за самоличност. Това е предложението: не по-евтин inference, а inference, който никой друг не може да види.

Какво да избереш

За модел от 30B клас с място за контекст, Pro-64 (64 GB) е комфортният избор; по-стегната quantization се събира в Pro-32 или Pro-48, по-голяма отива на Pro-80. Зареди модела първо, гледай resident паметта, оразмери от това, което си измерил. И задай очаквания: това е частен batch inference, не бърз чат прозорец.

Готов за deploy? Плати в crypto, без KYC — онлайн за около минута.

Deploy-ни сега →

Въпроси

С какво това е различно от Ollama use-case-а ви?

Страницата за Ollama е за малки модели на машина за $12 CPU — 1B–8B, embeddings, лека работа. Това е high-memory краят: 13B до quantized модели от 30B клас, които се нуждаят от 24–48 GB или повече, за да се заредят изобщо. Същата само-CPU реалност, много по-голям отпечатък в паметта, различен план.

Колко RAM за даден модел?

Моделът трябва да се събере в паметта плюс overhead. 13B 4-bit модел иска ~10–16 GB; 30B-клас quantized бута 24–48 GB; отиди по-голям или по-висока прецизност и си в 64–80 GB — отвъд това, никоя единствена наша машина не се събира. Добави място за контекст отгоре.

Ще бъде ли бърз?

Не — бъди честен със себе си тук. CPU inference на голям модел е няколко токена в секунда, не интерактивен стрийм. Наред е за batch и фонова работа (обобщи през нощта, класифицирай опашка). За real-time чат на голям модел се нуждаеш от GPU, който не предлагаме.

Защо да го пускам тук вместо API?

Поверителност. Промптовете и изходите ти никога не докосват сървърите или логовете на доставчик. За чувствителни данни — правни, медицински, вътрешен код — по-бавен частен модел бие бърз, който вижда всичко. Съчетай го с no-KYC crypto плащане и цялата верига остава твоя.

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.