EQVPS

VPS для приватного high-memory инференса LLM

Большие квантованные модели требуют реальной RAM, а не GPU, которого у вас нет. Где high-memory CPU-машина приватно гоняет модели класса 30B, что реально, а что нет. От $70/мес.

У нас есть отдельная страница про Ollama и мелкие модели — это $12 CPU-машина с 1B–8B и эмбеддингами. Эта страница про другой край: модели, достаточно большие, чтобы вас останавливала RAM, а не CPU.

Скажу честно сразу, как везде: наши серверы только CPU, без GPU. Большая модель тут работает медленно. Если нужен быстрый интерактивный чат на 30B — нужен GPU-хост, другой продукт, другой провайдер. Что high-memory CPU-машина делает хорошо — гоняет большую квантованную модель приватно для работы, которая не чат-окно.

Арифметика RAM

Модель сидит в памяти, квантованная или нет, плюс накладные под контекст и рантайм:

Вот почему «запустить большую локальную модель» — на деле вопрос про память. Модель и есть след памяти. Добавьте RAG-индекс на ту же машину — числа складываются.

Где приватность правда выигрывает

Аргумент не в скорости и не в цене — в том, что некоторые данные не могут уйти. Юридические документы. Медкарты. Проприетарный код. Всё, где слать промпт в чужой API исключено. Медленная модель целиком на вашей машине бьёт быструю, которая логирует всё. Мы расписали полную картину здесь.

И если данные настолько чувствительны, то и оплата, наверное, должна быть приватной. Аренда машины криптой без KYC держит всю цепочку — сервер, модель, промпты, оплату — вне записей о личности. Вот питч: не дешевле инференс, а инференс, который никто другой не видит.

Что выбрать

Для модели класса 30B с местом под контекст Pro-64 (64 ГБ) — комфортный выбор; более плотный квант влезет в Pro-32 или Pro-48, крупнее уходит на Pro-80. Сначала загрузите модель, посмотрите резидентную память, берите по замеренному. И настройте ожидания: это приватный батч-инференс, не быстрое чат-окно.

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

Чем это отличается от вашего use-case про Ollama?

Страница Ollama — про мелкие модели на $12 CPU-машине: 1B–8B, эмбеддинги, лёгкая работа. Это high-memory край: модели 13B–30B в кванте, которым нужно 24–48 ГБ и больше только чтобы загрузиться. Та же CPU-реальность, гораздо больший след памяти, другой тариф.

Сколько RAM под конкретную модель?

Модель должна влезть в память плюс накладные. 13B 4-бит хочет ~10–16 ГБ; класс 30B в кванте тянет 24–48 ГБ; больше или выше точность — 64–80 ГБ, а за 80 ГБ одной нашей машины не хватит. Плюс место под контекст.

Будет быстро?

Нет — будьте честны с собой. CPU-инференс большой модели это пара токенов в секунду, не интерактивный поток. Ок для батча и фона (суммаризация ночью, классификация очереди). Для чата в реальном времени на большой модели нужен GPU, которого мы не даём.

Зачем гонять здесь, а не в API?

Приватность. Ваши промпты и ответы не касаются серверов и логов провайдера. Для чувствительных данных — юридических, медицинских, внутреннего кода — медленная приватная модель бьёт быструю, которая видит всё. В паре с no-KYC оплатой криптой вся цепочка ваша.

Комментарии

Пока нет комментариев. Будьте первым.

Оставить комментарий

Комментарии проходят модерацию перед публикацией.