EQVPS

Приватный локальный инференс LLM: что CPU-VPS может, а что нет

Aug 9, 2026 · 2 min read · EQVPS Team

Скажу честно сразу: если нужна быстрая, дешёвая, качественная генерация — зовите API. CPU-VPS не побьёт дата-центр, забитый GPU, и кто говорит обратное — что-то продаёт.

Так зачем вообще self-host инференс? Одна причина, и она хорошая: модель на вашем сервере никуда не отправляет ваши промпты.

Как выглядит CPU-инференс на деле

На CPU с достаточным RAM можно гонять реальные модели. Модель 7–8B в 4-битном кванте работает. 13B работает. Можно даже вытянуть класс 30B, если хватает памяти. Чего нельзя — сделать это быстрым: вывод идёт в пару токенов в секунду, а не мгновенным потоком из API.

Вот честный компромисс. Для интерактивного чата это раздражает. Для фоновой работы — суммаризация документов ночью, классификация очереди, обогащение данных по расписанию — пара токенов в секунду совершенно нормальна, и никто не смотрит на часы.

Арифметика RAM

Модель должна сидеть в памяти, квантованная или нет, плюс накладные под контекст и рантайм:

Вот почему «запусти локальную модель» тихо становится вопросом про большую память. Модель и есть след в памяти. Добавьте RAG-индекс или агентов на ту же машину — числа складываются.

Ollama против vLLM, кратко

Ollama — простая дверь внутрь: установил, ollama run, готово. Правильный инструмент для приватной однопользовательской установки, где просто нужна доступная модель. vLLM сделан под пропускную раздачу: больше настройки, лучше под параллельной нагрузкой, оправдан когда реально держите объём. Начните с Ollama; беритесь за vLLM, когда раздаёте реальный трафик.

Где приватность правда выигрывает

Аргумент за self-host инференс не в скорости и не в цене — в том, что некоторые данные не могут уйти. Юридические документы. Медкарты. Проприетарный код. Всё, где слать промпт в чужой API исключено по политике или доверию. Медленная модель, которая крутится целиком на вашей машине, бьёт быструю, которая логирует всё, что вы шлёте.

А если данные настолько чувствительны, то и оплата, наверное, должна быть приватной. Аренда машины криптой без KYC держит всю цепочку — сервер, модель, промпты, оплату — вне чьих-либо записей о личности. Вот реальный питч: не «дешевле инференс», а «инференс, который никто другой не видит».

Итог

Ради скорости и качества — используйте API, стыдного нет. Self-host — когда приватность это требование и медленнее приемлемо. Считайте под модель плюс её контекст плюс всё остальное на машине и не ждите скорости GPU от CPU.

Когда модели нужна реальная память, линейка Pro даёт 32–80 ГБ с выделенным IP и ночными бэкапами — достаточно, чтобы держать серьёзную квантованную модель с местом под контекст вокруг.

FAQ

Можно запустить LLM без GPU?

Небольшие квантованные модели — да, и медленно. Модель 7–8B в 4-битном кванте идёт на CPU при достаточном RAM, но вывод будет в пару токенов в секунду, а не бодрый поток из API. Ок для батч-задач и фона, больно для интерактивного чата.

Сколько RAM под локальный инференс?

Модель должна влезть в память плюс накладные. Модель 7–8B 4-бит хочет ~6–8 ГБ; 13B около 10–16 ГБ; модели класса 30B тянут 24–48 ГБ в кванте. Плюс место под контекст и остальное на машине. Вот почему локальный инференс быстро уходит в high-memory.

Ollama или vLLM?

Ollama — простой заход: одна команда, модель подтянута, работает. vLLM — про пропускную способность и раздачу, больше настройки, лучше под нагрузкой. Для приватной однопользовательской машины обычно Ollama; vLLM когда реально раздаёте запросы объёмом.

Зачем self-host инференс, если он медленнее?

Приватность. Ваши промпты и ответы не касаются серверов и логов провайдера. Для чувствительных данных — юридических, медицинских, внутреннего кода, всего, что нельзя слать третьим — медленная приватная модель бьёт быструю, которая видит всё. В паре с no-KYC оплатой криптой вся цепочка остаётся вашей.

← Back to blogSee plans & pricing →

Комментарии

Пока нет комментариев. Будьте первым.

Оставить комментарий

Комментарии проходят модерацию перед публикацией.