Скажу честно сразу: если нужна быстрая, дешёвая, качественная генерация — зовите API. CPU-VPS не побьёт дата-центр, забитый GPU, и кто говорит обратное — что-то продаёт.
Так зачем вообще self-host инференс? Одна причина, и она хорошая: модель на вашем сервере никуда не отправляет ваши промпты.
Как выглядит CPU-инференс на деле
На CPU с достаточным RAM можно гонять реальные модели. Модель 7–8B в 4-битном кванте работает. 13B работает. Можно даже вытянуть класс 30B, если хватает памяти. Чего нельзя — сделать это быстрым: вывод идёт в пару токенов в секунду, а не мгновенным потоком из API.
Вот честный компромисс. Для интерактивного чата это раздражает. Для фоновой работы — суммаризация документов ночью, классификация очереди, обогащение данных по расписанию — пара токенов в секунду совершенно нормальна, и никто не смотрит на часы.
Арифметика RAM
Модель должна сидеть в памяти, квантованная или нет, плюс накладные под контекст и рантайм:
- 7–8B, 4-бит — около 6–8 ГБ. Идёт на среднем тарифе.
- 13B, 4-бит — примерно 10–16 ГБ.
- Класс 30B, квант — 24–48 ГБ, в зависимости от кванта.
- Больше или выше точность — быстро уходите в 64–80 ГБ — а за 80 ГБ одной машины Pro не хватит, и всё ещё CPU-медленно.
Вот почему «запусти локальную модель» тихо становится вопросом про большую память. Модель и есть след в памяти. Добавьте RAG-индекс или агентов на ту же машину — числа складываются.
Ollama против vLLM, кратко
Ollama — простая дверь внутрь: установил, ollama run, готово. Правильный инструмент для приватной однопользовательской установки, где просто нужна доступная модель. vLLM сделан под пропускную раздачу: больше настройки, лучше под параллельной нагрузкой, оправдан когда реально держите объём. Начните с Ollama; беритесь за vLLM, когда раздаёте реальный трафик.
Где приватность правда выигрывает
Аргумент за self-host инференс не в скорости и не в цене — в том, что некоторые данные не могут уйти. Юридические документы. Медкарты. Проприетарный код. Всё, где слать промпт в чужой API исключено по политике или доверию. Медленная модель, которая крутится целиком на вашей машине, бьёт быструю, которая логирует всё, что вы шлёте.
А если данные настолько чувствительны, то и оплата, наверное, должна быть приватной. Аренда машины криптой без KYC держит всю цепочку — сервер, модель, промпты, оплату — вне чьих-либо записей о личности. Вот реальный питч: не «дешевле инференс», а «инференс, который никто другой не видит».
Итог
Ради скорости и качества — используйте API, стыдного нет. Self-host — когда приватность это требование и медленнее приемлемо. Считайте под модель плюс её контекст плюс всё остальное на машине и не ждите скорости GPU от CPU.
Когда модели нужна реальная память, линейка Pro даёт 32–80 ГБ с выделенным IP и ночными бэкапами — достаточно, чтобы держать серьёзную квантованную модель с местом под контекст вокруг.
Комментарии
Пока нет комментариев. Будьте первым.