У нас есть отдельная страница про Ollama и мелкие модели — это $12 CPU-машина с 1B–8B и эмбеддингами. Эта страница про другой край: модели, достаточно большие, чтобы вас останавливала RAM, а не CPU.
Скажу честно сразу, как везде: наши серверы только CPU, без GPU. Большая модель тут работает медленно. Если нужен быстрый интерактивный чат на 30B — нужен GPU-хост, другой продукт, другой провайдер. Что high-memory CPU-машина делает хорошо — гоняет большую квантованную модель приватно для работы, которая не чат-окно.
Арифметика RAM
Модель сидит в памяти, квантованная или нет, плюс накладные под контекст и рантайм:
- 13B, 4-бит — примерно 10–16 ГБ. Идёт уже на среднем тарифе.
- Класс 30B, квант — 24–48 ГБ в зависимости от кванта. Это территория Pro-32 — Pro-64.
- Больше или выше точность — 64–80 ГБ, а за 80 ГБ одной нашей машины не хватит. Pro-80 тут потолок.
Вот почему «запустить большую локальную модель» — на деле вопрос про память. Модель и есть след памяти. Добавьте RAG-индекс на ту же машину — числа складываются.
Где приватность правда выигрывает
Аргумент не в скорости и не в цене — в том, что некоторые данные не могут уйти. Юридические документы. Медкарты. Проприетарный код. Всё, где слать промпт в чужой API исключено. Медленная модель целиком на вашей машине бьёт быструю, которая логирует всё. Мы расписали полную картину здесь.
И если данные настолько чувствительны, то и оплата, наверное, должна быть приватной. Аренда машины криптой без KYC держит всю цепочку — сервер, модель, промпты, оплату — вне записей о личности. Вот питч: не дешевле инференс, а инференс, который никто другой не видит.
Что выбрать
Для модели класса 30B с местом под контекст Pro-64 (64 ГБ) — комфортный выбор; более плотный квант влезет в Pro-32 или Pro-48, крупнее уходит на Pro-80. Сначала загрузите модель, посмотрите резидентную память, берите по замеренному. И настройте ожидания: это приватный батч-инференс, не быстрое чат-окно.
Комментарии
Пока нет комментариев. Будьте первым.