Скажу чесно одразу: якщо потрібна швидка, дешева, якісна генерація — кличте API. CPU-VPS не поб'є дата-центр, набитий GPU, і хто каже протилежне — щось продає.
То навіщо взагалі self-host інференс? Одна причина, і вона хороша: модель на вашому сервері нікуди не відправляє ваші промпти.
Як виглядає CPU-інференс насправді
На CPU з достатнім RAM можна ганяти реальні моделі. Модель 7–8B у 4-бітному кванті працює. 13B працює. Можна навіть витягнути клас 30B, якщо вистачає памʼяті. Чого не можна — зробити це швидким: вивід іде в пару токенів на секунду, а не миттєвим потоком з API.
Ось чесний компроміс. Для інтерактивного чату це дратує. Для фонової роботи — сумаризація документів уночі, класифікація черги, збагачення даних за розкладом — пара токенів на секунду цілком нормальна, і ніхто не дивиться на годинник.
Арифметика RAM
Модель має сидіти в памʼяті, квантована чи ні, плюс накладні під контекст і рантайм:
- 7–8B, 4-біт — близько 6–8 ГБ. Іде на середньому тарифі.
- 13B, 4-біт — приблизно 10–16 ГБ.
- Клас 30B, квант — 24–48 ГБ, залежно від кванта.
- Більше чи вища точність — швидко йдете в 64–80 ГБ — а за 80 ГБ однієї машини Pro не вистачить, і все ще CPU-повільно.
Ось чому «запусти локальну модель» тихо стає питанням про велику памʼять. Модель і є слід у памʼяті. Додайте RAG-індекс чи агентів на ту саму машину — числа складаються.
Ollama проти vLLM, коротко
Ollama — прості двері всередину: встановив, ollama run, готово. Правильний інструмент для приватної однокористувацької установки, де просто потрібна доступна модель. vLLM зроблений під пропускну роздачу: більше налаштування, краще під паралельним навантаженням, виправданий коли реально тримаєте обсяг. Почніть з Ollama; беріться за vLLM, коли роздаєте реальний трафік.
Де приватність справді виграє
Аргумент за self-host інференс не у швидкості й не в ціні — у тому, що деякі дані не можуть піти. Юридичні документи. Медкартки. Пропрієтарний код. Усе, де слати промпт у чужий API виключено з політики чи довіри. Повільна модель, що крутиться цілком на вашій машині, бʼє швидку, що логує все, що ви шлете.
А якщо дані настільки чутливі, то й оплата, мабуть, має бути приватною. Оренда машини криптою без KYC тримає весь ланцюг — сервер, модель, промпти, оплату — поза чиїмись записами про особу. Ось реальний пітч: не «дешевше інференс», а «інференс, який ніхто інший не бачить».
Підсумок
Заради швидкості та якості — використовуйте API, соромного немає. Self-host — коли приватність це вимога і повільніше прийнятно. Рахуйте під модель плюс її контекст плюс усе решта на машині й не чекайте швидкості GPU від CPU.
Коли моделі потрібна реальна памʼять, лінійка Pro дає 32–80 ГБ з виділеним IP і нічними бекапами — досить, щоб тримати серйозну квантовану модель з місцем під контекст навколо.
Коментарі
Поки немає коментарів. Будьте першим.