EQVPS

Приватний локальний інференс LLM: що CPU-VPS може, а що ні

Aug 9, 2026 · 2 min read · EQVPS Team

Скажу чесно одразу: якщо потрібна швидка, дешева, якісна генерація — кличте API. CPU-VPS не поб'є дата-центр, набитий GPU, і хто каже протилежне — щось продає.

То навіщо взагалі self-host інференс? Одна причина, і вона хороша: модель на вашому сервері нікуди не відправляє ваші промпти.

Як виглядає CPU-інференс насправді

На CPU з достатнім RAM можна ганяти реальні моделі. Модель 7–8B у 4-бітному кванті працює. 13B працює. Можна навіть витягнути клас 30B, якщо вистачає памʼяті. Чого не можна — зробити це швидким: вивід іде в пару токенів на секунду, а не миттєвим потоком з API.

Ось чесний компроміс. Для інтерактивного чату це дратує. Для фонової роботи — сумаризація документів уночі, класифікація черги, збагачення даних за розкладом — пара токенів на секунду цілком нормальна, і ніхто не дивиться на годинник.

Арифметика RAM

Модель має сидіти в памʼяті, квантована чи ні, плюс накладні під контекст і рантайм:

Ось чому «запусти локальну модель» тихо стає питанням про велику памʼять. Модель і є слід у памʼяті. Додайте RAG-індекс чи агентів на ту саму машину — числа складаються.

Ollama проти vLLM, коротко

Ollama — прості двері всередину: встановив, ollama run, готово. Правильний інструмент для приватної однокористувацької установки, де просто потрібна доступна модель. vLLM зроблений під пропускну роздачу: більше налаштування, краще під паралельним навантаженням, виправданий коли реально тримаєте обсяг. Почніть з Ollama; беріться за vLLM, коли роздаєте реальний трафік.

Де приватність справді виграє

Аргумент за self-host інференс не у швидкості й не в ціні — у тому, що деякі дані не можуть піти. Юридичні документи. Медкартки. Пропрієтарний код. Усе, де слати промпт у чужий API виключено з політики чи довіри. Повільна модель, що крутиться цілком на вашій машині, бʼє швидку, що логує все, що ви шлете.

А якщо дані настільки чутливі, то й оплата, мабуть, має бути приватною. Оренда машини криптою без KYC тримає весь ланцюг — сервер, модель, промпти, оплату — поза чиїмись записами про особу. Ось реальний пітч: не «дешевше інференс», а «інференс, який ніхто інший не бачить».

Підсумок

Заради швидкості та якості — використовуйте API, соромного немає. Self-host — коли приватність це вимога і повільніше прийнятно. Рахуйте під модель плюс її контекст плюс усе решта на машині й не чекайте швидкості GPU від CPU.

Коли моделі потрібна реальна памʼять, лінійка Pro дає 32–80 ГБ з виділеним IP і нічними бекапами — досить, щоб тримати серйозну квантовану модель з місцем під контекст навколо.

FAQ

Чи можна запустити LLM без GPU?

Невеликі квантовані моделі — так, і повільно. Модель 7–8B у 4-бітному кванті йде на CPU за достатнього RAM, але вивід буде в пару токенів на секунду, а не бадьорий потік з API. Ок для батч-задач і фону, боляче для інтерактивного чату.

Скільки RAM під локальний інференс?

Модель має влізти в памʼять плюс накладні. Модель 7–8B 4-біт хоче ~6–8 ГБ; 13B близько 10–16 ГБ; моделі класу 30B тягнуть 24–48 ГБ у кванті. Плюс місце під контекст і решту на машині. Ось чому локальний інференс швидко йде в high-memory.

Ollama чи vLLM?

Ollama — простий захід: одна команда, модель підтягнута, працює. vLLM — про пропускну здатність і роздачу, більше налаштування, краще під навантаженням. Для приватної однокористувацької машини зазвичай Ollama; vLLM коли реально роздаєте запити обсягом.

Навіщо self-host інференс, якщо він повільніший?

Приватність. Ваші промпти й відповіді не торкаються серверів і логів провайдера. Для чутливих даних — юридичних, медичних, внутрішнього коду, усього, що не можна слати третім — повільна приватна модель бʼє швидку, що бачить усе. У парі з no-KYC оплатою криптою весь ланцюг лишається вашим.

← Back to blogSee plans & pricing →

Коментарі

Поки немає коментарів. Будьте першим.

Залишити коментар

Коментарі проходять модерацію перед публікацією.