EQVPS

VPS для приватного high-memory інференсу LLM

Великі квантовані моделі потребують реальної RAM, а не GPU, якого у вас немає. Де high-memory CPU-машина приватно ганяє моделі класу 30B, що реально, а що ні. Від $70/міс.

У нас є окрема сторінка про Ollama і малі моделі — це $12 CPU-машина з 1B–8B і ембеддингами. Ця сторінка про інший край: моделі, досить великі, щоб вас зупиняла RAM, а не CPU.

Скажу чесно одразу, як усюди: наші сервери лише CPU, без GPU. Велика модель тут працює повільно. Якщо потрібен швидкий інтерактивний чат на 30B — потрібен GPU-хост, інший продукт, інший провайдер. Що high-memory CPU-машина робить добре — ганяє велику квантовану модель приватно для роботи, що не чат-вікно.

Арифметика RAM

Модель сидить у памʼяті, квантована чи ні, плюс накладні під контекст і рантайм:

Ось чому «запустити велику локальну модель» — насправді питання про памʼять. Модель і є слід памʼяті. Додайте RAG-індекс на ту саму машину — числа складаються.

Де приватність справді виграє

Аргумент не у швидкості й не в ціні — у тому, що деякі дані не можуть піти. Юридичні документи. Медкартки. Пропрієтарний код. Усе, де слати промпт у чужий API виключено. Повільна модель цілком на вашій машині бʼє швидку, що логує все. Ми розписали повну картину тут.

І якщо дані настільки чутливі, то й оплата, мабуть, має бути приватною. Оренда машини криптою без KYC тримає весь ланцюг — сервер, модель, промпти, оплату — поза записами про особу. Ось пітч: не дешевше інференс, а інференс, який ніхто інший не бачить.

Що вибрати

Для моделі класу 30B з місцем під контекст Pro-64 (64 ГБ) — комфортний вибір; щільніший квант влізе в Pro-32 чи Pro-48, більша йде на Pro-80. Спершу завантажте модель, подивіться резидентну памʼять, беріть за заміряним. І налаштуйте очікування: це приватний батч-інференс, не швидке чат-вікно.

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

Чим це відрізняється від вашого use-case про Ollama?

Сторінка Ollama — про малі моделі на $12 CPU-машині: 1B–8B, ембеддинги, легка робота. Це high-memory край: моделі 13B–30B у кванті, яким треба 24–48 ГБ і більше лише щоб завантажитися. Та сама CPU-реальність, значно більший слід памʼяті, інший тариф.

Скільки RAM під конкретну модель?

Модель має влізти в памʼять плюс накладні. 13B 4-біт хоче ~10–16 ГБ; клас 30B у кванті тягне 24–48 ГБ; більше чи вища точність — 64–80 ГБ, а за 80 ГБ однієї нашої машини не вистачить. Плюс місце під контекст.

Буде швидко?

Ні — будьте чесні з собою. CPU-інференс великої моделі це пара токенів на секунду, не інтерактивний потік. Ок для батчу і фону (сумаризація вночі, класифікація черги). Для чату в реальному часі на великій моделі потрібен GPU, якого ми не даємо.

Навіщо ганяти тут, а не в API?

Приватність. Ваші промпти й відповіді не торкаються серверів і логів провайдера. Для чутливих даних — юридичних, медичних, внутрішнього коду — повільна приватна модель бʼє швидку, що бачить усе. У парі з no-KYC оплатою криптою весь ланцюг ваш.

Коментарі

Поки немає коментарів. Будьте першим.

Залишити коментар

Коментарі проходять модерацію перед публікацією.