У нас є окрема сторінка про Ollama і малі моделі — це $12 CPU-машина з 1B–8B і ембеддингами. Ця сторінка про інший край: моделі, досить великі, щоб вас зупиняла RAM, а не CPU.
Скажу чесно одразу, як усюди: наші сервери лише CPU, без GPU. Велика модель тут працює повільно. Якщо потрібен швидкий інтерактивний чат на 30B — потрібен GPU-хост, інший продукт, інший провайдер. Що high-memory CPU-машина робить добре — ганяє велику квантовану модель приватно для роботи, що не чат-вікно.
Арифметика RAM
Модель сидить у памʼяті, квантована чи ні, плюс накладні під контекст і рантайм:
- 13B, 4-біт — приблизно 10–16 ГБ. Іде вже на середньому тарифі.
- Клас 30B, квант — 24–48 ГБ залежно від кванта. Це територія Pro-32 — Pro-64.
- Більше чи вища точність — 64–80 ГБ, а за 80 ГБ однієї нашої машини не вистачить. Pro-80 тут стеля.
Ось чому «запустити велику локальну модель» — насправді питання про памʼять. Модель і є слід памʼяті. Додайте RAG-індекс на ту саму машину — числа складаються.
Де приватність справді виграє
Аргумент не у швидкості й не в ціні — у тому, що деякі дані не можуть піти. Юридичні документи. Медкартки. Пропрієтарний код. Усе, де слати промпт у чужий API виключено. Повільна модель цілком на вашій машині бʼє швидку, що логує все. Ми розписали повну картину тут.
І якщо дані настільки чутливі, то й оплата, мабуть, має бути приватною. Оренда машини криптою без KYC тримає весь ланцюг — сервер, модель, промпти, оплату — поза записами про особу. Ось пітч: не дешевше інференс, а інференс, який ніхто інший не бачить.
Що вибрати
Для моделі класу 30B з місцем під контекст Pro-64 (64 ГБ) — комфортний вибір; щільніший квант влізе в Pro-32 чи Pro-48, більша йде на Pro-80. Спершу завантажте модель, подивіться резидентну памʼять, беріть за заміряним. І налаштуйте очікування: це приватний батч-інференс, не швидке чат-вікно.
Коментарі
Поки немає коментарів. Будьте першим.