Нека сме честни от началото: ако искаш бързо, евтино, висококачествено генериране, извикай API. CPU VPS няма да бие датацентър, пълен с GPU-та, и всеки, който ти казва иначе, продава нещо.
Тогава защо изобщо да хоствам inference сам? Една причина, и е добра: моделът на сървъра ти никога не изпраща промптовете ти никъде.
Как изглежда реално CPU inference
Можеш да пускаш реални модели на CPU с достатъчно RAM. Модел 7–8B, квантизиран до 4-bit, работи. 13B работи. Можеш дори да бутнеш модел клас 30B, ако имаш паметта. Това, което не можеш да направиш, е да го направиш бърз — изходът идва с няколко токена в секунда, не с мигновения стрийм, който API дава.
Това е честният компромис. За интерактивен чат е разочароващо. За фонова работа — обобщаване на документи през нощта, класифициране на опашка, обогатяване на данни по график — няколко токена в секунда са напълно наред, и никой не гледа часовника.
Математиката на RAM
Моделът трябва да седи в паметта, квантизиран или не, плюс overhead за контекст и runtime:
- 7–8B, 4-bit — около 6–8 GB. Работи на среден план.
- 13B, 4-bit — грубо 10–16 GB.
- Клас 30B, квантизиран — 24–48 GB, в зависимост от квантизацията.
- По-голям, или по-висока прецизност — бързо си на 64–80 GB — и отвъд 80 GB никоя единична Pro машина не се събира, и все още е бавна на CPU.
Затова „пусни локален модел“ тихо става въпрос за висока памет. Моделът е отпечатъкът в паметта. Добави RAG индекс или агенти на същата машина и числата се натрупват.
Ollama срещу vLLM, накратко
Ollama е лесната врата — инсталирай, ollama run, готово. Правилният инструмент е за частна настройка с един потребител, където просто искаш моделът наличен. vLLM е построен за throughput на сервиране: повече настройка, по-добре под едновременно натоварване, струва си, когато реално обработваш обем. Започни с Ollama; посегни към vLLM, когато сервираш реален трафик.
Къде privacy-first реално печели
Аргументът за self-hosted inference не е скорост или цена — той е, че някои данни не могат да излязат. Правни документи. Медицински досиета. Собствен код. Всичко, при което изпращането на промпта към API на трета страна е изключено по причини на политика или доверие. По-бавен модел, който работи изцяло на машината ти, бие бърз, който логва всичко, което му изпращаш.
И ако данните са толкова чувствителни, вероятно и плащането трябва да е частно. Наемането на машината с crypto и без KYC държи цялата верига — сървър, модел, промптове, фактуриране — извън записите за самоличност на когото и да е. Това е реалният аргумент: не „по-евтина inference“, а „inference, която никой друг не може да види“.
Заключение
За скорост и качество, използвай API — без срам в това. Хоствай сам, когато поверителността е изискването и по-бавното е приемливо. Оразмери за модела плюс контекста му плюс всичко друго, споделящо машината, и не очаквай GPU скорост от CPU.
Когато моделът се нуждае от реална памет, Pro линията работи от 32 до 80 GB с dedicated IP и нощни архиви — достатъчно да задържиш сериозен квантизиран модел с място за контекст около него.
Коментари
Още няма коментари. Бъди първият.