EQVPS

Хостване на локална LLM inference частно: какво CPU VPS може и не може

9.08.2026 г. · 3 мин четене · EQVPS Team

Нека сме честни от началото: ако искаш бързо, евтино, висококачествено генериране, извикай API. CPU VPS няма да бие датацентър, пълен с GPU-та, и всеки, който ти казва иначе, продава нещо.

Тогава защо изобщо да хоствам inference сам? Една причина, и е добра: моделът на сървъра ти никога не изпраща промптовете ти никъде.

Как изглежда реално CPU inference

Можеш да пускаш реални модели на CPU с достатъчно RAM. Модел 7–8B, квантизиран до 4-bit, работи. 13B работи. Можеш дори да бутнеш модел клас 30B, ако имаш паметта. Това, което не можеш да направиш, е да го направиш бърз — изходът идва с няколко токена в секунда, не с мигновения стрийм, който API дава.

Това е честният компромис. За интерактивен чат е разочароващо. За фонова работа — обобщаване на документи през нощта, класифициране на опашка, обогатяване на данни по график — няколко токена в секунда са напълно наред, и никой не гледа часовника.

Математиката на RAM

Моделът трябва да седи в паметта, квантизиран или не, плюс overhead за контекст и runtime:

Затова „пусни локален модел“ тихо става въпрос за висока памет. Моделът е отпечатъкът в паметта. Добави RAG индекс или агенти на същата машина и числата се натрупват.

Ollama срещу vLLM, накратко

Ollama е лесната врата — инсталирай, ollama run, готово. Правилният инструмент е за частна настройка с един потребител, където просто искаш моделът наличен. vLLM е построен за throughput на сервиране: повече настройка, по-добре под едновременно натоварване, струва си, когато реално обработваш обем. Започни с Ollama; посегни към vLLM, когато сервираш реален трафик.

Къде privacy-first реално печели

Аргументът за self-hosted inference не е скорост или цена — той е, че някои данни не могат да излязат. Правни документи. Медицински досиета. Собствен код. Всичко, при което изпращането на промпта към API на трета страна е изключено по причини на политика или доверие. По-бавен модел, който работи изцяло на машината ти, бие бърз, който логва всичко, което му изпращаш.

И ако данните са толкова чувствителни, вероятно и плащането трябва да е частно. Наемането на машината с crypto и без KYC държи цялата верига — сървър, модел, промптове, фактуриране — извън записите за самоличност на когото и да е. Това е реалният аргумент: не „по-евтина inference“, а „inference, която никой друг не може да види“.

Заключение

За скорост и качество, използвай API — без срам в това. Хоствай сам, когато поверителността е изискването и по-бавното е приемливо. Оразмери за модела плюс контекста му плюс всичко друго, споделящо машината, и не очаквай GPU скорост от CPU.

Когато моделът се нуждае от реална памет, Pro линията работи от 32 до 80 GB с dedicated IP и нощни архиви — достатъчно да задържиш сериозен квантизиран модел с място за контекст около него.

Въпроси

Мога ли да пусна LLM без GPU?

Малки квантизирани модели, да — и бавно. Модел 7–8B, квантизиран до 4-bit, работи на CPU с достатъчно RAM, но ще измерваш изхода в няколко токена в секунда, не в бързия стрийм, който получаваш от API. Наред за batch задачи и фонови задачи, болезнено за интерактивен чат.

Колко RAM за локална inference?

Моделът трябва да се събере в паметта плюс overhead. Модел 7–8B на 4-bit иска ~6–8 GB; 13B около 10–16 GB; модели клас 30B бутат 24–48 GB квантизирани. Добави място за контекст и всичко друго на машината. Затова локалната inference каца в територия с висока памет бързо.

Ollama или vLLM?

Ollama е лесната рампа — една команда, моделът издърпан, работещ. vLLM е за throughput и сервиране, повече настройка, по-добре под натоварване. За частна машина с един потребител Ollama обикновено е правилният избор; vLLM, когато реално сервираш заявки на обем.

Защо изобщо да хоствам inference сам, ако е по-бавно?

Поверителност. Промптовете и изходите ти никога не докосват сървъри или логове на доставчик. За чувствителни данни — правни, медицински, вътрешен код, всичко, което не можеш да пратиш на трета страна — по-бавен частен модел бие бърз, който вижда всичко. Съчетай го с no-KYC crypto плащане и цялата верига остава твоя.

← Обратно към блогаВиж планове и цени →

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.