Честният отговор на „колко сървър се нуждае AI агентът ми?“ е: по-малко, отколкото мислиш — точно докато изведнъж не престане да е така. Номерът е да знаеш от коя страна на тази линия седи натоварването ти. Затова вместо да гадаеш, ето какво реално използва всеки вид агент.
Единственият въпрос, който решава всичко
Моделът работи ли на сървъра ти, или агентът ти извиква модел през API?
Ако агентът ти говори с хостнат LLM (честият случай), умната, скъпа част се случва на чужд хардуер. Машината ти просто пуска orchestration цикъл: вземи вход, извикай API-то, парсни резултата, може би удари база данни, повтори. Това е леко. Наистина леко — 1 GB машина го прави без да се изпоти.
Ако пускаш модела локално, всичко се променя: сега RAM-ът е доминиран от теглата на модела, и ще искаш всяко ядро, което можеш да получиш. Повечето хора не се нуждаят от това. Тези, които се нуждаят, обикновено знаят точно защо (поверителност, без rate limits, offline). Ако това си ти, написахме отделно ръководство за хостване на локален LLM.
Оразмеряване по натоварване
Реални числа, от вида, по който можеш да действаш:
| Натоварване | RAM | vCPU | Диск | Бележки |
|---|---|---|---|---|
| Чат / асистент агент (API-базиран) | 1 GB | 2 | 15 GB | Цикълът е мъничък; моделът е отдалечен |
| Скрейпър / data агент | 2 GB | 2 | 25 GB | Запас за parsing + скрейпнати данни |
| Търговски бот | 1–2 GB | 2 | 15–25 GB | Латентността има повече значение от размера — виж ръководството за търговски ботове |
| Няколко агента паралелно | 4 GB | 4 | 35 GB | Всеки агент е евтин; concurrency-то се натрупва |
| Локален LLM, 3B–7B (quantized) | 4–6 GB | 4–6 | 25–45 GB | Само CPU, работи с четимо темпо, не масово |
Моделът: API-базираните агенти са мънички; локалните модели са единственото тежко нещо.
Къде спира CPU машината
Директно за тавана: плановете ни стигат до 6 GB RAM и 6 ядра, само-CPU — без GPU. Това покрива всичко в таблицата по-горе, включително 7B локален модел за лична употреба. Това, което не покрива: 13B+ модели, локален inference с висока пропускливост, или каквото и да е, което наистина се нуждае от GPU. Ако това е натоварването ти, CPU VPS — наш или на всеки — е грешният инструмент, и е по-добре да го знаеш сега, отколкото след като си deploy-нал.
За 95%-те агенти, които извикват API, нищо от това не е проблем. Те са щастливи на най-малката машина.
Практическо правило
- Само агент, който извиква API? Започни на 1 GB / 2 ядра. Можеш да преоразмериш по-късно.
- Скрейпване или съхранение на данни? 2 GB и по-голям диск.
- Пускаш няколко агента, или малък локален модел? 4–6 GB и 4+ ядра.
- Нуждае се от GPU? Различна категория — не го натиквай на CPU.
Не пре-провизирай от нервност. Агентите са леки по природа; цената на твърде-малка машина е едно преоразмеряване, докато цената на твърде-голяма машина е плащане за idle RAM всеки месец.
Когато си избрал размер, агент може да наеме машината сам през MCP, или можеш да я поръчаш за минута на сайта. И в двата случая, започни малко — почти сигурно ще се нуждаеш от по-малко, отколкото очакваше.
Коментари
Още няма коментари. Бъди първият.