「私のAIエージェントにどれくらいのサーバーが要る?」への正直な答えは:思うより少ない — 突然そうでなくなるまでは。 コツは、あなたのワークロードがその線のどちら側に座るかを知ること。だから当て推量の代わりに、各種のエージェントが実際に何を使うかを。
すべてを決める一つの質問
モデルはあなたのサーバーで動くのか、それともエージェントがAPI越しにモデルを呼ぶのか?
エージェントがホスト型LLMと話すなら(一般的なケース)、賢く高価な部分は誰か他人のハードウェアで起きます。あなたの箱はただオーケストレーションループを動かす:入力を取り、APIを呼び、結果をパースし、たぶんデータベースに当たり、繰り返す。それは軽い。本当に軽い — 1 GBの箱が汗もかかずにやります。
モデルをローカルで動かすなら、すべてが変わります:今やRAMはモデルの重みに支配され、取れるだけのコアが欲しくなります。ほとんどの人はこれを必要としません。必要な人はたいてい理由を正確に知っています(プライバシー、レート制限なし、オフライン)。それがあなたなら、ローカルLLMを自ホストする別のガイドを書きました。
ワークロードごとのサイジング
実数、行動に移せるたぐいの:
| ワークロード | RAM | vCPU | ディスク | メモ |
|---|---|---|---|---|
| チャット / アシスタントエージェント(API裏付け) | 1 GB | 2 | 15 GB | ループは小さい;モデルはリモート |
| スクレイパー / データエージェント | 2 GB | 2 | 25 GB | パース+スクレイプデータの余裕 |
| 取引ボット | 1〜2 GB | 2 | 15〜25 GB | サイズより遅延が大事 — 取引ボットガイド参照 |
| 複数エージェントを並列 | 4 GB | 4 | 35 GB | 各エージェントは安い;並行が積み上がる |
| ローカルLLM、3B〜7B(量子化) | 4〜6 GB | 4〜6 | 25〜45 GB | CPUのみ、読める速さで動く、まとめ処理ではない |
パターン:API裏付けのエージェントは小さい;ローカルモデルだけが重い。
CPUの箱はどこで止まるか
天井について率直に:私たちのプランは 6 GB RAMと6コア、CPUのみ — GPUなし で頭打ちです。それが上の表のすべてをカバーします、個人利用の7Bローカルモデルを含めて。カバーしないもの:13B以上のモデル、高スループットのローカル推論、あるいは本当にGPUが要る何でも。それがあなたのワークロードなら、CPU VPS — うちのも誰のも — は間違った道具で、デプロイした後より今知るほうが良いです。
APIを呼ぶ95%のエージェントには、このどれも問題ではありません。彼らは最小の箱で満足です。
実践的な経験則
- APIを呼ぶだけのエージェント? 1 GB / 2コアから始める。後でサイズを変えられます。
- スクレイピングやデータ保存? 2 GBと大きめのディスク。
- 複数エージェント、または小さなローカルモデルを動かす? 4〜6 GBと4以上のコア。
- GPUが要る? 別カテゴリ — CPUに無理やり押し込まないこと。
不安から過剰配備しないこと。エージェントは本質的に軽量;小さすぎる箱のコストは一度のサイズ変更、大きすぎる箱のコストは毎月遊ぶRAMに払うこと。
サイズを選んだら、エージェントが MCP で箱を自分で借りられますし、サイトで1分で注文もできます。どちらでも、小さく始めましょう — ほぼ確実に、期待より少なくて済みます。
コメント
まだコメントはありません。最初になりましょう。