エージェントのホスティングで最もよくある間違いは、1体に合わせてサイジングすることです。誰かが単一のエージェントを動かし、400 MB使うのを見て、エージェントはホストが安いと結論づけます。それから本物の一団にスケールし、箱が午前3時にスワップし始めます。
エージェント1体は本当に安いです。それは面白いケースではありません。
メモリは実際どこへ行くのか
モデルへのAPI呼び出しを撃つだけのエージェントは軽い — 大半はネットワークを待っています。そういうのを小さなプランで一ダース動かしても、気づきもしないでしょう。
RAMが消えるのは、エージェントが状態を持つときです。ターンごとに伸びる履歴。複数のエージェントが読み書きする作業セット。同じプロセスの長期記憶用ベクトルストア。アーキテクチャが「API呼び出し、忘れる」であることをやめ「覚える、協調する、引き継ぐ」になった瞬間、制約はCPUではなくメモリです。CrewAI、LangGraph、AutoGPT風のループはどれも本気になるにつれこの方向に傾きます。RAMを食うのはフレームワークではなく、状態です。私たちはここで数字を掘り下げました。
おおよそのサイジング
- 軽く、APIバウンドのエージェント — Proは要らず;NATか専用IPのプラン($3〜20)で十分。このページの残りは飛ばしましょう。
- 本物の一団(5〜10体) に共有記憶と役立つベクトルストア — Pro-32(32 GB)がスイートスポット。ほとんどの艦隊はここに着地します。
- より大きな艦隊、より長い履歴、数百万の記憶インデックス — Pro-64(64 GB)。ここで一つの箱が、さもなければ juggle する三つの小さいのを置き換えます。
- 艦隊+同居サービス、あるいはエージェント+ローカル推論 — Pro-80(80 GB)まで。
必要だと思うところより下から始め、1日 htop を見て、スワップが見えたら上げましょう。高めに当て推量するのはただお金の無駄です。
この形のホストである理由
自分のサーバーをプロビジョニングまたは管理する艦隊は、人間なしで駆動できるAPIを欲しがり — そしてますます、人間なしで払うことも。高メモリ、専用IP、暗号決済、KYCなし、そして全体がエージェントによってMCP経由で注文可能:その組み合わせは稀で、それがProラインの作られた目的です。ギガバイト当たりで最安ではなく、エージェントが軽いなら本当に要りません。でも状態を持ちプライバシーを重んじる本格的なシステムには、正しい合致です。
そこに来たら、Pro-32 が本物の一団をカバーし;艦隊が育つにつれ64か80 GBへサイズを上げましょう。
コメント
まだコメントはありません。最初になりましょう。