エージェントのホスティングで最もよく見る間違いは、間違ったものに合わせてサイジングすることです。誰かがエージェント1体を動かし、それが400 MBを使い、エージェントはホストするのが安いと結論づけます。それから本物の一団にスケールし、箱が午前3時にスワップし始めます。
エージェント1体は本当に安いです。それは面白いケースではありません。
メモリは実際どこへ行くのか
モデルへのAPI呼び出しを撃つだけのエージェントは軽い — 大半はネットワークを待っています。そういうのを小さなプランで一ダース動かしても、気づきもしないでしょう。
RAMが消えるのは、エージェントが状態を持ち始めたときです。ターンごとに伸びる会話履歴。複数のエージェントが読み書きする作業セット。長期記憶のためのベクトルストアが同じプロセスに座る。アーキテクチャが「API呼び出し、忘れる」であることをやめ「覚える、協調する、引き継ぐ」になった瞬間、制約はCPUではなくメモリになります。
CrewAI、LangGraph、AutoGPT風のループ — どれも本気になるにつれこの方向に傾きます。RAMを食うのはフレームワークではなく、状態です。
おおよそのサイジング、正直に
公式があるふりはしません、ないからです — 各エージェントがどれだけ抱えるかに完全に依ります。でもこれらを動かしてきた実践的な感覚:
- 軽量、APIバウンドのエージェント — ここではProはまったく要りません;NATか専用IPのプラン($3〜20)が処理します。Proが値打ちを得るのは、共有状態が〜32 GBを超えて押し上げてからです。
- 32 GB — 本物のマルチエージェントシステムのスイートスポット:共有記憶を持つ5〜10体に、実際に役立つベクトルデータベース。たいていの人はここに着地します。
- 64 GB — より大きな艦隊、より長い履歴、数百万ベクトルの記憶インデックス、あるいは複数サービスの同居。ここで、さもなければ juggle する3つの小さな箱を、1つの箱が置き換えます。
- 80 GB — 重い、メモリバウンドの作業:大きなインメモリデータセット、多数の同時エージェント、あるいはエージェント+同じホストでのローカルモデル推論。
必要だと思うところより下から始めましょう。1日 htop を見てください。スワップが見えたらサイズを上げる、その前ではなく — 高めに当て推量するのはただお金の無駄です。
買いにくい部分
これをややこしくするのがこれです:64 GBのRAMを借りるのは簡単。64 GBを暗号通貨で身元確認なしに借りるのは、そうではありません。まともなメモリを安く売るホストのほとんどは、それをカードとKYCフォームの後ろでやります。
エージェントが自分のサーバーをプロビジョニングする、あるいはワークロードが名前に結びつけたくないデータに触れるなら、その組み合わせ — 高メモリ、暗号通貨、KYC不要、そしてエージェント自身がMCP経由で注文できる — こそが実際の製品です。ギガバイト当たりで安くはなく、その比較がなぜ誤解を招くかは別途書きました。それはほとんど誰も提供しない条件で手に入ります。
で、どうするか
エージェントが軽くAPIバウンドなら、考えすぎないこと — 小さなNATか専用IPのプランで十分、高メモリの問い全体を飛ばしましょう。状態を持つ本物の艦隊を動かしているなら、実際にメモリにあるもので測り、32 GBから始め、グラフが言うときに上げましょう。
そこに来たら、Proラインが専用IPと夜間バックアップで32から80 GBをカバーします。野望ではなく、作業セットに合うティアを選びましょう。
コメント
まだコメントはありません。最初になりましょう。