どのRAGチュートリアルも数百の文書を持つノートPCで動き、労なく感じます。それから実際のコーパスに向ける — 会社の文書、何年分ものチケット、ナレッジベース — と、突然メモリが会話のすべてになります。
RAGはCPUでスケールしません。RAMでスケールします。
インデックスがなぜメモリを欲しがるか
検索は、テキストのチャンクをどれも埋め込み — 数百から数千の数字の長さのベクトル — に変えることで働きます。検索とは、あなたのクエリベクトルをそのすべてと比べること、速く。「速く」がキーワード:低遅延のためにインデックスはRAMに住む必要があります。ディスクでも動きますが、どのクエリもペナルティを払い、低遅延の検索こそそもそも自ホストの目的でした。
だからメモリの請求は二つでスケールします:チャンクがいくつあるか、そして各ベクトルがどれだけ広いか。
実数、おおよそ
自分のを測って — 次元とインデックス型がこれを大きく動かす — でも出発の感覚として:
- 数十万の埋め込み — 2〜4 GBに快適。個人のナレッジベース、単一プロダクトの文書。
- 低い数百万 — アプリ、モデルクライアント、周りのOSとともに、16〜32 GBを計画。これは本格的な会社のナレッジベースやマルチソースRAG。
- 数千万、あるいは高次元ベクトル — 今や48〜80 GB、その先は複数の箱に。大きな文書資産、マルチテナントの検索、あるいは複数のインデックスを同時に温かく保っている。
大きなインデックスも保持するマルチエージェントシステムは両方のコストを同じ箱に積みます — それが、32 GBのプランが静かに64 GBのになる仕組みです。
エンジンの選択、手短に
すでにPostgresを動かしているなら、pgvectorが最も手間の少ない選択肢 — お守りする新サービスではなく拡張です。数百万のベクトルがあり高速なフィルタ検索が欲しいとき、QdrantやWeaviateのような専用エンジンが別プロセスを稼ぎます。初日から過剰設計しないこと;すでに運用しているものを動かし、検索が実際に遅くなったら分離を。
なぜわざわざ自ホストするか
人々が実際にこれをする二つの理由、そしてどちらも「数ドルを節約するため」ではありません:
プライバシー。 埋め込みは抽象ではなく — 由来のテキストをエンコードします。あなたの文書、顧客のコンテンツ、内部のメモが、ベクトルに変えられ第三者のサーバーへ送られる。自ホストはそれをあなたが制御するマシンに保ちます。データがKYCなしで暗号通貨でも払うほど機微なら、マネージドのベクトルクラウドは全体の意味を台無しにします。
定額。 マネージドのベクトルサービスは保存したベクトルと走らせたクエリで課金します。VPSは月額一つの数字で、好きなだけ叩けます。スケールでは、予測可能が計量に勝ちます。
サイジングにとって何を意味するか
推測ではなく、コーパスを測ることから始めましょう。埋め込みの数と次元を得て、サンプルを読み込み、常駐メモリを見て、外挿します。それからインデックスと周りのすべて — アプリ、モデルクライアント、育つ余地 — に余裕のあるプランを選びます。
数百万ベクトルを超えるものをプライベートに保つなら、Proラインが専用IPと夜間バックアップで32から80 GBを動かし、インデックスこそが製品で失うと痛いときに効きます。
コメント
まだコメントはありません。最初になりましょう。