ノートPC上の文書200件のRAGデモは、たやすく感じられます。そこで本物のコーパスに向けると — ある会社の文書、何年分ものチケット、実在するナレッジベース — 全体がメモリの問題になります。CPUの問題ではなく。メモリの問題です。
ここが大半のホスティングページが飛ばす部分:高速な検索はインデックスをRAMに欲しがります。 テキストの各チャンクは埋め込みになります — 数百から数千の数字の幅のベクトル — そして検索とは、あなたのクエリをそれら全部と、素早く比較すること。ディスク上でも動きますが、クエリごとにレイテンシの税を払い、そもそも低レイテンシの検索こそが自己ホストした理由でした。
サイジングの計算、正直に
自分のコーパスを測ってください — 次元数とインデックスの種類でこれは大きく振れます — が、出発点の感触として:
- 数十万の埋め込み — 2〜4 GB。個人のナレッジベース。これにはProは要りません;小さめのプランで十分。
- 数百万 — アプリ、モデルクライアント、周りのOSと合わせて 16〜32 GB を見込みます。本格的な会社のナレッジベース。ここが Pro-32かPro-48 が意味を持ち始めるところ。
- 数千万、または高次元ベクトル — 48 GB以上、そして約80 GBを超えるとインデックスを複数サーバーに分割します。大きな文書群、マルチテナントの検索、複数インデックスを同時にホットに。
詳しく知りたければ、RAMカーブ全体をここに書きました。
なぜ高メモリ かつ KYC不要を一緒に
48 GBのRAMを借りるのは簡単。それを暗号通貨で、身元確認なしで借りるのは簡単ではありません — 本格的なメモリを安く売るホストの大半は、カードとKYCフォームの奥でそうしています。あなたの埋め込みは抽象的な数字ではありません;それが由来したテキストを符号化しています。あなたの文書、顧客のコンテンツが、ベクトルに変わったもの。そのデータがプライベートに支払うほど機微なら、マネージドのベクトルクラウドは全目的を台無しにします — サーバーをあなたの身元に結びつけるホストも同じです。
その組み合わせ — 高メモリ、専用IP、暗号通貨、KYC不要、夜間バックアップ — こそProラインの狙いです。ギガバイトあたり最安ではなく、プライバシーが要らないならRAMは他でもっと安く見つかります。でもインデックスこそがあなたの製品で、それが外に出られないなら、これが合う形です。
どこから始めるか
インデックスに加え、その周りすべて — アプリ、モデルクライアント、成長の余地 — のヘッドルームがあるプランを選んでください。実在するコーパスの大半にはそれが Pro-48(48 GB);大きなものはPro-64かPro-80へ。まずサンプルを読み込み、メモリを見て、恐れた数字ではなく測った数字からサイズを決めてください。
検索がより大きなエージェントシステムの一部なら、同じ箱がしばしばエージェント群も抱えます — そうやって48 GBプランは静かに64 GBになります。
コメント
まだコメントはありません。最初になりましょう。