−25%

Windows 年払い、10月31日まで。 プランを見る

EQVPS
始める

スケールする自己ホスト型RAG用VPS

コーパスが本物になった途端、検索拡張生成(RAG)はノートPCのデモではなくなる。ベクトルインデックスはRAMを欲しがり、あなたの埋め込みはあなたのプライベートデータ。ここにサイジングの計算と、なぜ高メモリ・KYC不要のホスティングが合うのかを。月$55から。

ノートPC上の文書200件のRAGデモは、たやすく感じられます。そこで本物のコーパスに向けると — ある会社の文書、何年分ものチケット、実在するナレッジベース — 全体がメモリの問題になります。CPUの問題ではなく。メモリの問題です。

ここが大半のホスティングページが飛ばす部分:高速な検索はインデックスをRAMに欲しがります。 テキストの各チャンクは埋め込みになります — 数百から数千の数字の幅のベクトル — そして検索とは、あなたのクエリをそれら全部と、素早く比較すること。ディスク上でも動きますが、クエリごとにレイテンシの税を払い、そもそも低レイテンシの検索こそが自己ホストした理由でした。

サイジングの計算、正直に

自分のコーパスを測ってください — 次元数とインデックスの種類でこれは大きく振れます — が、出発点の感触として:

  • 数十万の埋め込み — 2〜4 GB。個人のナレッジベース。これにはProは要りません;小さめのプランで十分。
  • 数百万 — アプリ、モデルクライアント、周りのOSと合わせて 16〜32 GB を見込みます。本格的な会社のナレッジベース。ここが Pro-32かPro-48 が意味を持ち始めるところ。
  • 数千万、または高次元ベクトル — 48 GB以上、そして約80 GBを超えるとインデックスを複数サーバーに分割します。大きな文書群、マルチテナントの検索、複数インデックスを同時にホットに。

詳しく知りたければ、RAMカーブ全体をここに書きました。

なぜ高メモリ かつ KYC不要を一緒に

48 GBのRAMを借りるのは簡単。それを暗号通貨で、身元確認なしで借りるのは簡単ではありません — 本格的なメモリを安く売るホストの大半は、カードとKYCフォームの奥でそうしています。あなたの埋め込みは抽象的な数字ではありません;それが由来したテキストを符号化しています。あなたの文書、顧客のコンテンツが、ベクトルに変わったもの。そのデータがプライベートに支払うほど機微なら、マネージドのベクトルクラウドは全目的を台無しにします — サーバーをあなたの身元に結びつけるホストも同じです。

その組み合わせ — 高メモリ、専用IP、暗号通貨、KYC不要、夜間バックアップ — こそProラインの狙いです。ギガバイトあたり最安ではなく、プライバシーが要らないならRAMは他でもっと安く見つかります。でもインデックスこそがあなたの製品で、それが外に出られないなら、これが合う形です。

どこから始めるか

インデックスに加え、その周りすべて — アプリ、モデルクライアント、成長の余地 — のヘッドルームがあるプランを選んでください。実在するコーパスの大半にはそれが Pro-48(48 GB);大きなものはPro-64かPro-80へ。まずサンプルを読み込み、メモリを見て、恐れた数字ではなく測った数字からサイズを決めてください。

検索がより大きなエージェントシステムの一部なら、同じ箱がしばしばエージェント群も抱えます — そうやって48 GBプランは静かに64 GBになります。

デプロイの準備はできましたか?暗号通貨で支払い、KYC不要 — 約1分でオンライン。

今すぐデプロイ →

FAQ

私のRAG構成には実際どれくらいのRAMが必要ですか?

埋め込み数とベクトル幅に比例します。数十万チャンクは2〜4 GBに収まり;数百万は、アプリとOSを合わせて16〜32 GB;数千万は48 GB以上を押し上げます。サンプルを測り、常駐メモリを見て、外挿してください — 高めに見積もらないこと、払いすぎるだけです。

マネージドのベクトルサービスを使わないのはなぜ?

人々が実際に自己ホストする理由は2つ:埋め込みはプライベートデータ(文書、メモ、顧客コンテンツ)を符号化するので、自分が管理するマシンに置くことが重要;そしてコストが一定 — マネージドはベクトルとクエリで課金し、VPSは好きなだけ叩ける月1回の数字です。

pgvectorそれとも専用エンジン?

すでにPostgresを動かしているなら、pgvectorが最も手間の少ない道 — 拡張1つ。重いフィルタリングを伴う数百万ベクトルには、Qdrantのような専用エンジンが独立したサービスに値します。運用しているものから始め、検索が遅くなったら分離を — その前ではなく。

RAGにGPUは必要ですか?

いいえ。検索はCPU + RAMの仕事です — テキスト生成ではなくベクトルの比較。生成ステップはあなたのLLMを呼びます(APIか、別のモデルホスト)。高メモリのCPU箱は、検索の半分にちょうど合う形です。

コメント

まだコメントはありません。最初になりましょう。

コメントを残す

コメントは表示される前にモデレートされます。