每篇 RAG 教程都在一台装了几百份文档的笔记本上跑,感觉毫不费力。然后你把它指向一个真实的语料——一家公司的文档、多年的工单、一个知识库——突然间内存就成了全部话题。
RAG 不靠 CPU 扩展。它靠 RAM 扩展。
为什么索引想要内存
检索的工作方式是把每一块文本变成一个 embedding——一个几百到几千个数字长的向量。搜索意味着把你的查询向量跟它们全部快速比较。“快速”是关键词:为低延迟,索引需要住在 RAM 里。在磁盘上它能用,但每个查询都要付代价,而低延迟检索一开始就是自托管的重点。
所以内存账单随两件事扩展:你有多少分块,以及每个向量多宽。
真实数字,大致地
量你自己的——维度和索引类型对这影响很大——但作为一个起步感觉:
- 几十万个 embeddings —— 在 2–4 GB 里舒服。一个个人知识库、单个产品的文档。
- 一到几百万 —— 加上周围的应用、模型客户端和操作系统,规划 16–32 GB。这是一个正经的公司知识库或一个多源 RAG。
- 数千万,或高维向量 —— 现在你到 48–80 GB,再往上就跨几台机器。大型文档资产、多租户检索、或你同时保持几个索引热着。
一个也持有大索引的多代理系统,把两笔成本都叠在同一台机器上——那就是一个 32 GB 套餐悄悄变成一个 64 GB 的方式。
引擎选择,简述
如果你已经在跑 Postgres,pgvector 是最省事的选项——它是个扩展,不是一个要照看的新服务。当你有数以百万计向量、想要快速的过滤搜索时,一个像 Qdrant 或 Weaviate 的专用引擎配得上那个单独的进程。别在第一天过度工程;跑你已经在运营的,只在搜索真的变慢时再拆出去。
为什么费劲自托管
人们真去做这个的两个理由,都不是“为了省几美元”:
隐私。 Embeddings 不是抽象的——它们编码了它们来自的文本。你的文档、你客户的内容、你的内部笔记,变成向量、送到一个第三方的服务器上。自托管把那个留在一台你掌控的机器上。如果数据敏感到你还在用加密货币、无需 KYC 付款,一个托管向量云就把全部意义抵消了。
固定成本。 托管向量服务按存储的向量和跑的查询计费。VPS 是一个月一个数,你想多用力用它都行。规模一大,可预测胜过按量。
这对配置意味着什么
从量你的语料开始,不是靠猜。拿到你的 embedding 数量和维度、加载一个样本、盯着常驻内存、外推。然后挑一个给索引加周围一切留有余量的套餐——应用、模型客户端、增长的空间。
对任何超过一两百万私密持有向量的场景,Pro 系列跑 32 到 80 GB,带独立IP 和每夜备份,当索引就是产品、丢了它很痛时,这很要紧。
评论
暂无评论。来做第一个吧。