−25%

Windows 按年付费,截至 10 月 31 日。 查看套餐

EQVPS

大规模自托管 RAG:一个向量索引到底吃多少 RAM

2026年8月9日 · 1 分钟阅读 · EQVPS Team

每篇 RAG 教程都在一台装了几百份文档的笔记本上跑,感觉毫不费力。然后你把它指向一个真实的语料——一家公司的文档、多年的工单、一个知识库——突然间内存就成了全部话题。

RAG 不靠 CPU 扩展。它靠 RAM 扩展。

为什么索引想要内存

检索的工作方式是把每一块文本变成一个 embedding——一个几百到几千个数字长的向量。搜索意味着把你的查询向量跟它们全部快速比较。“快速”是关键词:为低延迟,索引需要住在 RAM 里。在磁盘上它能用,但每个查询都要付代价,而低延迟检索一开始就是自托管的重点。

所以内存账单随两件事扩展:你有多少分块,以及每个向量多宽。

真实数字,大致地

量你自己的——维度和索引类型对这影响很大——但作为一个起步感觉:

一个也持有大索引的多代理系统,把两笔成本都叠在同一台机器上——那就是一个 32 GB 套餐悄悄变成一个 64 GB 的方式。

引擎选择,简述

如果你已经在跑 Postgres,pgvector 是最省事的选项——它是个扩展,不是一个要照看的新服务。当你有数以百万计向量、想要快速的过滤搜索时,一个像 Qdrant 或 Weaviate 的专用引擎配得上那个单独的进程。别在第一天过度工程;跑你已经在运营的,只在搜索真的变慢时再拆出去。

为什么费劲自托管

人们真去做这个的两个理由,都不是“为了省几美元”:

隐私。 Embeddings 不是抽象的——它们编码了它们来自的文本。你的文档、你客户的内容、你的内部笔记,变成向量、送到一个第三方的服务器上。自托管把那个留在一台你掌控的机器上。如果数据敏感到你还在用加密货币、无需 KYC 付款,一个托管向量云就把全部意义抵消了。

固定成本。 托管向量服务按存储的向量和跑的查询计费。VPS 是一个月一个数,你想多用力用它都行。规模一大,可预测胜过按量。

这对配置意味着什么

从量你的语料开始,不是靠猜。拿到你的 embedding 数量和维度、加载一个样本、盯着常驻内存、外推。然后挑一个给索引加周围一切留有余量的套餐——应用、模型客户端、增长的空间。

对任何超过一两百万私密持有向量的场景,Pro 系列跑 32 到 80 GB,带独立IP 和每夜备份,当索引就是产品、丢了它很痛时,这很要紧。

常见问题

为什么 RAG 需要这么多 RAM?

快速向量搜索想要索引常驻内存。每个文档分块变成一个 embedding——一个几百到几千个浮点数的向量——在数以百万计分块时这就累加起来。把索引推到磁盘上,搜索延迟就跳升;保住你自托管的全部理由(速度 + 掌控)意味着把它留在 RAM 里。

给定语料需要多少 RAM?

粗略感觉:几十万个 embeddings 在 2–4 GB 里没问题。一到几百万,加上周围的应用和操作系统,你就到 16–32 GB。数千万或高维向量,你就进入 48–80 GB,再往上就跨服务器拆。维度和索引类型对这影响很大,所以量你自己的。

pgvector 还是 Qdrant 这样的专用引擎?

如果你已经在跑 Postgres,pgvector 是最省事的路——一个扩展、一个数据库。对带重度过滤的数以百万计向量,一个专建引擎配得上它单独的服务。从你已经在运营的开始;只在搜索变慢时再换。

为什么自托管而不是一个托管向量服务?

两个真实理由:你的 embeddings 常常编码私有数据(文档、笔记、客户内容),自托管把那个留在一台你掌控的服务器上。而且它是固定成本——托管服务按向量和查询计价,VPS 是一个月一个数、没有按查询的账单。

← 返回博客查看套餐与价格 →

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。