夏日炎炎 — 万物皆化,连我们的价格也在融化。−25%所有年付套餐 −25%,截至 8 月 31 日查看套餐
EQVPS

用于大规模自建 RAG 的 VPS

一旦语料库变得真实,检索增强生成(RAG)就不再是笔记本上的 demo。向量索引需要内存,而你的 embeddings 就是你的私有数据。这里给出规格测算,以及为什么高内存、无需KYC的主机正合适。$55/月起。

在笔记本上拿两百份文档做的 RAG demo,感觉毫不费力。可一旦你把它对准一个真实的语料库——一家公司的文档、多年的工单、一个真正的知识库——整件事就变成了一个内存问题。不是 CPU 问题,是内存问题。

这里有个大多数主机页面都略过的点:**快速检索需要把索引放在 RAM 里。**每一块文本都会变成一个 embedding——一个几百到几千个数字宽的向量——而搜索意味着把你的查询快速地与它们全部比对。放在磁盘上也能用,但每次查询都要交一笔延迟税,而低延迟检索本来就是你选择自建的原因。

老实算一算规格

去测你自己的语料库——维度和索引类型会让结果差很多——不过先给个大致感觉:

如果你想看细节,我们在这里写出了完整的内存曲线

为什么高内存无需KYC要凑在一起

租 48 GB 内存很容易。用加密货币、不做身份核验地租下来就不容易了——大多数便宜卖大内存的主机商,背后都要一张银行卡和一份 KYC 表单。你的 embeddings 不是抽象的数字;它们编码着自己来源的那些文本。你的文档、你客户的内容,都变成了向量。如果这些数据敏感到你要私密付款的地步,那么一个托管的向量云会让这一切前功尽弃——一个把服务器绑到你身份上的主机商也一样。

这一组合——高内存、独立IP、加密货币、无需KYC、每晚备份——正是 Pro 系列的用武之地。它不是每 GB 最便宜的,如果你不需要隐私,别处能找到更便宜的内存。但如果索引就是你的产品、而且它不能外流,这就是合适的形态。

从哪里开始

选一个能容下索引以及它周边一切(应用、模型客户端、增长空间)的套餐。对大多数真实语料库来说,那就是 Pro-48(48 GB);大的则上 Pro-64 或 Pro-80。先加载一个样本,盯住内存,按你实测到的数字来定规格——而不是你担心的那个数字。

如果你的检索是一个更大的 AI 代理系统的一部分,同一台机器往往还会装下整个代理集群——一个 48 GB 的套餐就是这样悄悄变成 64 GB 的。

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

我的 RAG 部署到底需要多少内存?

它随 embedding 数量和向量宽度而变化。几十万个文本块用 2–4 GB 就够;几百万个,加上周边的应用和操作系统,落在 16–32 GB;几千万个则会推到 48 GB 以上。先测一个样本,盯住常驻内存,再外推——别往高了猜,那只会让你多付钱。

为什么不用托管的向量服务?

人们真正自建的两个理由:你的 embeddings 编码着私有数据(文档、笔记、客户内容),所以把它们放在一台你掌控的机器上很重要;另外成本是固定的——托管服务按向量数和查询数计费,而 VPS 是一个每月固定的数字,你想怎么压榨都行。

用 pgvector 还是专用引擎?

如果你已经在跑 Postgres,pgvector 是最省事的路子——一个扩展搞定。对于要做大量过滤的百万级向量,像 Qdrant 这样的专用引擎值得单独跑一个服务。先用你手头已经在运维的东西;等到搜索变慢了再拆分出去,别提前。

做 RAG 需要 GPU 吗?

不需要。检索是 CPU + RAM 的活儿——比对向量,而不是生成文本。生成那一步会去调用你的 LLM(一个 API,或者一台单独的模型主机)。对于检索这一半,高内存 CPU 服务器正是合适的形态。

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。