夏日炎炎 — 万物皆化,连我们的价格也在融化。−25%所有年付套餐 −25%,截至 8 月 31 日查看套餐
EQVPS

用于私有高内存 LLM 推理的 VPS

更大的量化模型需要真实的内存,而不是你没有的 GPU。一台高内存 CPU 服务器如何私密地运行 30B 级模型、什么是现实的、什么不是。$70/月起。

我们有一个专门讲 Ollama 和小模型的页面——那是一台 $12 的 CPU 服务器,跑 1B–8B 和 embeddings。本页讲的是另一端:那些大到让 RAM(而不是 CPU)成为瓶颈的模型。

先把话说在前头,跟别处一样:**我们的服务器只有 CPU,没有 GPU。**大模型在这里跑得慢。如果你要在 30B 模型上做快速的交互式对话,你需要一台 GPU 主机——那是另一种产品、另一家服务商。高内存 CPU 服务器真正擅长的,是私密地运行一个大的量化模型,去做那些不是聊天窗口的工作。

内存这笔账

模型(无论是否量化)都得放进内存,再加上上下文和运行时的开销:

所以「跑一个更大的本地模型」本质上是个高内存的问题。模型本身就是那份内存占用。在同一台主机上再加一个 RAG 索引,数字还会往上叠。

私有优先真正取胜的地方

关键不是速度,也不是成本——而是有些数据不能外流。法律文件。医疗记录。专有代码。任何把 prompt 发给第三方 API 都不可接受的场景。一个完全在你自己机器上运行的慢模型,胜过一个把你所发送的一切都记录下来的快模型。我们在这里写了完整的分析

而且如果数据敏感到这个地步,付款大概也应该是私密的。用加密货币、无需KYC租下这台机器,能让整条链——服务器、模型、prompt、账单——都不落到任何人的身份记录里。这就是卖点:不是更便宜的推理,而是别人看不到的推理。

怎么选

对于一个 30B 级、还要留出上下文空间的模型,Pro-64(64 GB)是舒适之选;更激进的量化能塞进 Pro-32 或 Pro-48,更大的则上 Pro-80。先把模型加载起来,盯住常驻内存,按你实测到的数字来定规格。也要摆正预期:这是私有的批处理推理,不是快速的聊天窗口。

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

这和你们的 Ollama 用例有什么区别?

Ollama 那一页讲的是一台 $12 的 CPU 服务器上的小模型——1B–8B、embeddings、轻量活儿。本页讲的是高内存那一端:13B 到 30B 级的量化模型,光是加载就要 24–48 GB 甚至更多。同样是只有 CPU 的现实,内存占用大得多,是另一档套餐。

某个模型需要多少 RAM?

模型必须放进内存,再加上开销。一个 13B 4-bit 模型大约要 10–16 GB;30B 级量化后会推到 24–48 GB;再往上或更高精度,就到了 64–80 GB——超过这个数,我们没有单台机器装得下。此外还要为上下文留出空间。

它快吗?

不快——这一点要对自己诚实。大模型上的 CPU 推理是每秒几个 token,而不是可交互的流式输出。用来做批处理和后台工作(通宵做摘要、给一个队列分类)没问题。要在大模型上做实时对话,你需要 GPU,而我们不提供。

为什么在这里跑,而不是用 API?

隐私。你的 prompt 和输出永远不会碰到某个服务商的服务器或日志。对于敏感数据——法律、医疗、内部代码——一个更慢的私有模型胜过一个看得见一切的快模型。再配上无需KYC的加密货币付款,整条链都归你自己。

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。