我们有一个专门讲 Ollama 和小模型的页面——那是一台 $12 的 CPU 服务器,跑 1B–8B 和 embeddings。本页讲的是另一端:那些大到让 RAM(而不是 CPU)成为瓶颈的模型。
先把话说在前头,跟别处一样:**我们的服务器只有 CPU,没有 GPU。**大模型在这里跑得慢。如果你要在 30B 模型上做快速的交互式对话,你需要一台 GPU 主机——那是另一种产品、另一家服务商。高内存 CPU 服务器真正擅长的,是私密地运行一个大的量化模型,去做那些不是聊天窗口的工作。
内存这笔账
模型(无论是否量化)都得放进内存,再加上上下文和运行时的开销:
- 13B、4-bit——大约 10–16 GB。用一个中档套餐就能跑。
- 30B 级、量化后——视量化程度而定,24–48 GB。这是 Pro-32 到 Pro-64 的地盘。
- 更大或更高精度——64–80 GB,超过 80 GB 我们没有单台机器装得下。Pro-80 就是这里的天花板。
所以「跑一个更大的本地模型」本质上是个高内存的问题。模型本身就是那份内存占用。在同一台主机上再加一个 RAG 索引,数字还会往上叠。
私有优先真正取胜的地方
关键不是速度,也不是成本——而是有些数据不能外流。法律文件。医疗记录。专有代码。任何把 prompt 发给第三方 API 都不可接受的场景。一个完全在你自己机器上运行的慢模型,胜过一个把你所发送的一切都记录下来的快模型。我们在这里写了完整的分析。
而且如果数据敏感到这个地步,付款大概也应该是私密的。用加密货币、无需KYC租下这台机器,能让整条链——服务器、模型、prompt、账单——都不落到任何人的身份记录里。这就是卖点:不是更便宜的推理,而是别人看不到的推理。
怎么选
对于一个 30B 级、还要留出上下文空间的模型,Pro-64(64 GB)是舒适之选;更激进的量化能塞进 Pro-32 或 Pro-48,更大的则上 Pro-80。先把模型加载起来,盯住常驻内存,按你实测到的数字来定规格。也要摆正预期:这是私有的批处理推理,不是快速的聊天窗口。
评论
暂无评论。来做第一个吧。