先说实话:如果你想要快速、便宜、高质量的生成,去调一个 API。一台 CPU VPS 打不过一整机房的 GPU,任何跟你说反话的人都在卖东西。
那到底为什么要自托管推理?一个理由,而且是个好理由:你服务器上的模型从不把你的提示词发到任何地方。
CPU 推理实际是什么样
你能在有足够 RAM 的 CPU 上跑真实的模型。一个量化到 4-bit 的 7–8B 模型能行。一个 13B 能行。如果你有内存,你甚至能推一个 30B 级别的模型。你做不到的是让它快——输出以每秒几个 token 来,而不是 API 给你的那种即时的流。
那是诚实的取舍。对交互式聊天让人上火。对后台工作——连夜总结文档、给一个队列分类、按计划丰富数据——每秒几个 token 完全没问题,也没人盯着表。
RAM 的算账
模型得坐在内存里,量化与否,再加上上下文和运行时的开销:
- 7–8B,4-bit —— 大约 6–8 GB。在一个中档套餐上跑。
- 13B,4-bit —— 大概 10–16 GB。
- 30B 级别,量化 —— 24–48 GB,视量化而定。
- 更大、或更高精度 —— 你很快就到 64–80 GB——过了 80 GB 没有单台 Pro 机器装得下,而且仍然 CPU-慢。
这就是为什么“跑一个本地模型”悄悄变成一个大内存问题。模型就是那份内存占用。在同一台机器上加一个 RAG 索引或代理,数字就叠起来。
Ollama 与 vLLM,简述
Ollama 是简单的进门——安装、ollama run、完事。对一个你只想让模型可用的私有单用户配置,它是对的工具。vLLM 是为服务吞吐而建的:配置更多、在并发负载下更好、当你真的在处理量时值得。从 Ollama 开始;服务真实流量时再上 vLLM。
隐私优先在哪里真正胜出
自托管推理的理由不是速度或成本——而是有些数据不能离开。法律文件。医疗记录。专有代码。任何因政策或信任原因不能把提示词发给第三方 API 的东西。一个完全跑在你机器上的更慢模型,胜过一个记录你发给它的一切的快模型。
而如果数据那么敏感,付款大概也该是私密的。用加密货币、无需 KYC 租下机器,让整条链——服务器、模型、提示词、账单——都在任何人的身份记录之外。那才是真正的卖点:不是“更便宜的推理”,而是“没人能看到的推理”。
一句话
要速度和质量,用 API——不丢人。当隐私是要求、更慢可接受时自托管。按模型加它的上下文加机器上共享的别的东西来配置,别指望 CPU 有 GPU 的速度。
当模型需要真实的内存,Pro 系列跑 32 到 80 GB,带独立IP 和每夜备份——足以放下一个正经的量化模型,周围还有放上下文的空间。
评论
暂无评论。来做第一个吧。