−25%

Windows 按年付费,截至 10 月 31 日。 查看套餐

EQVPS

私密地托管本地 LLM 推理:一台 CPU VPS 能做什么、不能做什么

2026年8月9日 · 1 分钟阅读 · EQVPS Team

先说实话:如果你想要快速、便宜、高质量的生成,去调一个 API。一台 CPU VPS 打不过一整机房的 GPU,任何跟你说反话的人都在卖东西。

那到底为什么要自托管推理?一个理由,而且是个好理由:你服务器上的模型从不把你的提示词发到任何地方。

CPU 推理实际是什么样

你能在有足够 RAM 的 CPU 上跑真实的模型。一个量化到 4-bit 的 7–8B 模型能行。一个 13B 能行。如果你有内存,你甚至能推一个 30B 级别的模型。你做不到的是让它快——输出以每秒几个 token 来,而不是 API 给你的那种即时的流。

那是诚实的取舍。对交互式聊天让人上火。对后台工作——连夜总结文档、给一个队列分类、按计划丰富数据——每秒几个 token 完全没问题,也没人盯着表。

RAM 的算账

模型得坐在内存里,量化与否,再加上上下文和运行时的开销:

这就是为什么“跑一个本地模型”悄悄变成一个大内存问题。模型就是那份内存占用。在同一台机器上加一个 RAG 索引或代理,数字就叠起来。

Ollama 与 vLLM,简述

Ollama 是简单的进门——安装、ollama run、完事。对一个你只想让模型可用的私有单用户配置,它是对的工具。vLLM 是为服务吞吐而建的:配置更多、在并发负载下更好、当你真的在处理量时值得。从 Ollama 开始;服务真实流量时再上 vLLM。

隐私优先在哪里真正胜出

自托管推理的理由不是速度或成本——而是有些数据不能离开。法律文件。医疗记录。专有代码。任何因政策或信任原因不能把提示词发给第三方 API 的东西。一个完全跑在你机器上的更慢模型,胜过一个记录你发给它的一切的快模型。

而如果数据那么敏感,付款大概也该是私密的。用加密货币、无需 KYC 租下机器,让整条链——服务器、模型、提示词、账单——都在任何人的身份记录之外。那才是真正的卖点:不是“更便宜的推理”,而是“没人能看到的推理”。

一句话

要速度和质量,用 API——不丢人。当隐私是要求、更慢可接受时自托管。按模型加它的上下文加机器上共享的别的东西来配置,别指望 CPU 有 GPU 的速度。

当模型需要真实的内存,Pro 系列跑 32 到 80 GB,带独立IP 和每夜备份——足以放下一个正经的量化模型,周围还有放上下文的空间。

常见问题

我能不用 GPU 跑一个 LLM 吗?

小的量化模型,能——而且慢。一个量化到 4-bit 的 7–8B 模型在有足够 RAM 的 CPU 上跑,但你会以每秒几个 token 来衡量输出,而不是 API 给你的那种利落的流。对批处理和后台任务没问题,对交互式聊天就痛苦。

本地推理需要多少 RAM?

模型得装进内存加上开销。一个 7–8B 的 4-bit 模型想要约 6–8 GB;13B 大约 10–16 GB;30B 级别的模型量化后要 24–48 GB。再给上下文和机器上别的东西留空间。这就是为什么本地推理很快落进大内存地界。

Ollama 还是 vLLM?

Ollama 是简单的入口——一条命令、拉取模型、跑起来。vLLM 是给吞吐和服务的,配置更多、在负载下更好。对一台私有的单用户机器,Ollama 通常是对的;vLLM 当你真的在大量服务请求时。

既然更慢,到底为什么自托管推理?

隐私。你的提示词和输出从不碰服务商的服务器或日志。对敏感数据——法律、医疗、内部代码、任何你不能发给第三方的东西——一个更慢的私有模型胜过一个看得到一切的快模型。把它和无需KYC 的加密付款配起来,整条链都留在你手里。

← 返回博客查看套餐与价格 →

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。