−25%

Windows 按年付费,截至 10 月 31 日。 查看套餐

EQVPS

用 Ollama 在 VPS 上自建本地 LLM——什么真的可行

2026年6月14日 · 1 分钟阅读 · EQVPS Team

把每个提示都发给别人的 API 没问题——直到它有问题。也许数据敏感,你宁愿它永不离开你的服务器。也许你厌倦了速率限制、或一个模型版本在你脚下改变、或你在做实验时一个按 token 的计价器在滴答走。到某个点,“要是我干脆跑自己的呢?”就不再是个思想实验。

Ollama 让那件事真的很容易。更难的问题是什么能装进一台 VPS——而这里诚实的答案比炒作更重要。

在 CPU 上你实际能跑什么

没有 GPU?那你在做 CPU 推理,模型大小就是一切。量化(把权重压到 4-bit)是让这变得实际的关键——你损失一丝质量,省下一大堆内存。

大致数字,要紧的那些:

说实话的速度:在几个 vCPU 上你会看到每秒几个 token。对一个聊天机器人或编码助手——你边读它边打字——完全没问题。对批处理一百万份文档就不行了——那是 GPU 的活,我们不假装不是。我们不提供 GPU 实例。 如果你的计划需要一个 70B 模型或重吞吐,一台 CPU VPS——我们的还是别家的——都是错的工具,你该在花一分钱之前就知道这点。

但一个回答你问题、从不往家打电话的私有 7B?那在一台 6 GB 的机器上跑得很舒服。

安装——三条命令

开一台服务器,SSH 进去,然后:

curl -fsSL https://ollama.com/install.sh | sh   # 安装 Ollama
ollama run llama3.2:3b                            # 拉取 + 运行一个 3B 模型

就这样——你已经在终端里聊天了。要从你自己的代码里用它,Ollama 已经在 11434 端口上提供一个 HTTP API:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

一个值得先知道的坑:默认那个 API 绑在 localhost 上。保持这样、通过 SSH 隧道用,否则它就暴露到公网了。如果你想让它可达,把它放到鉴权后面——别在公网 IP 上留一个开放的模型端点。

挑机器

让套餐配模型,而不是反过来:

你想跑你需要的 RAM合理的套餐
3B 模型,轻度使用约 3 GBSmall (4 GB)
7B 模型,舒服地跑约 5-6 GBMedium (6 GB)
更大 / 高吞吐GPU 地界不是 CPU VPS

对多数自托管者,Medium (6 GB) 是诚实的推荐——给一个 7B 模型加你的应用和操作系统留足余量。Small (4 GB) 在你只用 3B 时可行。再低的,一旦操作系统和上下文吃进去就太紧了。

为什么在这里做

如果你在自托管一个 LLM,隐私通常是一半的理由——所以为了租机器交出你的证件就很奇怪。你不必:你能用 USDC 或 USDT 付款(或通过 on-ramp 用银行卡),无需 KYC,约一分钟服务器就是你的了。加密原生、对代理友好,数据留在一台你掌控的机器上。

取舍就是我们一直诚实说的那个:只有 CPU、6 GB 的上限、小模型。在这之内,自托管很棒。在这之外,别让任何人拿一台 CPU 机器卖给你一个需要 GPU 的活。

想试试?挑一个套餐、付款,你大约 60 秒就有 root——然后三条命令就到你自己的私有模型。

常见问题

我能不用 GPU 跑 LLM 吗?

能,对小模型。一个 4-bit 量化的 3B 或 7B 模型能在 CPU 上跑,以可读的速度回答——对聊天机器人、编码助手,或你不盯着光标的后台任务都没问题。CPU 上做不了的是服务一个大模型(13B 以上)或推高吞吐;那时 GPU 就不再可选。

跑 Llama 7B 我需要多少 RAM?

一个 4-bit 的 7B 模型,加上上下文窗口和操作系统后大约 5 GB——所以一台 6 GB 的机器是舒服的下限。一个 3B 模型约 3 GB 装得下。更小的量化(Q4)用一点点质量换来少得多的内存,在 VPS 上这是对的取舍。

自建 LLM 比用 API 便宜吗?

看用量。托管 API 按 token 收费、闲置时不花钱;VPS 无论你用不用都是固定的月账单。如果你持续跑一串请求,或你主要在乎隐私和没有速率限制,自托管赢。对偶尔的一次性提示,按量 API 更便宜。

为什么自托管而不用云 API?

人们真去做的三个理由:数据从不离开你的服务器(对法律、医疗、或只是私人笔记是真实需求)、没有速率限制或按 token 的计价、模型不会在你脚下变化或被弃用。代价是你要管这台机器、并在它的硬件之内过活。

在一台 CPU VPS 上我实际能跑的最大模型是多大?

在一台 6 GB 机器上,4-bit 的 7B 模型是甜点。技术上你能用足够的 RAM 加载一个 13B,但在 CPU 上它慢到你会感觉到。再往上你就想要 GPU 了,那是另一种主机。

← 返回博客查看套餐与价格 →

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。