把每个提示都发给别人的 API 没问题——直到它有问题。也许数据敏感,你宁愿它永不离开你的服务器。也许你厌倦了速率限制、或一个模型版本在你脚下改变、或你在做实验时一个按 token 的计价器在滴答走。到某个点,“要是我干脆跑自己的呢?”就不再是个思想实验。
Ollama 让那件事真的很容易。更难的问题是什么能装进一台 VPS——而这里诚实的答案比炒作更重要。
在 CPU 上你实际能跑什么
没有 GPU?那你在做 CPU 推理,模型大小就是一切。量化(把权重压到 4-bit)是让这变得实际的关键——你损失一丝质量,省下一大堆内存。
大致数字,要紧的那些:
- 3B 模型,4-bit —— 约 3 GB RAM。对聊天和简单任务够利落。
- 7B 模型,4-bit —— 约 5 GB RAM。甜点:明显更聪明,还能以可读的速度跑。
- 13B 及以上 —— 8-10 GB+,在 CPU 上慢。技术上可行,实际上让人恼火。
说实话的速度:在几个 vCPU 上你会看到每秒几个 token。对一个聊天机器人或编码助手——你边读它边打字——完全没问题。对批处理一百万份文档就不行了——那是 GPU 的活,我们不假装不是。我们不提供 GPU 实例。 如果你的计划需要一个 70B 模型或重吞吐,一台 CPU VPS——我们的还是别家的——都是错的工具,你该在花一分钱之前就知道这点。
但一个回答你问题、从不往家打电话的私有 7B?那在一台 6 GB 的机器上跑得很舒服。
安装——三条命令
开一台服务器,SSH 进去,然后:
curl -fsSL https://ollama.com/install.sh | sh # 安装 Ollama
ollama run llama3.2:3b # 拉取 + 运行一个 3B 模型
就这样——你已经在终端里聊天了。要从你自己的代码里用它,Ollama 已经在 11434 端口上提供一个 HTTP API:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
一个值得先知道的坑:默认那个 API 绑在 localhost 上。保持这样、通过 SSH 隧道用,否则它就暴露到公网了。如果你想让它可达,把它放到鉴权后面——别在公网 IP 上留一个开放的模型端点。
挑机器
让套餐配模型,而不是反过来:
| 你想跑 | 你需要的 RAM | 合理的套餐 |
|---|---|---|
| 3B 模型,轻度使用 | 约 3 GB | Small (4 GB) |
| 7B 模型,舒服地跑 | 约 5-6 GB | Medium (6 GB) |
| 更大 / 高吞吐 | GPU 地界 | 不是 CPU VPS |
对多数自托管者,Medium (6 GB) 是诚实的推荐——给一个 7B 模型加你的应用和操作系统留足余量。Small (4 GB) 在你只用 3B 时可行。再低的,一旦操作系统和上下文吃进去就太紧了。
为什么在这里做
如果你在自托管一个 LLM,隐私通常是一半的理由——所以为了租机器交出你的证件就很奇怪。你不必:你能用 USDC 或 USDT 付款(或通过 on-ramp 用银行卡),无需 KYC,约一分钟服务器就是你的了。加密原生、对代理友好,数据留在一台你掌控的机器上。
取舍就是我们一直诚实说的那个:只有 CPU、6 GB 的上限、小模型。在这之内,自托管很棒。在这之外,别让任何人拿一台 CPU 机器卖给你一个需要 GPU 的活。
想试试?挑一个套餐、付款,你大约 60 秒就有 root——然后三条命令就到你自己的私有模型。
评论
暂无评论。来做第一个吧。