先把让人扫兴的部分说清楚,因为互联网上满是不肯这么做的页面。
我们的服务器是纯 CPU 的。我们不提供 GPU。 这意味着在这里做本地 LLM 的活儿有一个硬顶,假装不是这样只会白白浪费你的钱。
CPU 上真正跑得动的东西
有了最多 6 vCPU 和 6 GB 内存(我们的 Medium 套餐——$12/月),你就落在小型量化模型的范围里:
- 1B–3B 模型(Q4): 真的可用。对分类、打标签、路由和简单的结构化抽取来说,够快。
- 7B–8B 模型(Q4): 能跑,但预期每秒几个 token。对一个通宵嚼文档的队列来说没问题,当聊天窗口用就很痛苦。
- Embedding 模型: 绝佳契合。它们小、在 CPU 上快,而这大概是在我们这样的机器上跑 Ollama 的最好理由。
- 13B 及以上: 别。你会一边 swap 一边等。
如果你需要一个快速、交互式的 70B 聊天,你需要的是一台 GPU 主机——那是另一家服务商的另一种产品,与其收你 $12,我们宁愿告诉你这一点。
CPU 机器真正胜出的地方
隐私。 你的文档、你的提示词、你的 embedding——永远不离开一台你掌控的机器,永远不会变成别人的训练数据。对很多人来说这就是全部意义所在,每秒几个 token 是可以接受的代价。
成本可预期。 没有按 token 计费的账单。一条给五万条记录分类的流水线,和给五十条分类的,花的钱一样:$12。
异步工作。 大多数有用的 LLM 活儿都不是聊天窗口。它是一个队列:把这些做摘要、给那些打标签、把这一堆语料做 embedding。一台 CPU 机器通宵磨掉一批积压,干这个恰恰很在行。
搭建
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama 在 localhost:11434 上提供一个 HTTP API。把它留在那里。如果你需要从别处连它,就在一个独立IP套餐上,把它放到一个带认证的反向代理后面——永远不要把一个未认证的模型端点暴露到开放的互联网上。
把它和一个向量数据库配起来(Docker 里的 Qdrant 或 pgvector),你就在一台 $12 的机器上有了一整套私有 RAG 栈。那个组合——小型本地 embedding、本地向量库、只在繁重的生成那一步用外部 API——才是在这种硬件上真正说得通的配置。
怎么挑套餐
| 用途 | 套餐 | 价格 |
|---|---|---|
| Embedding、1–3B 模型、RAG 流水线 | Medium | $12/月 |
| 同上,再加一个带认证的公开端点 | Medium-IP | $20/月 |
| 只是测试小模型 | Small | $8/月 |
纯 CPU、最多 6 vCPU 和 6 GB 内存。NVMe 存储、流量不限量,德国或芬兰。加密货币付款,无需KYC。按年付款就是一笔转账,而不是十二笔。
延伸阅读
- 托管一个向量数据库作 AI 记忆 —— 私有 RAG 栈的另一半
- 用于 AI 代理的 VPS —— 在同一台机器上做编排
准备好了? 部署一台服务器 → —— 约一分钟内上线,加密货币付款,无需身份证件。
评论
暂无评论。来做第一个吧。