Ollama 让运行本地模型变成一行安装。这是操作指南;关于 CPU 推理能做什么、不能做什么(以及 RAG 的最佳落点)的坦诚说明,请看 面向 Ollama 的 VPS 用例 和 自托管 Ollama。
1. 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
这会安装 Ollama 并把它作为 systemd 服务启动,监听在 localhost:11434。
2. 拉取并运行一个小模型
在 CPU 机器上,从小开始:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B 模型在 CPU 上真正可用;7–8B 每秒几个 token(批处理还行,聊天很痛苦);13B+ 会换页并爬行——别用。
3. 调用 HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
嵌入是 CPU 的最佳落点:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. 保持在 localhost——需要时再安全暴露
Ollama 默认绑定到 127.0.0.1:11434。就让它留在那里。 如果你需要从另一台机器访问它,就在 专用 IP 套餐 上于前面放一个带认证的反向代理(nginx + HTTPS 指南)或使用 SSH 隧道——绝不要公开暴露未认证的模型端点。
坦诚的部分
这些是 纯 CPU 实例(没有 GPU)。小型量化模型和嵌入运行良好;大模型不行。把 Ollama 与 用于私有 RAG 栈的向量数据库 搭配——小型本地嵌入加本地向量存储,正是在这里真正出彩的组合。Medium(每月 $12,6 GB) 是舒适的套餐。大约一分钟拿到 root,无 KYC,用加密货币付款。
评论
暂无评论。来做第一个吧。