EQVPS

如何在 VPS 上安装 Ollama(并调用其 API)

在 VPS 上安装 Ollama、拉取一个小模型并调用其 HTTP API——并坦诚说明这些是 CPU 机器,所以请坚持使用小型量化模型和嵌入。复制粘贴命令,以及如何安全地对外暴露。

Ollama 让运行本地模型变成一行安装。这是操作指南;关于 CPU 推理能做什么、不能做什么(以及 RAG 的最佳落点)的坦诚说明,请看 面向 Ollama 的 VPS 用例自托管 Ollama

1. 安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

这会安装 Ollama 并把它作为 systemd 服务启动,监听在 localhost:11434

2. 拉取并运行一个小模型

在 CPU 机器上,从小开始:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

3B 模型在 CPU 上真正可用;7–8B 每秒几个 token(批处理还行,聊天很痛苦);13B+ 会换页并爬行——别用。

3. 调用 HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

嵌入是 CPU 的最佳落点:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. 保持在 localhost——需要时再安全暴露

Ollama 默认绑定到 127.0.0.1:11434就让它留在那里。 如果你需要从另一台机器访问它,就在 专用 IP 套餐 上于前面放一个带认证的反向代理(nginx + HTTPS 指南)或使用 SSH 隧道——绝不要公开暴露未认证的模型端点。

坦诚的部分

这些是 纯 CPU 实例(没有 GPU)。小型量化模型和嵌入运行良好;大模型不行。把 Ollama 与 用于私有 RAG 栈的向量数据库 搭配——小型本地嵌入加本地向量存储,正是在这里真正出彩的组合。Medium(每月 $12,6 GB) 是舒适的套餐。大约一分钟拿到 root,无 KYC,用加密货币付款。

常见问题

如何在 VPS 上安装 Ollama?

一条命令:curl -fsSL https://ollama.com/install.sh | sh。然后 ollama pull 一个小模型并 ollama run 它,或在 localhost:11434 上调用 HTTP API。步骤在下方。在 CPU VPS 上请坚持使用小型量化模型(1B–8B)和嵌入——大模型需要 GPU。

模型在 CPU VPS 上会快吗?

小的会,大的不会。4 位量化的 7–8B 模型预计每秒几个 token,而 1–3B 模型和嵌入模型则真正流畅。非常适合后台任务、分类和 RAG 流水线——不适合在大模型上做快速交互式聊天。

我应该把 Ollama 的 API 暴露到互联网吗?

不要。把它保持在 localhost:11434。如果需要远程访问,在专用 IP 套餐上把它放在带认证的反向代理之后,或通过 SSH 隧道访问。绝不要把未认证的模型端点暴露到开放互联网。

我需要哪个套餐?

我们的 Medium(每月 $12,6 GB)能舒适地承载小模型和嵌入;Small($8)可用于测试 1–3B 模型。这些是纯 CPU 实例——没有 GPU——所以按模型的内存占用来选规格,而不是寄望于速度。

你们要身份证件或银行卡吗?

不要。注册用邮箱,用 USDC 或 USDT 付款——无文件、无卡。

评论

暂无评论。来做第一个吧。

发表评论

评论在显示前会经过审核。