High-memory & RAG
加密 VPS、通过 MCP 的 AI 代理、交易机器人托管,以及用 USDC/USDT 付款——无需KYC。
在 VPS 上自托管 LiteLLM 代理:一个 OpenAI 兼容端点接入所有模型
把 LiteLLM 装在你自己的 VPS 上,为每个应用和 agent 提供一个 OpenAI 兼容的 URL,路由到 OpenAI、Anthropic、Groq、本地 Ollama 等——你的密钥、预算和日志都留在你掌控的机器上。加密货币付款,无需 KYC。
大规模自托管 RAG:一个向量索引到底吃多少 RAM
RAG 演示在笔记本上跑。数以百万计 embeddings 的生产级 RAG 是一个内存问题。这是为什么索引想要 RAM、按语料规模的真实数字,以及团队一开始为什么自托管它。
私密地托管本地 LLM 推理:一台 CPU VPS 能做什么、不能做什么
在你自己的服务器上跑 Ollama 或 vLLM,让提示词不进服务商的日志。但 CPU 推理有硬限制。这是在一台大内存 VPS 上什么现实、什么需要 GPU,以及隐私优先的做法在哪里真正胜出。
为什么无需KYC 的大内存 VPS 比“每 GB 单价”算出来的贵
一台能用加密货币、不用证件租下的 32–80 GB VPS,跟主流主机的每 GB 单价一比显得贵。这是那个价格实际买到什么,以及什么时候它是错的选择。
面向 AI 代理的大内存 VPS:当你的机队真的需要那些 RAM
单个代理几乎不碰内存。十个持有共享状态的代理是另一码事。本文讲一支代理机队何时长到小机器装不下、每一档 RAM 到底买到多少,以及无需KYC 的大内存该放在哪。
一个 AI 代理到底需要多大的 VPS?一份配置指南
给 AI 代理、机器人和小型 LLM 配 RAM、CPU 和磁盘——用真实数字,不靠感觉。一个聊天代理、一个爬虫、一个交易机器人、一个本地模型各自需要多少,以及 CPU 机器从哪里开始不够用。
在 VPS 上为 AI 代理记忆托管一个向量数据库
用一个自托管的向量库给你的 AI 代理长期记忆。VPS 上的 pgvector vs Qdrant、embeddings 到底需要多少 RAM,以及怎么让你的数据不进第三方服务器。
用 Ollama 在 VPS 上自建本地 LLM——什么真的可行
用 Ollama 在 VPS 上跑你自己的 LLM:各模型真实的 RAM 数字、诚实的 CPU 速度预期、三条命令的安装,以及怎么通过 API 访问它。外加 CPU 机器到哪里为止、你会想要一块 GPU。