爬虫是那种你启动一次、想让它跑上几周的东西——一个价格监控、一次研究性爬取、一个连夜填满的数据集。那不属于你的笔记本,而对很多人来说,它也不属于一个在给你 shell 之前要护照和卡的主机。一台你用邮箱注册、用加密货币付款的 VPS 正合适:始终在线、私密、属于你。
下面是用什么来跑它、怎么搭,以及一件多数指南跳过的、关于 IP 的诚实事。
为什么无需KYC 在这里真的要紧
大多数主机把你的账户绑到一张证件和一张卡上,并记录下来。对一个数据采集项目,那是你不需要的隐私泄露——你的基础设施最后跟你的名字和你的抓取活动挂了钩。用一个邮箱和加密货币付款,让项目和你的身份分开。对这类读者,那才是真正的吸引力,比价格更重要。
它也只是摩擦更小:为一次性爬取开一台机器、让它跑、拆掉——不用每次都跳一支账户验证之舞。
多大规格——以及你怎么付款
配置完全取决于你怎么抓:
- 纯 HTTP(Scrapy、
requests+ BeautifulSoup)。 轻。1–2 GB 内存能应付很多并发请求,因为你不渲染任何东西。 - 无头浏览器(Playwright、Puppeteer、Selenium)。 饿。每个 Chromium 实例吃 300–700 MB,所以 4 GB 是合理的下限,并行跑几个就更多。这是一台抓取机器需要真实 RAM 的常见原因。
关于付款:用一个邮箱注册、用 Base 或 Ethereum 上的 USDC 或 USDT 付款——不用卡、不用文件。银行卡也能用,但 on-ramp 有约 $27 的最低额,所以对便宜套餐,一次充一小笔余额、从里面扣更顺。
对服务器,NAT 就够——爬虫只发出站调用。只有当你还托管某个入站的东西(一个提供你采集数据的 API)时,才选独立IP。
让它跑起来
SSH 进去、搭好你的工具链。一个无头浏览器的例子,因为那是更难的情形:
sudo apt update && sudo apt install -y python3-venv
mkdir ~/scraper && cd ~/scraper
python3 -m venv venv && source venv/bin/activate
pip install playwright && playwright install --with-deps chromium
# 或者一个轻量栈: pip install scrapy beautifulsoup4 httpx
# scrape.py —— 无头抓取
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
b = p.chromium.launch()
page = b.new_page()
page.goto("https://example.com")
print(page.title())
b.close()
对一次要跑几个小时的爬取,别把它留在一个 SSH 会话里——用一个 systemd 服务(或做快速跑用 tmux)把它包起来,这样它熬过断开和重启,和让任何进程保活是同一个套路。如果是一个 AI 代理在驱动抓取,它甚至能通过 MCP 自己租下这台机器。
关于 IP 的诚实部分
这是多数“最佳抓取 VPS”帖子夸大的地方。一台 VPS 给你一台带一个出站 IP 的服务器。那对跑爬虫很完美——一台干净、专属、始终在线的机器。它不是一个代理服务,一个 IP 也绕不过一个按地址封禁或限速的目标。
如果你在大规模抓取、撞到封禁,解法是在你请求前面放一个单独的代理/轮换服务商——VPS 跑你的代码,代理层处理 IP。两个不同的活。任何跟你说一台机器能解决大规模 IP 封禁的人,都在卖给你东西。
而且负责任地抓:尊重 robots.txt、节流你的请求速率、待在你所采集内容的条款之内。一个有礼貌的爬虫比一个贪婪的被封得少得多。
注意事项
- 纯 CPU、一个地区(德国)。 对抓取逻辑和无头浏览器没问题;如果你特别需要 GPU 或某个特定地理位置,先知道这点。
- 用浏览器时盯住 RAM。 一个泄漏的 Playwright 循环会吃掉机器——关掉页面和上下文、给并发设上限。
- 它是一台服务器,不是一个魔法匿名器。 无需KYC 让账户私密;你的请求在目标看来是什么样,取决于你(和你的代理层)。
在这之内,一台无需KYC VPS 是一个干净、私密、让爬虫一直跑下去的家。挑一个套餐、用加密货币付款,几分钟内让你的采集器上线。
评论
暂无评论。来做第一个吧。