Một scraper là loại thứ bạn khởi động một lần và muốn chạy hàng tuần — một trình theo dõi giá, một cuộc thu thập nghiên cứu, một tập dữ liệu tự lấp qua đêm. Cái đó không thuộc về laptop của bạn, và với nhiều người nó cũng không thuộc về một host muốn một hộ chiếu và một thẻ trước khi nó cho bạn một shell. Một VPS bạn đăng ký với một email và thanh toán bằng crypto vừa việc: luôn bật, riêng tư, và là của bạn.
Đây là chạy nó trên cái gì, cách thiết lập nó, và một điều trung thực về các IP mà hầu hết các hướng dẫn bỏ qua.
Vì sao không-KYC thực sự quan trọng ở đây
Hầu hết các host gắn tài khoản của bạn với một giấy tờ và một thẻ, và ghi log nó. Cho một dự án thu thập dữ liệu đó là một rò rỉ quyền riêng tư bạn không cần — hạ tầng của bạn kết cục liên kết với tên bạn và hoạt động scraping của bạn. Thanh toán với một email và crypto giữ dự án tách khỏi danh tính của bạn. Đó là sức hút thật cho đối tượng này, hơn giá.
Nó cũng chỉ là ít ma sát hơn: dựng lên một cỗ máy cho một cuộc thu thập một lần, để nó chạy, gỡ nó xuống — không điệu nhảy xác-minh-tài-khoản mỗi lần.
Kích cỡ nào — và bạn thanh toán thế nào
Chọn kích cỡ phụ thuộc hoàn toàn vào cách bạn scrape:
- HTTP thuần (Scrapy,
requests+ BeautifulSoup). Nhẹ. 1–2 GB RAM xử lý nhiều yêu cầu đồng thời vì bạn không render gì. - Trình duyệt headless (Playwright, Puppeteer, Selenium). Đói. Mỗi instance Chromium ngốn 300–700 MB, nên 4 GB là một mức sàn hợp lý, nhiều hơn nếu bạn chạy vài cái song song. Đây là lý do thông thường một cỗ máy scraping cần RAM thật.
Về thanh toán: đăng ký với một email và thanh toán bằng USDC hoặc USDT trên Base hoặc Ethereum — không thẻ, không giấy tờ. Một thẻ cũng hoạt động, nhưng on-ramp có mức tối thiểu ~$27, nên cho một gói rẻ mượt hơn khi nạp một số dư nhỏ một lần và rút từ nó.
NAT là đủ cho máy chủ — một scraper chỉ tạo các cuộc gọi đi ra. Bạn sẽ chọn một IP riêng chỉ nếu bạn cũng host một thứ gì đó đến (một API phục vụ dữ liệu bạn thu thập).
Đưa nó vào hoạt động
SSH vào và thiết lập chuỗi công cụ của bạn. Một ví dụ trình duyệt-headless, vì đó là trường hợp khó hơn:
sudo apt update && sudo apt install -y python3-venv
mkdir ~/scraper && cd ~/scraper
python3 -m venv venv && source venv/bin/activate
pip install playwright && playwright install --with-deps chromium
# hoặc một stack nhẹ: pip install scrapy beautifulsoup4 httpx
# scrape.py — fetch headless
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
b = p.chromium.launch()
page = b.new_page()
page.goto("https://example.com")
print(page.title())
b.close()
Cho một cuộc thu thập chạy hàng giờ, đừng để nó trong một phiên SSH — bọc nó trong một dịch vụ systemd (hoặc tmux cho một lần chạy nhanh) để nó sống sót qua các lần ngắt kết nối và khởi động lại, cùng mẫu giữ bất kỳ tiến trình nào sống. Nếu một AI agent điều khiển cuộc scrape, nó thậm chí có thể tự thuê cỗ máy qua MCP.
Phần trung thực về các IP
Đây là chỗ hầu hết các bài "VPS tốt nhất cho scraping" thổi phồng. Một VPS cho bạn một máy chủ với một IP đi ra. Điều đó hoàn hảo để chạy scraper — một cỗ máy sạch, chuyên dụng luôn bật. Nó không phải một dịch vụ proxy, và một IP sẽ không đưa bạn quanh một mục tiêu chặn hoặc giới hạn tần suất theo địa chỉ.
Nếu bạn scrape ở quy mô và gặp chặn, cách sửa là một nhà cung cấp proxy/xoay riêng ở phía trước các yêu cầu của bạn — VPS chạy mã của bạn, lớp proxy xử lý các IP. Hai việc khác nhau. Bất kỳ ai nói bạn một cỗ máy đơn giải quyết chặn IP quy mô lớn đang bán bạn một thứ gì đó.
Và scrape một cách có trách nhiệm: tôn trọng robots.txt, điều tiết tần suất yêu cầu của bạn, và ở trong các điều khoản của cái bạn thu thập. Một scraper lịch sự bị chặn ít hơn nhiều một cái tham lam.
Các lưu ý
- Chỉ CPU, một khu vực (Đức). Ổn cho logic scraping và các trình duyệt headless; nếu bạn cụ thể cần một GPU hoặc một địa lý cụ thể, biết điều đó trước.
- Canh RAM với các trình duyệt. Một vòng lặp Playwright rò rỉ sẽ ngốn cỗ máy — đóng các trang và context, giới hạn đồng thời.
- Nó là một máy chủ, không phải một trình ẩn danh thần kỳ. Không-KYC giữ tài khoản riêng tư; các yêu cầu của bạn trông thế nào với các mục tiêu là do bạn (và lớp proxy của bạn).
Trong đó, một VPS không-KYC là một ngôi nhà sạch, riêng tư cho một scraper cứ tiếp tục chạy. Chọn một gói, thanh toán bằng crypto, và có bộ thu thập của bạn online trong vài phút.
Hosting VPS ẩn danh: nó thực sự nghĩa là gì (và các giới hạn của nó) →
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.