په ستاسو laptop یو scraper سم دی تر هغه چې تاسو یې د یوې چلونې په منځ کې بند کړئ، ستاسو کور IP rate-limit شي، یا تاسو غواړئ همدا job هره ساعت وچلیږي که تاسو ویښ یاست که نه. دا یوې VPS ته حرکت درې واړه سموي: دا ۲۴/۷ پورته پاتې کیږي، ستاسو د کور IP شهرت نه سوځوي، او cron یا یو systemd timer یې په مهالویش ستاسو پرته چلوي. دلته دی چې څنګه یې تنظیم کړئ، تاسو واقعاً څومره سرور ته اړتیا لرئ، او هغه برخې چې ډیری لارښودونه یې په ارامۍ پریږدي.
ولې یو VPS ستاسو ماشین د دې لپاره ماتوي
- ۲۴/۷ او مهالویش شوی. یو scraper چې ساعتنی چلیږي یو کوربه ته اړتیا لري چې تل فعال وي. یو laptop نه دی.
- ستاسو کور IP پاک پاتې کیږي. د کور څخه scraping پدې معنی چې ستاسو residential IP rate-limitونه او بلاکونه اخلي. دا له یوه سرور وکړئ او ستاسو خپل پیوستون نه لمس شوی پاتې کیږي.
- ثبات. هیڅ ویده کیدل نشته، د یوه crawl په منځ کې هیڅ wifi پریوتل نشته، یو ثابت datacenter پیوستون، او د پایلو د راټولولو یو ځای.
stack، او هره برخه څه ته اړتیا لري
دوه ډیر مختلف د وزن ټولګي، او د ناسم پلان ټاکل پیسې ضایع کوي یا job وږی کوي:
- httpx / requests (Python) — د APIونو، JSON endpointونو، او جامد HTML لپاره. دا سپک دی: پروسس په لسګونو megabytes کې ناست وي، network-محدود، نه CPU-محدود. یو $3 Nano (1 vCPU / 1 GB) دا په آرامۍ چلوي، حتی د
asyncioله لارې د concurrency سره. - Playwright / headless Chromium — د JavaScript-render شوو سایټونو لپاره چیرته چې تاسو یو ریښتیني browser ته اړتیا لرئ. دا درنه ده. Headless Chromium نږدې 300–400 MB د هر browser instance، سربیره 100–200 MB د هر خلاص context/tab، سربیره ستاسو runtime دی. بودجه:
- $5 Micro (2 vCPU / 2 GB) — یو یا دوه browser contextونه یو ځل.
- $8 Small (4 vCPU / 4 GB) — څو موازي contextونه، یا درانه پاڼې.
د ګوتې قاعده: ستاسو کوډ نږدې هیڅکله خنډ نه دی — Chromium دی. د browser لپاره اندازه کړئ، نه scraper لپاره.
مهالویش: systemd timer د cron پر ځای
cron کار کوي، خو یو systemd timer په یوه سرور چې تاسو یې ساتئ غوره ډیفالټ دی: د journalctl له لارې logونه، catch-up که box کوز و، او تفتیش وړ د-هر-چلونې حالت. یو لږترلږه تنظیم:
# /etc/systemd/system/scrape.service
[Unit]
Description=Run scraper
[Service]
Type=oneshot
User=scraper
WorkingDirectory=/home/scraper/job
ExecStart=/home/scraper/job/venv/bin/python scrape.py
# /etc/systemd/system/scrape.timer
[Unit]
Description=Hourly scrape
[Timer]
OnCalendar=hourly
Persistent=true
[Install]
WantedBy=timers.target
sudo systemctl enable --now scrape.timer
journalctl -u scrape.service -f # watch runs
Persistent=true هغه څه دي چې cron یې نشي کولی: که سرور د چلونې پر مهال کوز و، job یو ځل په boot فایرکوي د دې پر ځای چې په ارامۍ یې پریږدي.
پایلې چیرته ځي
دا ساده وساتئ او د حجم سره یې سم کړئ: SQLite د جوړښتلرونکي ډیټا لپاره چې تاسو یې query کوئ (یو فایل، صفر تنظیم)، CSV د چټکو tabular dumpونو لپاره، یا یو S3-سره سمون object store کله چې پایلې box ماتوي یا تاسو یې off-server غواړئ. خپل logونه وچرخوئ (logrotate یا د journald حدونه) نو یو فلسفي scraper په وروورو ديسک نه ډکوي.
ریښتینې برخه: egress IP او شهرت
دا هغه جزئیات دی چې پریکړه کوي ایا ستاسو scraper د یوې اونۍ لپاره کار کوي یا په لومړۍ ورځ بندیږي.
په یوه NAT پلان، بهرته ترافیک یو egress IP د نورو پیرودونکو سره شریکوي. د هغه IP شهرت شریک دی — یو ګاونډی چې همدا هدف scrape کوي کولی شي پته rate-limit شي مخکې له دې چې تاسو یو واحد request ولیږئ. د سپک، کله ناکله scraping لپاره سم؛ په مقیاس یوه ذمهواري.
یو dedicated IP تاسو ته ستاسو خپل egress شهرت درکوي — د بل هیڅ چا چلند یې نه اغیزمنوي. خو دا دواړه لوري ته کوي: تیز scraping ستاسو خپل پاک IP سوځوي، او یو ځل چې یو هدف یې بند کړي، دا بند دی. یو dedicated IP کنټرول دی، نه معافیت.
په ریښتیني مقیاس، تاسو بهرني proxy poolونه ته اړتیا لرئ. هیڅ واحد IP — شریک یا dedicated — نشي کولی بار د ډیرو پتو په اوږدو کې وویشي، چې هغه څه دي چې جدي scraping د IP-rate-limited هدفونو په وړاندې غواړي. Proxyونه یو عمومي، third-party طبقه ده چې تاسو یې پر سر اضافه کوئ؛ VPS scraper چلوي، proxy pool پتې ورکوي. تمه مه کوئ چې یو د سرور IP د یوه proxy pool دنده وکړي.
اخلاق او AUP — اختیاري نه دي
Scraping په یوه قانوني او اخلاقي خړه سیمه کې اوسیږي، نو یې روښانه وګورئ:
- rate limitونه او robots.txt ته درناوی وکړئ. خپل requestونه محدود کړئ. یو ادب scraper د ترافیک په څیر ښکاري؛ یو بېادب یو د برید په څیر.
- خپل هدف DoS مه کوئ. د یوه سایټ سوځول تر هغه چې پریوځي scraping نه دی، دا denial-of-service دی — او دلته د منلو وړ کارونې سرغړونه ده چې خدمت پای ته رسوي.
- یوازې هغه scrape کړئ چې اجازه یې لرئ. قانوني، اجازه شوې د ډیټا راټولونه کرښه ده. ترې تیر شئ او دا ستاسو په غاړه ده.
کتاکلی
یو VPS د یوه scraper لپاره سم کور دی: تل-فعال، مهالویش شوی، او ستاسو له کور IP لرې. پلان stack ته سم کړئ — $3 Nano د httpx، $5 Micro تر $8 Small د Playwright — د یوه systemd timer سره مهالویش وکړئ، او د IPونو په اړه ریښتیني اوسئ: شریک egress شهرت شریکوي، یو dedicated IP ستاسو د جوړولو یا سوځولو دی، او ریښتینی مقیاس proxy poolونه معنی لري. لومړی box د نوي-VPS د امنیت checklist سره قفل کړئ، دا د VPS اندازهکولو لارښود په کارولو سم اندازه کړئ، او که د پرته-له-کارت تادیې محرمیت مهم وي، د ناشناخته VPS ماتونه ریښتینې نسخه ده. په مسؤلانه توګه scrape وکړئ — AUP ریښتینی دی.
د scrape کولو لپاره چمتو یاست؟ یو Micro پلان یو کلک پیل دی؛ لوی موازي crawlونه په Small غوره کوي.
تبصرې
لا تبصرې نشته. لومړی اوسئ.