我正在爬行一个网站,并解析一些content+images,然而,即使是100页左右的简单网站,它也需要几个小时才能完成这项工作。我正在使用以下设置。任何帮助都将不胜感激。我已经看过这个问题了-- Scrapy 's Scrapyd too slow with scheduling spiders,但不能获得太多的洞察力。
EXTENSIONS = {'scrapy.contrib.logstats.LogStats': 1}
LOGSTATS_INTERVAL = 60.0
RETRY_TIMES = 4
CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 12
CONCURRENT_ITEMS = 200
DOWNLOAD_DELAY = 0.75发布于 2012-08-14 21:20:39
您确定网站响应正常吗?
设置DOWNLOAD_DELAY = 0.75将强制请求是连续的,并在它们之间添加0.75秒的延迟。如果你移除它,你的爬行肯定会更快,但是,每个域名有12个并发请求,请注意不要太咄咄逼人地攻击网站。
即使有延迟,它也不应该花费几个小时,所以这就是为什么我想知道网站是否缓慢或没有响应。一些网站会对机器人这样做。
https://stackoverflow.com/questions/11945159
复制相似问题