我正在尝试抓取一个网站使用python的Scrapy框架。但我要去拿验证码。服务器使用Distil netwrok bot检测来实现bot检测。有什么办法可以解决这个问题吗?
发布于 2020-04-05 22:38:46
我个人把它淹没在代理中。4个请求的1个代理之前被阻止,然后我更改了代理。我有数万个免费的代理,所以这不是一个大问题。但是速度不是很快,所以我将并发数设置为1k左右。
发布于 2016-02-11 11:08:16
你可以使用像Selenium这样的工具来克服它。它是一个web测试框架,可以自动加载web浏览器来模拟普通用户。页面加载后,您可以使用Scrapy或Bs4等工具抓取内容。继续加载下一页,然后抓取。它比普通的刮刀速度慢,但它能完成这项工作,并能通过大多数探测器,如Incapsula。
希望这能有所帮助。
https://stackoverflow.com/questions/35314206
复制相似问题