我正在爬行一个网站并保存链接到“page”项字段中每个页面的url,以便稍后重建站点树。一种简单的方法是访问response.request.Header‘referer’,这是请求的引用标头。这个标头真的可靠吗?也就是说,对于由Scrapy生成的请求,它总是存在吗?或者它是否可能不准确/不存在于请求中?
发布于 2015-01-07 21:24:21
是的,默认情况下有一个启用的RefererMiddleware
RefererMiddleware
根据生成请求的响应的URL填充请求引用标头。
喂,这是实施。
https://stackoverflow.com/questions/27828477
相似问题