我用nutch 1.4抓取一个站点,我知道nutch不会抓取这个站点中的所有链接。我没有过滤器,也没有爬行的限制规则。例如,nutch从不抓取此链接:
http://www.irna.ir/News/30786427/سوء-استفاده-از-نام-كمیته-امداد-برای-جمع-آوری-رای-در-مناطق-محروم/سياسي/
如果我把这个链接给nutch抓取,nutch永远不会抓取这个链接。这个网站是波斯语,而不是英语。如何抓取此链接?
发布于 2012-04-03 23:37:14
Nutch在将每个URL添加到crawldb之前,会对每个url运行url标准化和其他url处理。你的网址本身可能已经被过滤掉了。您可以从使用的插件列表中删除这些插件(conf/nutch-site.xml中的plugin.includes属性),然后重试。
发布于 2014-02-22 15:31:02
它可能无法获取非英语网址的一个原因是因为www.irna.ir的web服务器和使用的nutch客户端使用了不同的网址编码。
https://stackoverflow.com/questions/9073932
复制相似问题