首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >为什么nutch不抓取所有没有英文网站的链接?

为什么nutch不抓取所有没有英文网站的链接?
EN

Stack Overflow用户
提问于 2012-01-31 11:17:57
回答 2查看 316关注 0票数 0

我用nutch 1.4抓取一个站点,我知道nutch不会抓取这个站点中的所有链接。我没有过滤器,也没有爬行的限制规则。例如,nutch从不抓取此链接:

http://www.irna.ir/News/30786427/سوء-استفاده-از-نام-كمیته-امداد-برای-جمع-آوری-رای-در-مناطق-محروم/سياسي/

如果我把这个链接给nutch抓取,nutch永远不会抓取这个链接。这个网站是波斯语,而不是英语。如何抓取此链接?

EN

回答 2

Stack Overflow用户

发布于 2012-04-03 23:37:14

Nutch在将每个URL添加到crawldb之前,会对每个url运行url标准化和其他url处理。你的网址本身可能已经被过滤掉了。您可以从使用的插件列表中删除这些插件(conf/nutch-site.xml中的plugin.includes属性),然后重试。

票数 0
EN

Stack Overflow用户

发布于 2014-02-22 15:31:02

它可能无法获取非英语网址的一个原因是因为www.irna.ir的web服务器和使用的nutch客户端使用了不同的网址编码。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/9073932

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档