如何使Heritrix继续抓取已找到且不在种子列表中的域名?
我的意思是让它不停止爬行在种子列表中的所有域名。并为它在爬行过程中找到的每个链接继续爬行过程。
发布于 2011-10-03 02:34:46
我上次使用Heritrix已经有一段时间了,但如果我没记错的话,你需要在你的设置/个人资料中更改max-link-hops。你把max-link-hops做得越大,你定义的种子产生的步数(“跳数”)就越多。
发布于 2011-10-03 15:56:52
默认情况下,Heritrix配置为仅对种子列表中的域上的URL进行爬网。一些额外的材料通常也被爬行,因为嵌入的材料,托管在其他地方,也被获取。
如果你想让Heritrix抓取它遇到的任何东西,你需要修改作用域。
作用域由一系列判定规则组成。每个规则都可以接受、拒绝或传递URL。接受或拒绝的最后一个规则获胜。通常,列表中的第一个规则是全盘拒绝所有,然后是一个SurtPrefixDecideRule,它在与SURT列表匹配的所有URL中进行规则。SURT列表通常是使用种子列表构建的。
但是,您可以手动配置SURT列表,指定您自己的列表,或者(如果您真的想要所有内容),您可以简单地删除它并拒绝所有规则,并在顶部添加接受所有决定规则。
发布于 2015-10-15 18:26:32
您还可以将surt decide规则'NotonDomains‘设置为true。这将爬行所有不在种子列表中的域。
https://stackoverflow.com/questions/7628264
复制相似问题