首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >如何使Heritrix在找到且不在种子列表中域上继续爬网过程

如何使Heritrix在找到且不在种子列表中域上继续爬网过程
EN

Stack Overflow用户
提问于 2011-10-03 02:14:48
回答 3查看 1.5K关注 0票数 0

如何使Heritrix继续抓取已找到且不在种子列表中的域名?

我的意思是让它不停止爬行在种子列表中的所有域名。并为它在爬行过程中找到的每个链接继续爬行过程。

EN

回答 3

Stack Overflow用户

发布于 2011-10-03 02:34:46

我上次使用Heritrix已经有一段时间了,但如果我没记错的话,你需要在你的设置/个人资料中更改max-link-hops。你把max-link-hops做得越大,你定义的种子产生的步数(“跳数”)就越多。

票数 1
EN

Stack Overflow用户

发布于 2011-10-03 15:56:52

默认情况下,Heritrix配置为仅对种子列表中的域上的URL进行爬网。一些额外的材料通常也被爬行,因为嵌入的材料,托管在其他地方,也被获取。

如果你想让Heritrix抓取它遇到的任何东西,你需要修改作用域。

作用域由一系列判定规则组成。每个规则都可以接受、拒绝或传递URL。接受或拒绝的最后一个规则获胜。通常,列表中的第一个规则是全盘拒绝所有,然后是一个SurtPrefixDecideRule,它在与SURT列表匹配的所有URL中进行规则。SURT列表通常是使用种子列表构建的。

但是,您可以手动配置SURT列表,指定您自己的列表,或者(如果您真的想要所有内容),您可以简单地删除它并拒绝所有规则,并在顶部添加接受所有决定规则。

More on configuring Heritrix 3 scoping.

票数 1
EN

Stack Overflow用户

发布于 2015-10-15 18:26:32

您还可以将surt decide规则'NotonDomains‘设置为true。这将爬行所有不在种子列表中的域。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/7628264

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档