首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >抓取整个网站内容

抓取整个网站内容
EN

Stack Overflow用户
提问于 2009-04-30 16:20:55
回答 2查看 1K关注 0票数 0

我正在将内容源指定为内部非sharepoint网站

例如http://internal.example.com

但是,一个完整的爬网只能在网站的根目录下抓取22个页面(有100个),除非我指定了‘自定义-指定页面深度和服务器跳数:’并将‘页面深度’和‘限制服务器跳数’保留为无限制

这让爬行变得精神错乱!

更新:我正在使用MS Search Server Express 2008

EN

回答 2

Stack Overflow用户

发布于 2009-04-30 17:07:54

Wget非常聪明。这是一个我用来递归快照站点的命令行。

wget -r -k -K --no-parent http://internal.example.com/

http://gnuwin32.sourceforge.net/packages/wget.htm

票数 2
EN

Stack Overflow用户

发布于 2009-04-30 16:29:31

您可能想要确切地指定您正在使用什么工具/技术来执行此爬行。另外,你有没有尝试过无限制以外的东西,结果是什么?

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/807786

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档