首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >将javascript应用于html以获取数千份文档的最快方法

将javascript应用于html以获取数千份文档的最快方法
EN

Stack Overflow用户
提问于 2019-08-01 17:55:20
回答 1查看 37关注 0票数 1

在应用了javascript之前,很多页面都不包含完整的html,我需要以完全“呈现”的形式爬行数千页上述html,但是不需要视觉方面的RAM智慧或cpu智慧被占用,

我现在正在使用的情况,暂时,WebBrowser控制.Net,缺点:呈现,完全浏览器

考虑到selenium,缺点:半满浏览器

最好的选择是phantomJS,它已经被停用了,是否有一个现代的等同物,只是这样做:

代码语言:javascript
复制
string s = "<html><label id="lo"></label><script>document.getElementById('lo').innerHTML = 'dog';</script></html>
";

s = Magic.Parse(s)
//s is now "<html><label id="lo">dog</label><script>document.getElementById('lo').innerHTML = 'dog';</script></html>
";

也许这是一个不好的例子,很好的例子,在像google和bing这样的页面上,他们这样做是为了减缓机器人请求,所以人们使用他们的API

任何推荐和帮助都很感激。

将是大约10万html文件。

EN

回答 1

Stack Overflow用户

回答已采纳

发布于 2019-08-01 18:07:32

你应该试试木偶师,它是一种无头铬,类似于PhantomJS,谷歌用来为内部和公共服务抓取和解析网站。

如果您需要一个可以与您的C#代码一起使用的库,您应该检查基于Chrome(开放源代码Chrome)的CEFSharp,并使用最后一个版本进行更新。

票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/57314571

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档