在应用了javascript之前,很多页面都不包含完整的html,我需要以完全“呈现”的形式爬行数千页上述html,但是不需要视觉方面的RAM智慧或cpu智慧被占用,
我现在正在使用的情况,暂时,WebBrowser控制.Net,缺点:呈现,完全浏览器
考虑到selenium,缺点:半满浏览器
最好的选择是phantomJS,它已经被停用了,是否有一个现代的等同物,只是这样做:
string s = "<html><label id="lo"></label><script>document.getElementById('lo').innerHTML = 'dog';</script></html>
";
s = Magic.Parse(s)
//s is now "<html><label id="lo">dog</label><script>document.getElementById('lo').innerHTML = 'dog';</script></html>
";也许这是一个不好的例子,很好的例子,在像google和bing这样的页面上,他们这样做是为了减缓机器人请求,所以人们使用他们的API
任何推荐和帮助都很感激。
将是大约10万html文件。
https://stackoverflow.com/questions/57314571
复制相似问题