我想开始将大量的原始HTML页面解析成语义数据结构。
只是对社区对各种可用工具的意见感兴趣,特别是各种语言的有用的库。
到目前为止,我计划使用Hadoop来管理大量的处理,但对替代方案很好奇。
发布于 2012-01-16 15:32:35
首先,您需要下载页面源代码,然后创建一个DOM树。如果使用C#编写代码,可以使用以下工具创建DOM树。
1) http://htmlagilitypack.codeplex.com/
2) http://www.majestic12.co.uk/projects/html_parser.php
第一个很容易使用,但第二个更快,对内存更友好,如果你想创建一个健壮的应用程序,我建议你使用第二个
然后,您可以使用以下命令从网页中提取有用的完整内容:
http://www.chrisspen.com/blog/how-to-extract-a-webpages-main-article-content.html
和许多其他文章,你可以找到通过谷歌从网页中提取内容(从网页中提取主要内容)
希望能有所帮助
https://stackoverflow.com/questions/3693237
复制相似问题