首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >从HTML中提取文本的工具

从HTML中提取文本的工具
EN

Software Recommendation用户
提问于 2015-11-10 07:44:58
回答 1查看 195关注 0票数 3

有一个网站,我想从其中提取内容。到目前为止,我一直在Notepad++中使用Regex,但是

  1. 我们都知道我们不应该使用Regex解析HTML
  2. 由于网站的重新设计,Regex几乎是不可能正确的。

我读过一些可能的答案-- 123.4. --但它们都归结为Python+Scrapy或JSoup。

  1. 我在找一个非程序员的工具
  2. 允许用户直观地选择元素(在呈现的HTML中不一定,也可以在HTML源代码中)
  3. 构造一个"XPaths“列表(或类似的,XML XPath理解可用)
  4. 之后,可以在计划作业中不使用GUI重新运行提取。

其他所需经费

  1. Windows或Ubuntu
  2. 商业解决方案是可以的
EN

回答 1

Software Recommendation用户

发布于 2015-12-03 10:35:04

非程序员工具构建了一个"XPaths“列表。

几乎矛盾的要求,但仍然是一些突出的刮擦软件都是好的。见清单:

他们的简短描述

票数 -1
EN
页面原文内容由Software Recommendation提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://softwarerecs.stackexchange.com/questions/26343

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档