首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >如何在<body>中方便地提取嵌入到html页面中的网页内容?

如何在<body>中方便地提取嵌入到html页面中的网页内容?
EN

Stack Overflow用户
提问于 2009-11-26 18:30:45
回答 4查看 304关注 0票数 0

如何轻松提取网页的内容,其中只嵌入在html页面内(如img,pdf,flv,doc,rtf,wmc等),而不是css和css背景图片,javascript。

我正在将旧网站的内容迁移到新网站。重新上传所有图片,链接的pdf,flv等。

EN

回答 4

Stack Overflow用户

发布于 2009-11-26 18:35:24

如果您使用过XHTML,那么可以使用普通的XML解析器。

票数 1
EN

Stack Overflow用户

发布于 2009-11-26 18:53:40

BeautifulSoup类op python是一个非常好的解析器,在执行这样的操作时非常方便。

票数 1
EN

Stack Overflow用户

发布于 2009-11-26 18:33:50

为此,您需要一个HTML解析器。在Perl中,有HTML::Parser模块。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/1802871

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档