如何轻松提取网页的内容,其中只嵌入在html页面内(如img,pdf,flv,doc,rtf,wmc等),而不是css和css背景图片,javascript。
我正在将旧网站的内容迁移到新网站。重新上传所有图片,链接的pdf,flv等。
发布于 2009-11-26 18:35:24
如果您使用过XHTML,那么可以使用普通的XML解析器。
发布于 2009-11-26 18:53:40
BeautifulSoup类op python是一个非常好的解析器,在执行这样的操作时非常方便。
发布于 2009-11-26 18:33:50
为此,您需要一个HTML解析器。在Perl中,有HTML::Parser模块。
https://stackoverflow.com/questions/1802871
复制相似问题