我正在试着从这个网站上抓取所有的新闻。它们没有在源代码中显示:http://www.uvm.dk/aktuelt
我试过使用Firefox的实时Http头文件和Chrome的开发工具,但仍然不能理解幕后发生的事情。我相信这很简单:-)
我有这些信息,但是我如何使用它们来抓取想要的新闻呢?
请求方法:POST
连接:保持活动的PageId=8938bc1b-a673-4513-80d1-e1714ca93d7c&Term=&Years%5B%5D=2017&WorkAreaIds=&SubjectIds=&TemplateIds=&NewsListIds%5B%5D=Emner&TimeSearch%5BEvaluation%5D=&FlagSearch%5BEvaluation%5D=Alle&DepartmentNames=&Letters=&RootItems=&Language=da&PageSize=10&Page=1
有人能帮上忙吗?
发布于 2017-05-09 16:52:28
不是直接的回答,而是一些提示。
你使用livehttpheaders的方法很好。在加载首页前打开侧边栏,清除所有。然后加载主页和一篇文章。因为图片,css和js,通常会有大量的http请求。但是你会发现有几个是有用的。通常第一个是主页,下面的某个地方是文章主页。另一个有趣的是当你点击下一页的时候。
我喜欢将下载(HTTP)和抓取(HTML或JSON等)解耦。我用第一个脚本下载到一个文件,然后用第二个脚本丢弃。首先,因为我希望能够在不反复下载的情况下调整抓取。其次,因为我更喜欢用bash+curl下载,而用python+lxml下载。如果我需要抓取信息来继续下载,我的抓取脚本会在控制台上输出这些信息。
https://stackoverflow.com/questions/43864051
复制相似问题