首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >使用Python进行Post API搜索

使用Python进行Post API搜索
EN

Stack Overflow用户
提问于 2017-05-09 15:45:32
回答 1查看 77关注 0票数 0

我正在试着从这个网站上抓取所有的新闻。它们没有在源代码中显示:http://www.uvm.dk/aktuelt

我试过使用Firefox的实时Http头文件和Chrome的开发工具,但仍然不能理解幕后发生的事情。我相信这很简单:-)

我有这些信息,但是我如何使用它们来抓取想要的新闻呢?

http://www.uvm.dk/api/search

请求方法:POST

连接:保持活动的PageId=8938bc1b-a673-4513-80d1-e1714ca93d7c&Term=&Years%5B%5D=2017&WorkAreaIds=&SubjectIds=&TemplateIds=&NewsListIds%5B%5D=Emner&TimeSearch%5BEvaluation%5D=&FlagSearch%5BEvaluation%5D=Alle&DepartmentNames=&Letters=&RootItems=&Language=da&PageSize=10&Page=1

有人能帮上忙吗?

EN

回答 1

Stack Overflow用户

发布于 2017-05-09 16:52:28

不是直接的回答,而是一些提示。

你使用livehttpheaders的方法很好。在加载首页前打开侧边栏,清除所有。然后加载主页和一篇文章。因为图片,css和js,通常会有大量的http请求。但是你会发现有几个是有用的。通常第一个是主页,下面的某个地方是文章主页。另一个有趣的是当你点击下一页的时候。

我喜欢将下载(HTTP)和抓取(HTML或JSON等)解耦。我用第一个脚本下载到一个文件,然后用第二个脚本丢弃。首先,因为我希望能够在不反复下载的情况下调整抓取。其次,因为我更喜欢用bash+curl下载,而用python+lxml下载。如果我需要抓取信息来继续下载,我的抓取脚本会在控制台上输出这些信息。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/43864051

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档