首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >R中来自opensubtitles.org的网页抓取字幕

R中来自opensubtitles.org的网页抓取字幕
EN

Stack Overflow用户
提问于 2017-06-14 18:44:07
回答 0查看 1.7K关注 0票数 2

我是网络抓取的新手,目前正在为一个研究项目下载超过10万部电影的字幕文件。每部电影都有一个唯一的IMDb ID (即,“盗梦空间”的ID是1375666)。我在R中有一个包含102524个I的列表,我想从opensubtitles.org下载相应的字幕。

每部电影在网站上都有自己的页面,例如,《盗梦空间》有:

https://www.opensubtitles.org/en/search/sublanguageid-eng/imdbid-1375666

下载字幕的链接是通过单击表中名为“电影名称”的第一个链接来获得的,该链接会将您带到一个新页面,然后单击该页面上的“下载按钮”。

我正在使用rvest抓取页面,并且我已经编写了以下代码:

代码语言:javascript
复制
for(i in 1:102524) {
  subtitle.url = paste0("https://www.opensubtitles.org/en/search/sublanguageid-eng/imdbid-", movie.ids[i])

  read_html(subtitle.url) %>%
    html_nodes(".head+ .expandable .bnone")
  # Not sure where to go from here
}

任何关于如何做到这一点的帮助都将不胜感激。

编辑:我知道我在问一些相当复杂的问题,但任何关于从哪里开始的建议都会很好。

EN

回答

页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/44542519

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档