我是网络抓取的新手,目前正在为一个研究项目下载超过10万部电影的字幕文件。每部电影都有一个唯一的IMDb ID (即,“盗梦空间”的ID是1375666)。我在R中有一个包含102524个I的列表,我想从opensubtitles.org下载相应的字幕。
每部电影在网站上都有自己的页面,例如,《盗梦空间》有:
https://www.opensubtitles.org/en/search/sublanguageid-eng/imdbid-1375666
下载字幕的链接是通过单击表中名为“电影名称”的第一个链接来获得的,该链接会将您带到一个新页面,然后单击该页面上的“下载按钮”。
我正在使用rvest抓取页面,并且我已经编写了以下代码:
for(i in 1:102524) {
subtitle.url = paste0("https://www.opensubtitles.org/en/search/sublanguageid-eng/imdbid-", movie.ids[i])
read_html(subtitle.url) %>%
html_nodes(".head+ .expandable .bnone")
# Not sure where to go from here
}任何关于如何做到这一点的帮助都将不胜感激。
编辑:我知道我在问一些相当复杂的问题,但任何关于从哪里开始的建议都会很好。
https://stackoverflow.com/questions/44542519
复制相似问题