我正在尝试用tm-package创建一个来自LexisNexis的文章语料库。文章已从LexisNexis导出为.html,并使用tm.plugin.lexisnexis-package解析为R,如下所示:
> library("tm")
> library("tm.plugin.lexisnexis")
> src <- LexisNexisSource("~/Desktop/lexisnexis.html")按照tm.plugin.lexisnexis-documentation中的说明,然后使用tm-package创建一个语料库,如下所示:
> data <- Corpus(src, readerControl = list(language = NA))
Error in getNodeSet(tree, "//div[@class = 'c3']/p[@class = 'c1']/span[@class = 'c4']")[[1]] :
subscript out of bounds这个错误是什么意思,我该如何修复它?
示例html-data:link
发布于 2016-01-10 05:47:12
我是这个包的作者。因为LexisNexis使用的格式没有文档记录,所以它现在已经失效了。我会试着修复它,但如果有人提出补丁,它会更快发生。:-)
https://stackoverflow.com/questions/34636145
复制相似问题