我在R中有一个数据帧,我们称之为data。
其中一列data$tags包含字符串。每个字符串都是一个逗号分隔的标记列表(或与此条目相关的类别)。
我正在试图获取数据帧中所有可用标记的列表。
我想我可以使用其中一个apply函数在strsplit函数上运行列,并得到一个包含所有字符串部分的长连接向量,然后使用unique消除重复值。
我试过:
func_split_tags <- function(e) {
return(unlist(strsplit(e," ")))
}
all_tags <- sapply(as.vector(data$tags), func_split_tags)但这只是给了我一个分裂字符串向量的列表。
有人知道怎么做吗?
谢谢!
发布于 2016-03-30 02:34:11
这就是你要找的东西吗?
df <- data.frame(x = seq(1:10), s = 'I am in the city', stringsAsFactors = FALSE)
as.character(unlist(sapply(df$s, function(x) strsplit(x, ' '))))你可以写最后一行,就好像你不想要一个简单的strsplit
unlist(strsplit(df$s, ' '))发布于 2016-03-30 03:07:07
我们可以用str_extract来做这个
library(stringr)
unlist(str_extract_all(df$s, "\\w+"))https://stackoverflow.com/questions/36298574
复制相似问题