我有一个txt文件,包含轨道ID,歌曲ID,艺术家名称和歌曲名称。我想把它转换成R中的数据帧来做一些分析。用于分离数据的好函数是什么?下面是数据集的顶部行。谢谢!
TRMMMKD128F425225D<SEP>SOVFVAK12A8C1350D9<SEP>Karkkiautomaatti<SEP>Tanssi vaan发布于 2020-06-03 05:18:24
我们可以使用read.table直接将文件作为数据读取,但是列之间的分隔符(sep)只能是一个字符。
因此,我们可以首先使用readLines读取文本文件,用单个字符('\t')替换使用gsub的'<SEP>',然后使用指定列名的read.table。
data <- read.table(text = gsub('<SEP>', '\t',
readLines('filename.txt'), fixed = TRUE),
col.names = c('TrackID', 'SongID', 'ArtistName', 'SongName'),sep = "\t")
data
# TrackID SongID ArtistName SongName
#1 TRMMMKD128F425225D SOVFVAK12A8C1350D9 Karkkiautomaatti Tanssi vaan发布于 2020-06-02 21:30:34
我们可以使用separate
library(tidyr)
separate(df1, 'Col1', into = c('TrackID', 'SongID', 'ArtistName', 'SongName'),
"\\<SEP\\>")发布于 2020-06-03 05:45:27
您可以使用readLines和strsplit。
rw <- readLines("X:/foo.txt")
nice.df <- setNames(as.data.frame(do.call(rbind, strsplit(rw, "<SEP>"))),
c("Track.ID", "Song.ID", "Artist.Name", "Song.name"))
nice.df
# Track.ID Song.ID Artist.Name Song.name
# 1 TRMMMKD128F425225D SOVFVAK12A8C1350D9 Karkkiautomaatti Tanssi vaan
# 2 TRMMMKD128F425225D SOVFVAK12A8C1350D9 Karkkiautomaatti Tanssi vaan
# 3 TRMMMKD128F425225D SOVFVAK12A8C1350D9 Karkkiautomaatti Tanssi vaan
# 4 TRMMMKD128F425225D SOVFVAK12A8C1350D9 Karkkiautomaatti Tanssi vaanfoo.txt内容:
TRMMMKD128F425225D<SEP>SOVFVAK12A8C1350D9<SEP>Karkkiautomaatti<SEP>Tanssi vaan
TRMMMKD128F425225D<SEP>SOVFVAK12A8C1350D9<SEP>Karkkiautomaatti<SEP>Tanssi vaan
TRMMMKD128F425225D<SEP>SOVFVAK12A8C1350D9<SEP>Karkkiautomaatti<SEP>Tanssi vaan
TRMMMKD128F425225D<SEP>SOVFVAK12A8C1350D9<SEP>Karkkiautomaatti<SEP>Tanssi vaanhttps://stackoverflow.com/questions/62161650
复制相似问题