我是用文字袋模型分类的。我读了800个文本文件,每一个都包含一个句子。
然后,这些句子的表述如下:
[{"OneWord":True,"AnotherWord":True,"AndSoOn":True},{"FirstWordNewSentence":True,"AnSoOn":True},...]我的数据有多少维度?
这是最大向量中的条目数吗?或者是唯一的单词数量?还是别的什么?
发布于 2016-11-07 23:15:23
对于每个文档,单词包模型都有一组稀疏特性。例如(在示例中使用您的第一句):
OneWord
AnotherWord
AndSoOn以上三个是文档的三个active特性。它是稀疏的,因为我们从来没有显式地列出这些inactive特性,而且我们有一个非常大的词汇表(您认为所有可能的惟一单词都是特性)。换句话说,我们没有说:
OneWord
AnotherWord
AndSoOn
FirstWordNewSentence: false我们只包括那些“真”字。
我的数据有多少维度?这是最大向量中的条目数吗?或者是唯一的单词数量?还是别的什么?
如果坚持使用稀疏特性表示,则可能需要估计每个文档的活动功能的平均数量。在您的示例中,这个数字是2.5 ((3+2)/2 = 2.5)。
如果使用密集表示(例如,one-hot encoding,这不是一个好主意,尽管词汇表很大),输入维度与词汇表大小相等。
如果使用具有100维的word嵌入,并将所有单词的嵌入组合成一个新的输入向量来表示文档,则输入维度为100。在本例中,通过嵌入将稀疏特性转换为密集的特性。
https://stackoverflow.com/questions/40464043
复制相似问题