我的数据集如下。

主题栏是指邮件Subject和问题描述,问题详情栏是指邮件正文。
基于主题和电子邮件正文关键字,我需要对它应该属于哪个队列进行分类。
前面的队列列由25+不同的类别组成。
我的数据帧形状是(60697,4)。
请建议我需要遵循的分类方法。我需要使用哪些ML模型来训练数据和测试数据。
我知道一点使用自然语言标记化的概念。
分类更像gmail收件箱分类:主要分类、社交分类和促销分类。但是,在这里我必须将其归类为25+。
发布于 2018-02-22 20:08:42
我会尝试以下方法:
X矩阵。您可能想要测试不同的ngram_range,以便提高类的预测性,因此每个类都应该有一个整数-这将是您的y向量,并使用<代码>D17和<代码>D21和<代码>D22...<代码>H223<代码>G224将X拆分为X_train和X_test,并将y拆分为y_train和LogisticRegression模型。发布于 2018-02-23 20:09:01
你可以试一试FastText。这里有一个tutorial的链接。
Fasttext在监督分类的上下文中使用word embeddings的概念。使用快速文本的主要优点是,它的速度正如它的名字所说的那样快。它可以很容易地处理1000+类别/标签。
https://stackoverflow.com/questions/48926206
复制相似问题