我正在处理一个分类问题,在这个问题上,我想把商业邮件和个人电子邮件分开来分析他们的行为。我正在考虑使用regex,但在查看电子邮件后,我意识到电子邮件地址差异很大。虽然我可以手动识别一些带有明显商业名称的电子邮件,比如xxx@carsales.com.au,但很难系统地过滤这些电子邮件。有什么有用的技巧吗?Thx
发布于 2020-06-24 09:58:14
谢谢你澄清你的问题。
所以,根据我所得到的,你想从电子邮件(即文本)中预测用户的统计数据。如果您知道同一组电子邮件的一些人口统计数据,您可以通过以下方式执行一项监督任务:
如果您不知道人口统计学,那么您可以通过聚集聚类来构建客户配置文件:
在这里,您可以使用Doc2Vec (https://medium.com/wisio/a-gentle-introduction-to-doc2vec-db3e8c0cce5e)之类的方法将电子邮件编码成语义空间中的向量,然后在这些向量上使用聚集聚类(https://www.datanovia.com/en/lessons/agglomerative-hierarchical-clustering/)来查找用户集群。
以上是一种无监督的方法,您还可以在查看了生成的树状图之后,决定您认为需要多少客户配置文件。
https://datascience.stackexchange.com/questions/76523
复制相似问题