首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >决策树在推荐系统中的应用

决策树在推荐系统中的应用
EN

Stack Overflow用户
提问于 2014-04-05 16:21:45
回答 2查看 4K关注 0票数 1

我有一个在列(年龄,性别,时间,日期,视图,点击)上训练的决策树,它被分为两个类别-是或否-代表商品X的购买决策。使用这些值,我试图预测1000个样本(客户)的概率,这些样本看起来像('12',‘男性’,'9:30',‘星期一’,'10','3'),('50',‘女性’,'10:40',‘周日’,'50',‘50’,‘50’,'6') ........我想要获得个人概率或得分,这将帮助我识别哪些客户最有可能购买项目X。因此,我希望能够对预测进行排序,并仅向5个想要购买项目X的客户显示特定项目。我如何实现这一点?决策树能达到这个目的吗?有没有其他方法?我是ML的新手,所以请原谅我的词汇错误。

EN

回答 2

Stack Overflow用户

发布于 2014-04-06 01:46:37

使用具有小样本集的决策树,肯定会遇到过拟合问题。特别是在决策的较低级别,在树中,用于训练决策边界的数据将呈指数级减少。你的数据集应该有比类别数量多得多的样本,并且每个类别都有足够的样本。

说到决策边界,请确保您了解如何处理每个维度的数据类型。例如,“性别”是分类数据,其中“年龄”、“一天中的时间”等是实值输入(离散/连续)。因此,树的不同部分需要不同的公式。否则,你的模型最终可能会处理9:30,9:31,9:32...作为单独的类。

尝试其他一些算法,从简单的算法开始,比如k-近邻(KNN)。有一个验证集来测试每个算法。使用Matlab (或类似的软件),您可以使用库快速尝试不同的方法,并查看哪种方法效果最好。这里没有足够的信息来向你推荐一些非常具体的东西。另外,

我建议你也试试KNN。KNN能够捕获数据中的亲和性。比方说,20岁左右的人在晚上点击产品页面大约5次后就会购买产品X。KNN将能够告诉您每个新客户与购买该项目的客户的距离有多近。在此基础上,您可以选择前5个。非常容易实现,并作为更复杂方法的基准。

(假设浏览量和点击量意味着每个客户对产品X的点击量和浏览量)

票数 2
EN

Stack Overflow用户

发布于 2014-04-05 17:08:27

决策树是一个分类器,通常它不适合作为推荐系统的基础。但是,假设您只预测购买一件商品的可能性,而不是数万件,那么使用分类器是有意义的。

你只需给所有客户打分,并保留购买X的概率最高的5个客户,是的。这个问题还有什么要问的吗?

票数 1
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/22878408

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档