我有一个市场交易数据集,包括时间戳和货物如下。
约翰总是在超市买牛奶和面包。除此之外,他还购买了如下商品:
我们能否回答这个问题:“他星期四买什么?”
例如:他星期四除了买牛奶和面包外,还会买啤酒、鳄梨。
我应该用哪一种?监督或不受监督。
在这种情况下,我可以使用哪种模型来预测一组货物?
发布于 2016-07-19 07:42:53
由于您手上有一个事务数据集,我们在这里讨论的是明确的监督学习。虽然你当然可以尝试使用神经网络,但我认为,一旦你看到简单的算法失败了,你就应该开始使用更简单、更昂贵的算法(这通常是个好主意)。
现在形成你所描述的,你有一些时间序列数据,有一个分类的数量,你想要预测,你需要一些修改的ARMA模型。你可以为你感兴趣的每一种商品(如啤酒、巧克力、土豆等)建立一个逻辑回归模型。这将预测他是否会购买该产品。输入到模型中的变量是一组二进制观察,描述他是否在一天前、一周前、四周前购买了该产品,等等。玩那些滞后的游戏。物流回归的好处是,你马上就会看到购买的时间是多少。如果你看到一个星期前变量的系数很大,你知道他每周吃鳄梨等等。请注意,如果每周购买一些东西,它也每四周购买一次,因此您将遇到一些相关问题。
如果你没有正确的预测,你可以尝试不同的模型,例如树木或集合方法,如随机森林或增强树木。如果这些方法也不起作用,你可能会有一个没有明显周期性的时间序列。在这种情况下,您可以尝试以不同的方式设置变量,例如,使用他购买产品后的天数。
最后一个建议是:你可能需要检查购物之间的相关性。也许他会一起买鳄梨,西红柿和洋葱来做美味的鳄梨酱。如果他有一些洋葱剩菜,他可能会倾向于购买更多的鳄梨等。
https://datascience.stackexchange.com/questions/12661
复制相似问题