我正在尝试在Spark中执行最快的查找,作为一些练习滚动我自己的关联规则模块的一部分。请注意,我知道下面的指标,信心,在PySpark中是受支持的。length-two and greater itemsets .map(confidence)对于那些熟悉这种类型的查找问题的人,您将知道会引发这种类型的异常:
Exception: It appears that you are attempting to broadcast an RDD</em
然而,当我从AWS Cloudwatch查看Output时,输出中有许多对我来说并不重要的信息。(RDD.scala:324)at org.apache.spark.rdd.MapPartitionsRDD.compute(RDD.scala:324)
at org.apache.spark.rdd</e
:277) at org.apache.spark.rdd.RDD.iterator(RDD.scala:244) at org.apache.spark.rdd.UnionRDD.compute(UnionRDD.scala:87) )在org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:277) at org.apache.spark</e
我试图通过将用户的RDD映射到模型的recommendProducts方法来从MatrixFactorizationModel中提取预测。这给了我一个MapPartitionsRDD。然后,尝试减少或以其他方式访问此RDD会给我一个Spark异常。._import org.apache.spark.mllib.recommendation.For more information, see