scala> rdd
res87: org.apache.spark.rdd.RDD[String] = MapPartitionsRDD[3] at textFile at <console>:24完成后,我将检查Spark的存储页面。它显示我缓存的分数仅为2%,内存中的大小为6.5MB。然后,我在RDD上调用'count‘操作。之后,当我检查Spark存储页面时,我突
我使用spark是为了计算用户评论的pagerank,但当我在一个大数据集(40k条目)上运行代码时,我总是得到Spark java.lang.StackOverflowError。+ t._2; });
//calculate pagerank using this https://github.com/apache/spark/blob/master/examples