这个算法用了梯度下降的方法:一个随机的值作为 w 的初始值, 每次迭代都会将含有 w 的方法应用到每一个数据点然后累加得到梯度值, 然后将 w 往改善结果的方向移动.
?...如果一个文档引用另一个文档, 那被引用的文档的排名值(rank)需要加上引用的文档发送过来的贡献值, 当然这个过程是个迭代的过程....在每一次迭代中, 每一个文档都会发送 r/n 的贡献值给它的邻居, 其中 r 表示这个文档的排名值, n 表示这个文档的邻居数量....然后更新文档的排名值为, 这个表达式值表示这个文档收到的贡献值, N 表示所有的文档的数量, 我们可以用如下的 spark 代码来表达 PageRank:
?...引用资料
[1] ApacheHive.http://hadoop.apache.org/hive.
[2] Scala.http://www.scala-lang.org.