我正在尝试使用spark将数据从greenplum读取到HDFS中。为此,我使用jar文件:greenplum-spark_2.11-1.6.0.jarval yearDF = spark.read.format("io.pivotal.greenplum.spark.GreenplumRelationProvider8)
org.postgresql.util.PSQLException: ERROR: error when writing data t
情况是这样的:我启动了一个spark作业,但由于OOM的许多任务失败而失败。所以我增加了任务的内存分配。我仍然看到OOM的一些节点失败了,但作业最终可能会成功。我的问题是Spark是如何处理这个问题的?似乎Spark可以在一次失败的尝试后重新分发数据。附注:失败的任务是在批处理作业中应用Window and Rank操作。
当我们想从Spark连接HDFS时,我们只是将HADOOP_CONF_DIR设置为而不是将各种参数传递给Spark/usr/hdp/current/spark-client/bin/spark-submit --class org.apache.spark.examples.SparkPi --master y