首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >PySpark: saveAsNewAPIHadoopDataset()可以用作HBase的批量加载吗?

PySpark: saveAsNewAPIHadoopDataset()可以用作HBase的批量加载吗?
EN

Stack Overflow用户
提问于 2015-08-24 14:21:55
回答 1查看 1.8K关注 0票数 3

我们目前使用saveAsNewAPIHadoopDataset()通过Spark RDDs (pyspark)将数据导入到HBase表中。

此函数是否通过mapreduce使用HBase批量加载功能?换句话说,直接导入到HBase的saveAsNewAPIHadoopDataset()是否等同于使用saveAsNewAPIHadoopFile()将Hfiles写入HDFS,然后调用org.apache.hadoop.hbase.mapreduce.LoadIncrementalHFiles加载到HBase?

以下是我们的HBase加载例程的示例片段:

代码语言:javascript
复制
conf = {"hbase.zookeeper.quorum": config.get(gethostname(),'HBaseQuorum'),
        "zookeeper.znode.parent":config.get(gethostname(),'ZKznode'),
        "hbase.mapred.outputtable": table_name,
        "mapreduce.outputformat.class": "org.apache.hadoop.hbase.mapreduce.TableOutputFormat",
        "mapreduce.job.output.key.class": "org.apache.hadoop.hbase.io.ImmutableBytesWritable",
        "mapreduce.job.output.value.class": "org.apache.hadoop.io.Writable"}

keyConv = "org.apache.spark.examples.pythonconverters.StringToImmutableBytesWritableConverter"
valueConv = "org.apache.spark.examples.pythonconverters.StringListToPutConverter"

spark_rdd.saveAsNewAPIHadoopDataset(conf=conf,keyConverter=keyConv,valueConverter=valueConv)
EN

回答 1

Stack Overflow用户

发布于 2015-11-03 00:53:51

不完全同意。RDD.saveAsNewAPIHadoopDatasetRDD.saveAsNewAPIHadoopFile做的几乎是一样的事情。他们的API只是有一点不同。每种方法都提供了不同的“机制与策略”选择。

票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/32175634

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档