首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >Spark最佳方法查找Dataframe以提高性能

Spark最佳方法查找Dataframe以提高性能
EN

Stack Overflow用户
提问于 2016-08-27 01:27:30
回答 2查看 600关注 0票数 1

数据帧A(百万条记录)其中一列是create_date,modified_date

Dataframe B 500记录具有start_date和end_date

当前方法:

Select a.*,b.* from a join b on a.create_date between start_date and end_date

上述作业需要半个小时或更长时间才能运行。

如何提高性能?

EN

回答 2

Stack Overflow用户

发布于 2016-08-27 01:51:19

DataFrames目前还没有这样的直接连接方法。在执行连接之前,它将完全读取这两个表。

https://issues.apache.org/jira/browse/SPARK-16614

您可以使用RDD来利用joinWithCassandraTable函数

https://github.com/datastax/spark-cassandra-connector/blob/master/doc/2_loading.md#using-joinwithcassandratable

票数 3
EN

Stack Overflow用户

发布于 2016-08-27 02:03:03

正如其他人所建议的,其中一种方法是广播较小的数据帧。这也可以通过配置以下参数自动完成。

代码语言:javascript
复制
spark.sql.autoBroadcastJoinThreshold

如果数据帧大小小于此处指定的值,Spark将自动广播较小的数据帧,而不是执行连接。您可以阅读有关此here的更多信息。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/39171732

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档