首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >如何在非阻塞模式下启动spark (使用thrift服务器),以便hive可以更新数据并将数据重新加载到spark中(查看表格)

如何在非阻塞模式下启动spark (使用thrift服务器),以便hive可以更新数据并将数据重新加载到spark中(查看表格)
EN

Stack Overflow用户
提问于 2015-12-22 20:02:23
回答 1查看 613关注 0票数 0

我们确实遇到了表查找的问题。我们需要同时从hive和spark (使用thrift服务器)访问表格。然而,我们的问题是在spark上运行spark和thrift服务器导致一个表的查找。

我们在Amazon AWS EMR集群上运行,其中包含Hive、Spark和thrift Server2。

我们希望使用hive更新s3存储,并定期在后台将这些聚合数据加载到spark中。同时,Spark总是加载了thrift服务器,并从s3加载了相同的数据,以便对这些数据进行实时聚合。Spark不需要对此数据的写访问权限。

问题是在hive上运行周期性的所有数据加载任务会导致作业冻结。

我们认为元存储可能被spark / thrift服务器锁定,阻止hive更新和重新加载数据到spark。(但对此不太确定)

可以在只读非阻塞模式下启动spark and thrift服务器吗?

可能导致问题的原因是什么?有没有人遇到过类似的问题?

EN

回答 1

Stack Overflow用户

发布于 2015-12-23 20:25:40

您的元存储是如何配置的?它是否使用Derby作为metastore?在默认配置下,它使用Derby,而Derby不支持多个并发用户。如果是这样的话,您应该将其更改为使用MySQL之类的东西,它确实支持多用户。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/34415513

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档