我们确实遇到了表查找的问题。我们需要同时从hive和spark (使用thrift服务器)访问表格。然而,我们的问题是在spark上运行spark和thrift服务器导致一个表的查找。
我们在Amazon AWS EMR集群上运行,其中包含Hive、Spark和thrift Server2。
我们希望使用hive更新s3存储,并定期在后台将这些聚合数据加载到spark中。同时,Spark总是加载了thrift服务器,并从s3加载了相同的数据,以便对这些数据进行实时聚合。Spark不需要对此数据的写访问权限。
问题是在hive上运行周期性的所有数据加载任务会导致作业冻结。
我们认为元存储可能被spark / thrift服务器锁定,阻止hive更新和重新加载数据到spark。(但对此不太确定)
可以在只读非阻塞模式下启动spark and thrift服务器吗?
可能导致问题的原因是什么?有没有人遇到过类似的问题?
发布于 2015-12-23 20:25:40
您的元存储是如何配置的?它是否使用Derby作为metastore?在默认配置下,它使用Derby,而Derby不支持多个并发用户。如果是这样的话,您应该将其更改为使用MySQL之类的东西,它确实支持多用户。
https://stackoverflow.com/questions/34415513
复制相似问题