我从twitter收集数据并将其存储在hdfs上。我想根据时间戳对这些tweet进行排序,但这个查询需要很长时间。
1.5 gb的数据需要1分钟来排序,我认为这比预期的要多得多。
可以做些什么来加速这个查询呢?
谢谢你的帮助。
发布于 2015-08-22 01:22:55
你不能期望从Hive得到更快的东西。在我们的Prod集群上,涉及到批处理作业的JDBC的查询的典型开销是20秒--这是在使用精益和平均的MapReduce连接的情况下;使用Hive CLI,仅仅启动MapReduce和预热TEZ容器就需要另外20秒。
如果需要关系型数据库管理系统的响应时间,只需使用MySQL即可。或者可能是像MemSQL的免费版本这样的分布式东西。
https://stackoverflow.com/questions/32139955
复制相似问题