当我试图理解hadoop体系结构时,我想找出一些问题。当有一个大的数据输入时,HDFS会将它分成许多块(每盘64 to或128 to),然后复制很多时间将它们存储在内存块中,对吗?
但是,我仍然不知道MapReduce在哪里工作。它是用来划分和合并数据来存储的吗?还是用它来返回一些有用的输出?
发布于 2015-04-26 20:30:09
在HDFS中存储数据与用MapReduce范式分析数据是非常不同的。
当上传到HDFS时,大数据文件被分割成存储在数据阳极中的块,每个块被复制的次数与配置的复制因子相同(默认情况下为3)。数据分割就像将文件除以所配置的块大小一样简单。
如前所述,MapReduce是分析大数据文件以获取增值信息的编程范例。用几句话来说,每个文件块都被分配给一个map任务,以便所有映射器都在chuncks上执行相同的操作;一旦完成,输出部分结果将被发送到还原器,以便以某种方式聚合数据。
https://stackoverflow.com/questions/29882326
复制相似问题