通常,Hadoop示例定义如何对一个文件或多个文件进行单词计数,单词计数的结果将来自整个集合!
我希望对每一段进行字数计数,并将其存储在单独的文件中,如(I)_wordcnt.txt。
怎么做?(问题是地图运行为整套和减速器最终采集输出!
,我可以做一些事情,比如如果我达到一个特定的标记,写结果!),如果文件:
para1
...
para2
...
para3
...我能喜欢看para2写para1字数的结果吗?或者,如果用其他方式在单独的文件中编写每个段落,那么如何像这样做呢?
loop:
file(i)(parai)->Mapper->Reducer->multipleOutput(output-file(i))->writetofile(i);
i++;
goto loop;发布于 2013-04-13 07:04:50
您需要让RecordReader一次读一段。参见这个问题:将RecordReader重写为立即阅读段落而不是行
发布于 2013-04-15 10:47:50
我写的基本基础,作为我们如何能够做到这一点。
我认为我们必须为这个过程运行链接映射器和减速器。
在第一个映射器中,您必须使用RecordReader并将其键设置为整个段落。这样,我们就可以得到和段落一样多的键,have.Then,您需要使用还原器作为同一性减速器,并且再次让还原器输出到一个新的映射器,这个映射器将得到段落作为键。
现在,由于您在新的映射程序中有了段落,您可以根据您的需要调整著名的字数码。(只需在这里用值替换键,所有的rest都是相同的)。
由于在还原器中有嵌套的映射程序,在单独的文件中获取段落的单词计数将很容易。
请告诉我的方法是否正确。
https://stackoverflow.com/questions/15981878
复制相似问题