首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >hadoop,段落中的单词计数

hadoop,段落中的单词计数
EN

Stack Overflow用户
提问于 2013-04-12 22:30:01
回答 2查看 675关注 0票数 2

通常,Hadoop示例定义如何对一个文件或多个文件进行单词计数,单词计数的结果将来自整个集合!

我希望对每一段进行字数计数,并将其存储在单独的文件中,如(I)_wordcnt.txt。

怎么做?(问题是地图运行为整套和减速器最终采集输出!

,我可以做一些事情,比如如果我达到一个特定的标记,写结果!),如果文件:

代码语言:javascript
复制
para1
...
para2
...
para3
...

我能喜欢看para2写para1字数的结果吗?或者,如果用其他方式在单独的文件中编写每个段落,那么如何像这样做呢?

代码语言:javascript
复制
   loop: 
   file(i)(parai)->Mapper->Reducer->multipleOutput(output-file(i))->writetofile(i);
   i++;
   goto loop;
EN

回答 2

Stack Overflow用户

发布于 2013-04-13 07:04:50

您需要让RecordReader一次读一段。参见这个问题:将RecordReader重写为立即阅读段落而不是行

票数 0
EN

Stack Overflow用户

发布于 2013-04-15 10:47:50

我写的基本基础,作为我们如何能够做到这一点。

我认为我们必须为这个过程运行链接映射器和减速器。

在第一个映射器中,您必须使用RecordReader并将其键设置为整个段落。这样,我们就可以得到和段落一样多的键,have.Then,您需要使用还原器作为同一性减速器,并且再次让还原器输出到一个新的映射器,这个映射器将得到段落作为键。

现在,由于您在新的映射程序中有了段落,您可以根据您的需要调整著名的字数码。(只需在这里用值替换键,所有的rest都是相同的)。

由于在还原器中有嵌套的映射程序,在单独的文件中获取段落的单词计数将很容易。

请告诉我的方法是否正确。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/15981878

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档