首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >为什么每种语言都需要一个标记器?

为什么每种语言都需要一个标记器?
EN

Stack Overflow用户
提问于 2013-06-26 15:54:16
回答 3查看 4.6K关注 0票数 13

在处理文本时,为什么需要专门用于该语言的标记器?

使用空格标记还不够吗?在哪些情况下,简单地使用空白标记化不是一个好主意?

EN

回答 3

Stack Overflow用户

回答已采纳

发布于 2013-06-26 17:18:35

标记化是从表层文本中识别出具有语言意义的单位语义单位()。

中文:如果您在新加坡只能前往一间夜间娱乐场所,Zouk必然是您的不二之选。

英语:如果你在新加坡只有一个俱乐部的时间,那么它就必须是Zouk。

印尼:Jika Anda hanya memiliki waktu untuk satu klub di新加坡,pergilah ke Zouk。

日语:シンガポールで一つしかクラブに行く時間がなかったとしたら、このズークに行くべきです。

:싱가포르에서클럽한군데밖에갈시간이없다면,Zouk를선택하세요。

越南语:Nếu bạn chỉcóthời gian ghéthăm một c­u lạc bộởth? hãyđến Zouk.

文本来源:http://aclweb.org/anthology/Y/Y11/Y11-1038.pdf

上面平行文本的标记化版本应该如下所示:

对于来说,这很简单,因为每个都是由空格分隔/分隔的。然而,在其他语言中,情况可能并非如此。对于大多数浪漫化语言,例如印尼语,它们具有相同的空格分隔符,可以轻松地识别LMU。

但是,有时LMU是由空格分隔的两个“单词”的组合。例如,在上面的越南语句子中,你必须将thời_gian (在英语中的意思是时间)读作一个令牌,而不是两个令牌。将这两个单词分成两个标记会产生错误的LMU (例如,http://vdict.com/th%E1%BB%9Di,2,0,0.html)或错误的LMU(例如,http://vdict.com/gian,2,0,0.html)。因此,一个合适的越南语标记器应该将thời_gian输出为一个令牌,而不是thờigian

对于其他一些语言,它们的正字法可能没有空格来分隔“单词”或“记号”,例如汉语、日语,有时还包括韩语。在这种情况下,计算机必须使用标记化来识别LMU。通常,在LMU上附加了语素/词形变化,因此在自然语言处理中,有时morphological analyzer比分词器更有用。

票数 20
EN

Stack Overflow用户

发布于 2013-06-26 15:58:12

有些语言,比如中文,根本不使用空格来分隔单词。

其他语言会以不同的方式使用标点符号-例如,撇号可能是单词的一部分,也可能不是。

案例折叠规则因语言而异。

Stopword和词干提取在不同的语言中是不同的(尽管我想我在这里偏离了标记器和分析器的范围)。

Bjerva编辑:此外,许多语言连接复合名词。是否应该将其标记为多个标记不能仅使用空格轻松确定。

票数 5
EN

Stack Overflow用户

发布于 2013-12-28 21:00:09

这个问题还暗示着“什么是单词?”并且可以是非常特定于任务的(即使忽略多语言作为一个参数)。以下是我尝试的归纳式答案:

单词之间的空格(缺少)

许多语言根本不在单词之间加空格,因此基本的空格分词算法是没有用的。这些语言包括主要的东亚语言/脚本,例如中文、日语和泰语。古希腊语也是由古希腊人写的,没有空格。引入了空格(以及重音标记等)由那些后来的人。在这些语言中,分词是一项更主要和更具挑战性的任务。(MANNI:1999,第129页)

化合物

德语复合名词写成一个单词,例如:"Kartellaufsichtsbehördenangestellter“(”反垄断机构“的一名雇员),和复合词事实上是单个单词--从语音上看(参见:(MANNI:1999,第120页)。然而,它们的信息密度很高,人们可能希望划分这样的复合词,或者至少了解单词的内部结构,这就成为一项有限的分词任务。

也有粘合语言的特殊情况;介词,所有格代词,...‘附加’到‘主’字;例如,在欧洲的领域中,芬兰语、匈牙利语、土耳其语。

变体样式和编码

某种语义类型的信息的变体编码,例如电话号码、日期等的本地语法:

...即使不是处理多语言文本,任何处理来自不同国家或根据不同风格约定编写的文本的应用程序都必须准备好处理排版差异。特别是,一些项,如电话号码,显然是一种语义分类,但可以以多种格式出现。(MANNI:1999,第130页)

杂项

一项主要任务是对句点(或一般的标点符号)和其他非字母(-numeric)符号进行消歧:例如,如果句点是单词的一部分,请保持这种方式,这样我们就可以区分,华盛顿州的缩写wash和动词wash的大写形式(MANNI:1999,p.129)。除了这样的情况外,处理缩写和连字符也不能被视为跨语言的标准情况(即使忽略缺少的空格分隔符)。

如果想要处理多语言压缩,/“cliticons”:

  • 英语:他们是我父亲的堂兄弟。法语: Montrez-leàl‘agent!
  • German:
  • ‘s ins Haus gebracht。(in%s仍然是有效的变体)

由于标记化和句子分割齐头并进,它们共享相同的(跨语言)问题。对于它可能关注/想要大致方向的人:

  • 亲吻,Tibor和Jan Strunk。2006年。无监督多语言句子边界检测。计算Linguistics32(4),p。485-525.
  • Palmer,D.和M.赫斯特。1997年。自适应多语言句子边界消歧。计算语言学,23(2),第241-267.
  • Reynar,J.和A.拉特纳帕奇。1997年。识别句子边界的最大熵方法。第五届应用自然语言处理会议论文集,第16-19页。

参考

(MANNI:1999) Manning Ch.D.、H. Schütze.1999年。统计自然语言处理基础。马萨诸塞州剑桥:麻省理工学院出版社。

票数 4
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/17314506

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档