我正在做的是替卢古脚本,它的unicode范围是0C01-0C7F,你能解释一下如何找出其中的音节吗?
(从那问题中更新复制)
我可以对字符进行分类,但在telugu脚本中,一个音节可能包含一个或多个字符,当从文件中检索字符时,音节被分割,无法组合,所以如果有人知道telugu脚本文本分类,请帮助我。
发布于 2009-10-31 06:54:52
我不会说泰卢古语(对不起!),但我明白这是一种以音节为基础的语言,音节由元音(“achchu”s)和辅音(“hallu”s)组成。因此,正如维基百科解释的那样,你最终得到了“60个符号,其中16个是元音,3个元音修饰符,41个辅音”。此页显示Unicode对应:元音为0C05至0C14 (还有0C60和0C61,“语音”RR和LL);辅音为0C15至0C39;其他代码为许多“符号、标点符号、数字”等。
此PDF上有一张完整的可能音节表,但我承认脚本让我很难知道什么是什么。如果你说得很好,或者很容易接触到这样的人,你就会在一个比我更好的地方告诉你如何在一连串的特卢古字符中刻出音节。Python与它没有多大关系--它只是众多编程语言中的一种,它可以让您实现确定音节所需的任何算法,但它绝对没有内置的算法!)
发布于 2012-10-18 03:59:51
在特卢古,音节是以几种方式形成的。
如果您使用英文脚本来音译成telugu (就像google音译工具),那么很多英语字符可能只形成一个音节。
考虑一下"stree“(在google音译工具中键入这个词),这个词在Telugu中只形成一个音节。您可以分析http://rishida.net/tools/analysestring/index.php?list=స్త్上的Telugu字符串,以了解telugu音节是如何形成的。
你有两个选择解决这个问题
1如果您的输入是在Telugu脚本中,则计算出代码点序列。并根据元音结束和新音节开始的时间对代码点序列进行分组。
2如果你的输入是用英语写成的,那么你需要弄清楚什么时候应该把这个顺序分解成多个音节。
https://stackoverflow.com/questions/1653614
复制相似问题