我有一个应用程序,需要从图像中一个接一个地分离日语字符。
输入:具有一行日语文本的图像。它可以有半角片假名、半角数、全角片假名、平假名和数字。也可以是半角或全角英文字符。(让我们暂时忘记英文字符)
问题:通过使用自适应阈值、膨胀和腐蚀,我可以很容易地分离出字符。但有一个大问题。
一些日语字符之间有一个空格。比如川,体,休,非。因此,简单地查看垂直白色间隙是没有帮助的。查找宽度也没有帮助,因为可以有全角字符(2btyte)或半角字符(1byte)。我似乎需要一种巧妙的方式来做到这一点。
你知道我该怎么做吗?任何想法都是好主意:)
这里有几张样例图片。(红色圈出的字符是有问题的)
发布于 2013-09-11 09:10:16
不要期望找到一个简单的算法就能做你想做的事情,准备结合一些技术,包括但不限于你已经提到的那些。
根据之前的个人经验,我个人的建议是让你看看template matching techniques。
基本上,这就是你需要做的:
如果你发现自己在处理光照条件、字符颜色、字体、大小等方面的变化太多,你会意识到你将需要一个巨大的数据库来涵盖所有不同的可能性。在这种情况下,对变化的条件使用一些变换不变量可能会有所帮助。对于字符识别,我相信骨架化可以很好地工作。看一下topological skeleton和morphological skeleton,还有here作为一个简单的例子。
https://stackoverflow.com/questions/18731042
复制相似问题