有没有人对OCR的不同字体有什么经验?我正在生成一个ID,然后尝试使用tesseract扫描它。目前我只是T&E'n不同的字体,但这似乎是相当低效的。我已经尝试了OCR*系列的字体,以及各种其他字体,如Arial和佐治亚。tesseract容易与OCR*字体混淆。
有没有专门为tesseract设计的字体,或者与其配合良好的系统字体?
发布于 2008-11-25 01:09:06
好的,在谷歌上搜索一下,一个特定的OCR字体:OCR Font
看起来这是1973年采用的标准。
发布于 2011-01-02 21:12:30
在尝试了许多不同的字体和OCR引擎之后,我倾向于使用Consolas获得最好的效果。它是一种像OCR-A一样的等宽字体,但对人类来说更容易阅读。Consolas包含在多个Microsoft产品中。
还有一个受Consolas影响的开源字体Inconsolata。Inconsolata是Consolas的一个很好的替代品,特别是考虑到许可细节。
在我的测试中,Calibri字体中的数字和空格并不总是被正确识别。OCR-A给出了很多读取错误。我没有尝试过MIRC,因为它对大多数人来说并不容易阅读。
注释:tesseract需要进行大量的测试和微调才能可靠。在我们的例子中,我们切换到了商业许可的OCR引擎(ABBYY),特别是因为可靠性非常重要,我们需要支持多种(欧洲)语言。
更新: 2017年1月31日-由于潜在的版权问题,将“基于Consolas”更改为“受Consolas影响”。
发布于 2010-02-03 05:42:44
我发现Calibri对我来说是最好的。我们每天在自动化系统中使用OCR软件,在测试了数十种字体(包括一些OCR特定字体)后,Calibri始终是最好的。
祝好运。
https://stackoverflow.com/questions/316068
复制相似问题