我正在寻求建议,我应该使用哪个版本的Tesseract来训练一种具有独特字母的古老语言。就特征而言,这种语言与阿拉伯语非常相似。它也是从右到左的,一些字母可以在单词中连接。换句话说,一个字母可能有三种形状,这取决于它是在开头、中间还是结尾。它还有高于或低于字母的harakat (short vowel marks)。
我问这个问题的原因是因为我想利用3.X版可用的工具,但是关于阿拉伯语的this warning让我失望了,因为这门语言和它非常相似。
对于任何熟悉Tesseract的人来说,你推荐用哪个版本来训练这样的语言?另外,如果你知道有更好的工具,请分享它。
发布于 2017-08-15 00:11:22
如果你有大量的文档需要OCR,我会推荐使用Tesseract 4.0,因为它通常更快。你可以参考下面的更多信息,如果你以前没有读过的话。
--oem 1)中的OCR是否工作正常,该模式仅限神经网络LSTM。Tesseract 4.0.0 alpha已于去年11月/12月发布。
希望这能有所帮助。
https://stackoverflow.com/questions/45662475
复制相似问题