我正在使用Microsoft Translator Text中的训练集创建一个自定义模型,用于日语(JA)到英语(EN)的翻译。训练数据是否应该标记化,是否全部小写?
日语中的引号字符(“”和“”)与英语中的不同。在JA训练数据中,这些数据应该被标记化(用空格分隔)吗?在并行EN训练数据中,应该使用EN引号(""),还是使用JA引号?
除此之外,是否还需要其他预处理,例如将文本全部转换为小写?模型在部署时返回的文本大小写并不重要。
发布于 2019-05-29 20:44:37
让培训材料像展示给人类读者一样,大小写和标点符号完好无损。大小写和标点符号在翻译中很重要,它是引擎要接收的相关信号。没有理由应用您自己的标记化,它会干扰系统的标记化。最好的培训材料是句子对齐或片段对齐,就像您在TM导出的TMX或XLIFF中获得它一样。
https://stackoverflow.com/questions/56346860
复制相似问题