首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >是否预处理Microsoft Custom Translator Text JA->EN的培训数据?(标记化,小写)

是否预处理Microsoft Custom Translator Text JA->EN的培训数据?(标记化,小写)
EN

Stack Overflow用户
提问于 2019-05-29 00:51:16
回答 1查看 73关注 0票数 0

我正在使用Microsoft Translator Text中的训练集创建一个自定义模型,用于日语(JA)到英语(EN)的翻译。训练数据是否应该标记化,是否全部小写?

日语中的引号字符(“”和“”)与英语中的不同。在JA训练数据中,这些数据应该被标记化(用空格分隔)吗?在并行EN训练数据中,应该使用EN引号(""),还是使用JA引号?

除此之外,是否还需要其他预处理,例如将文本全部转换为小写?模型在部署时返回的文本大小写并不重要。

EN

回答 1

Stack Overflow用户

回答已采纳

发布于 2019-05-29 20:44:37

让培训材料像展示给人类读者一样,大小写和标点符号完好无损。大小写和标点符号在翻译中很重要,它是引擎要接收的相关信号。没有理由应用您自己的标记化,它会干扰系统的标记化。最好的培训材料是句子对齐或片段对齐,就像您在TM导出的TMX或XLIFF中获得它一样。

票数 2
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/56346860

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档