首页
学习
活动
专区
圈层
工具
发布
社区首页 >问答首页 >语音到文本的语音到文本训练

语音到文本的语音到文本训练
EN

Stack Overflow用户
提问于 2020-08-16 03:03:21
回答 2查看 79关注 0票数 1

我想训练和使用基于ML的个人语音到文本的高度受损的声音转换器,为300-400个单词的小集合。这是为有声音障碍的人使用的。但不能是通用的,因为每个人都有一个独特的语音输入单词,这取决于他们的损伤类型。

想知道是否有任何ML引擎,允许这样的培训。如果不是,那么最好的方法是什么?

谢谢

EN

回答 2

Stack Overflow用户

发布于 2020-08-16 03:07:32

我强烈推荐看youtube原创连续剧“人工智能时代”的第一季第二集。

基本上,谷歌已经为那些不能真正形成正常语音的人做了这件事。它非常有趣,并谈到了他们是如何做到的,以及如何使用ML技术做到这一点。

enter link description here

票数 0
EN

Stack Overflow用户

发布于 2020-08-16 06:28:04

大多数语音识别引擎都支持训练(wav2letter、deepspeech、espnet、kaldi等),您只需输入数据即可。唯一的问题是你需要大量的数据来进行可靠的训练(每个单词需要1000个样本)。例如,您可以查看Google Commands数据集,了解如何从头开始训练。

由于训练数据集对于您的情况来说将非常小,并且仅由几个样本组成,因此您可能可以从现有的预训练模型开始,并在您的样本上对其进行微调,以获得最佳的准确性。您需要查看“几个短期学习”设置。

你可以看看wav2vec 2.0预训练模型,它对这样的学习应该是有效的。您可以找到用于微调和推断here的示例和命令。

您还可以尝试在Google Commands for NVIDIA NEMO中微调Japser模型。它的效率可能会稍低一些,但仍然可以工作,并且应该更容易设置。

票数 0
EN
页面原文内容由Stack Overflow提供。腾讯云小微IT领域专用引擎提供翻译支持
原文链接:

https://stackoverflow.com/questions/63429811

复制
相关文章

相似问题

领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档