我真的对语音到文本算法很感兴趣,但我不确定从哪里开始学习它们。经过几次搜索,我找到了this,但它是1996年的,我相当肯定从那时起就有了改进。
有没有人对这类东西有经验,有什么建议可以阅读/检查源代码吗?或者仅仅是关于如果我想要进入编写语音识别程序的世界应该学习什么的一般建议(如果你对该领域没有太多的知识,有时很难知道要搜索什么)。
编辑:我想做一些跨平台的事情,但目前我的目标是linux。
编辑2:感谢csmba深思熟虑的回复。在这一点上,我主要感兴趣的是能够创建允许自动化或通过语音执行不同命令的应用程序。因此,可以将有限数量的可识别命令串在一起。一个例子是一个音乐播放器,它接受诸如“播放专辑Hello Everything by Squarepusher”这样的命令,或者一个应用程序启动器,允许用户创建语音快捷方式来启动特定的应用程序。
我意识到这是一个相当大的问题,而且我现在还远没有达到实现整个识别引擎所需的知识水平,尽管涉及到的技术让我着迷,这也是我想努力做的事情。很有可能,我最终会拿起一两本关于这个主题的书,在空闲时间研究/玩弄“简单”的实现。
发布于 2008-08-18 16:56:44
这是一个很大的问题,我不知道如何开始...因此,让我试着给你正确的“条款”,这样你就可以改进你的任务:
首先,理解语音识别是一门多种多样且复杂的学科,它有许多不同的应用。人们倾向于将这个领域映射到他们脑海中出现的第一件事(通常是计算机理解你在IVR系统中所说的话)。因此,首先让我们将概念区分为主要类别:
Human-to-Machine:应用程序处理理解人类在说什么,但人类知道他正在与机器交谈,并且语法非常有限。示例如下
human-to-human (自发语音):这是一个更大、更复杂的问题。这里我们还可以将其分解为不同的应用程序:
现在,语音到文本并不是你应该说的,你关心的。你所关心的是解决一个问题。不同的技术用于解决不同的问题。查看其中一些的概述here。总而言之,其他的方法是音标,LVCSR和直接为基础。
另外,你有兴趣成为技术背后的PHd吗?你需要一个与信号处理相关的硕士学位,可能还需要一个PHd学位才能成为尖端人才。在这种情况下,您将为开发实际的语音引擎的公司工作。像Nuance和IBM这样的公司是大公司,但也存在Phillips和其他初创公司。
另一方面,如果你想成为实现应用程序的人,你将不会致力于引擎,而是致力于构建使用该引擎的应用程序。我认为一个很好的类比来自游戏行业:你是在开发图形引擎(比如Cry引擎),还是在几百个游戏中的一个上工作,都使用相同的图形引擎?
不要误会我的意思,在IBM/Nuance之外的搜索质量上还有很多工作要做。引擎通常是非常开放的,并且有许多算法调整要做,这可能会极大地影响性能。每个业务应用程序都有不同的约束和成本/收益函数,因此您可以进行多年的实验,构建更好的基于语音识别的应用程序。
还有一件事:通常情况下,你还希望在堆栈中处于较低的位置时拥有良好的统计背景。
此时此刻,我主要感兴趣的是能够创建允许自动化的应用程序
很好,我们在这里汇聚..。那么你对“语音到文本”不感兴趣了。这些流行语把你带到了一个完全转录的世界,一个你不需要去的地方。您应该专注于一些更人性化的技术,如Voice XML和IVR系统中使用的技术(Nuance是其中最大的参与者)
发布于 2008-08-18 16:16:26
如果你是这个领域的新手,我绝对推荐你选择一两个a book。我没有这方面的经验,所以我不能给你推荐。如果你还在上大学(或者仍然有亲密的关系),你应该看看你的教授是否能给你推荐。
你链接的调查可能也是一个很好的资源。我相信自1996年以来已经有了一些进步,但基本情况不太可能发生根本性的变化。如果这份调查写得很好,那么就值得你花时间去读一读。
发布于 2008-08-18 16:18:08
对于OS X,请查看以下内容:OS X Speech Technologies
对于视窗系统,请查看以下内容:Microsoft Speech API
https://stackoverflow.com/questions/14837
复制相似问题