我们看到越来越多的语音识别实现了,并且对能够做好语音识别的库的需求越来越大。与键盘或小键盘相比,它背后的理由是什么(就可用性而言)?你会出于什么原因投资于这个开发项目?
例如,让我们以呼叫中心为例。几年前,几乎每个呼叫中心都使用IVR来提示菜单的按键。现在,我们看到越来越多的菜单提示输入语音关键字和/或按下键盘:“请说发票或按1查看您的发票”。或者我们在公司的电话簿中看到了同样的事情:“请说出你试图联系的人的名字”……“弗兰克·洛伊德”“你是说杰克·弗洛伊德吗?如果你想联系这个人,请说”是“,或者说”不“再试一次。”
我想这是一个加分,当你在你的车里,没有拿着你的手机,但值得额外的等待时间吗?所有选项的交互时间更长,在尝试分析是否说了什么时提示时间更长,等等?当然,可靠性比以前更好了,但有时它感觉更像是某人决定插入系统的玩具,这样它就会有未来感。
有设计IVR或使用(或选择不使用)语音识别的软件的经验吗?
谢谢!
发布于 2009-08-17 13:09:55
与键盘或小键盘相比,它背后的理由是什么(就可用性而言)?
可用性是一个非常宽泛的术语。如果我试图用触摸板输入我的地址,它不会被认为是非常有用的。一些人认为,使用总体成功率为70-80%的语音引擎也不是很好用。正如其他帖子所指出的那样,对于那些使用手机的人来说,免提输入要容易得多。然而,如果主题对呼叫者来说有点陌生,那么使用文字输入与数字输入实际上可能不如按键式电话那么直观。听到不太熟悉的术语和短语的呼叫者无法在提示的10-30秒内记住它们,但他们可以用手指悬停在最佳发音选项上或记住选项的顺序。
你有什么理由要投资这个开发项目?
这是一个奇怪的问题。通常,在IVR环境中使用语音或不使用语音的决定不是从世界的发展角度出发的。除非您有真正需要语音的特定要求,否则您几乎总是在降低总体成功率。言辞通常是影响公司形象的一个因素。或者拥有最新的科技玩具。
我想当你在车里而不拿着手机的时候,这是一个加分,但这值得额外的等待时间吗?
现在使用现代ASR时,语音识别延迟不是很高。在大多数情况下,输入与语音并行处理,语音识别结束之间的时间间隔为1秒。请注意,许多IVR需要在某些输入后执行数据查找,这可能会显示为较慢的系统。正常输入超过1s通常是部署能力不足的标志。
它在最初实现时可能并没有动力不足,但通过调优工作,您可以做出许多性能与准确性的决定。为了获得下一个.1%,可以将资源推送到超出其峰值的位置。
另外,可靠性比以前更好了,当然,但有时它感觉更像是某人决定插入系统的玩具,这样它就会有未来感。
一般来说,是这样的。在可靠性方面,您需要真正查看总体数字,以了解系统。这是一场统计之战,其中个人并不是很重要(除非他们拥有副总裁或更高的头衔)。通过优化输入(切换提示)、资源使用和其他语音录音调整参数,您可以尝试最大限度地提高准确性。对于基本的自然语言响应,你可以达到90以上。然而,你的总体成功率要低得多。想象5个提示都是98% (实际上,你倾向于有一堆99,然后是几个90年代中期或更低):.98 * .98 * .98 * .98 * .98 = 90%。这意味着每10个人中就有一个失败了。这是在调用者混淆和业务规则之前。DTMF输入通常非常接近100%,即使在几次输入之后也是如此。
是否有使用(或不使用)语音识别的交互式语音识别或软件的设计经验?是。但是,我怀疑这真的不是你想要的问题。作为技术方面的人,这通常不是你的决定,你对它的影响力有限。如果你真的在寻找演讲的利弊:
优势:
缺点:
发布于 2009-05-22 15:17:20
我认为语音识别就像任何输入方法一样,各有利弊。
Pro's
Con's
发布于 2009-05-23 02:46:01
在某些情况下,公司需要处理旋转式电话。可能会发现,只设置识别系统而不是两者都设置会更具成本效益。
语音识别比按键音有更多的开销。如果你想得到最好的结果,你需要不断地调整应用程序,并根据无法识别的单词发音来训练系统。您还需要非常注意如何使用语音识别提示用户,否则可能会收到意想不到的响应。
总体而言,按键音要容易得多,因为在任何给定的时间都只有有限的可能选项。
如果你的应用足够简单,那么你的语音记录只会让它变得复杂。按2可选择其他语言。
https://stackoverflow.com/questions/898402
复制相似问题