我希望将电子桌面应用程序中的语音到文本集成到直播中,而无需在本地生成.mp3文件,或者您可以说直接从麦克风流到google语音。
我在谷歌云网站上找到了一篇文章,那就是这里。 (最后一篇文章说需要安装SoX )。
它有一个相当混乱的要求,SoX需要安装在机器上.
但是,当我包装我的电子应用程序并将其分发给世界时,没有必要让每个人都安装SoX。那么,当每个人要安装我的应用程序时,我如何集成它,或者我可以在每个人的PC上安装SoX,因为正如文档所述,SoX是必须的。有什么办法吗?
发布于 2018-10-08 19:41:04
如果我们查看在您链接的页面中用node.js编写的最后一个示例,我们会发现它使用了一个名为“节点记录-lpcm16 16”的模块,它不是GCP的一部分。如果我们继续读下去,就会找到对record.start()的调用。这样做的目的是来源一个输入数据流(大概从麦克风)。我的理解是,当我们研究关于将演讲转录为文本的文章时,我们看到GCP并不关心音频源来自何处,而是取决于您自己的应用程序从哪里获取它。该示例仅说明了使用SoX的一种可能的技术,但还有其他方法,如"arecord“,可能还有更多。我认为我们需要做的是将音频输入的概念与GCP处理音频输入流的能力分开。因此,我不认为GCP的语音到文本需要SoX,而是您获得音频数据的应用程序必须在将其传递给GCP之前从某个地方获取该数据,而SoX是一种可能的选择。
https://stackoverflow.com/questions/52707003
复制相似问题