首页
学习
活动
专区
圈层
工具
发布

Meta发布首款实时音频模型Muse Voice Transcribe

Meta Superintelligence Labs(超智能实验室)正式推出Muse Voice Transcribe,这是该公司开发的首款实时音频感知模型。

Muse Voice Transcribe标志着Meta在实时语音模型落地应用上的重要里程碑。该模型支持实时流式语音转文字(ASR)、超过20人的说话人分离(Diarization)以及端点检测(Endpointing)。其具备多语言能力,可无缝处理语言切换,并通过语言、关键词和上下文偏置技术进一步提升准确率。

数据显示,截至2026年9月1日,Muse Voice Transcribe在流式语音转文字及公开说话人分离基准测试中均位列第一。

基于流式ASR的自回归架构

Muse Voice Transcribe隶属于Muse Spark系列,是一款自回归多模态模型。音频以80毫秒(12.5赫兹)为块进行处理,每个块被转换为一个软标记(soft token)。在处理每个音频块时,模型需决定是继续监听下一个音频块,还是输出文本标记。当模型选择继续监听时,会预测特殊标记<|next_audio|>,并在下一次输入时将其替换为实际音频块。

当音频流停止时,系统插入特殊标记<|empty_audio|>告知模型音频结束。接收该标记后,模型将输出所有剩余文本标记,不再产生<|next_audio|>标记。

由于模型完全掌控监听时机,它可在转录前决定接收多少音频上下文(即“延迟”)。准确率与延迟存在权衡:等待预测时间越长,转录越准确,但延迟越高。Muse Voice Transcribe具备“自适应延迟”功能,可根据难度动态调整每个单词的延迟。该功能通过强化学习实现,将词错率(WER)奖励与延迟奖励相乘结合,从而在最终转录时间的速度与准确性权衡上达到帕累托前沿。

集成说话人分离与端点检测

基于流式ASR架构,通过引入额外特殊标记,该模型可轻松支持其他音频感知任务。

在说话人分离方面,模型引入<|start_of_turn|>标记潜在说话人切换,并使用<|speaker_{A-Z}|>标签区分不同说话人。一旦检测到切换,模型立即预测<|start_of_turn|>,并将说话人标签预测推迟至块末尾。同一说话人的音频可能被<|start_of_turn|>分割,但片段间的说话人标签保持一致。

在端点检测方面,模型引入<|speech_onset|>标记语音开始,<|speech_endpoint|>标记用户结束说话时刻。这两个任务与流式ASR联合训练,并在ASR奖励基础上增加了针对说话人分离和端点检测的额外奖励。

核心能力

语言覆盖

Muse Voice Transcribe使用70多种语言训练,其中25种经过广泛验证。初始版本建议优先试用这25种已验证语言,同时也支持其他更多语言。

代码切换(Code-Switching)

针对双语使用者常见的语言混合场景,Muse Voice Transcribe原生支持任意形式的代码切换,无论是句内还是句间。模型还利用上下文偏置进一步提高识别准确率。

长上下文处理

模型原生支持超过一小时、多达20多名说话人的长音频输入,无需进行后处理。

应用场景

目前,Meta AI和Muse Code中的语音听写功能已由Muse Voice Transcribe驱动。用户只需按住'Fn'键,即可通过Meta AI处理屏幕上的任何窗口任务。该模型现已通过Meta Model API、Mac版Meta AI以及Muse Code开放获取。

【星途科讯 图文丨伊贝 首发于ZAKER科技,转载请注明出处】

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OEq5LUGrTz0BSrHPYNu0WXug0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券