首页
学习
活动
专区
圈层
工具
发布

“嗯、啊、说错了”自动删,Google推出新一

Google 新出的 Gemini 3.5 Transcribe,是个专门听写录音的模型。

它支持 85 种以上语言变体,普通话和粤语都能认。目前走 API 开放给开发者,还在公测期。

分实时和录音两版:实时版延迟不到一秒,适合直播字幕。录音版能分清谁在说话,还能标单词时间。

智能模式会帮你润色:它能自动删掉“嗯、啊”和口误。不过想读着顺,就得牺牲说话人区分和时间戳。

准确率进了一梯队:官方说非实时词错率仅 2.6%。但第三方榜单上它排第五,还不是全行业第一。

价格挺便宜:处理一小时录音最低只要 0.30 美元。不过免费层的数据可能会被拿去训练模型。

总的来说:它干活快又便宜,但涉及法律取证等场景,还得人工复核。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OnD81u2USBgLSuIndziOCbwA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券