Google 新出的 Gemini 3.5 Transcribe,是个专门听写录音的模型。
它支持 85 种以上语言变体,普通话和粤语都能认。目前走 API 开放给开发者,还在公测期。
分实时和录音两版:实时版延迟不到一秒,适合直播字幕。录音版能分清谁在说话,还能标单词时间。
智能模式会帮你润色:它能自动删掉“嗯、啊”和口误。不过想读着顺,就得牺牲说话人区分和时间戳。
准确率进了一梯队:官方说非实时词错率仅 2.6%。但第三方榜单上它排第五,还不是全行业第一。
价格挺便宜:处理一小时录音最低只要 0.30 美元。不过免费层的数据可能会被拿去训练模型。
总的来说:它干活快又便宜,但涉及法律取证等场景,还得人工复核。