我一直在折腾怎么把 TTS 模型压到极小,目标是在没有 NPU、只有 512KB SRAM 的 3 美元芯片上跑起来。
折腾的过程中,我做出了 sanoTTS 这个系列:
支持 11 种嗓音、6 种语言
参数规模从 29.4 万到 220 万不等,对比一下,比 kokoro 小 1000 倍,比 voxtral TTS 小 9000 倍
150 万参数版本 SCOREQ 4.13、UTMOS 4.10
29.4 万参数版量化成 int8 后只有 337KB
能在网页里用 WebAssembly 跑,装个 sanotts-web 就行
还给了扩展教程,可以自己加语言、加嗓音
我可以很确定地说,这次发的一堆模型里包含了史上最小的神经 TTS 模型,在 whisper 上词错率大概 2%。
在 SCOREQ 上,sanoTTS-Amy(151 万)比 Inflect Nano(463 万)和 KittenTTS(1500 万)都强:4.13 对 3.81 对 3.02。
在 esp32 上实时因子 0.225,说白了就是 1 秒能生成 4 秒音频。
有啥问题随便问。