首页
学习
活动
专区
圈层
工具
发布

我做了个 sanoTTS:最小完整 TTS 模型仅 29.4 万参数(337KB),能在 3 美元单片机上跑,还有 146 万参数的版本打败了比它大 3 倍和 10 倍的模型

我一直在折腾怎么把 TTS 模型压到极小,目标是在没有 NPU、只有 512KB SRAM 的 3 美元芯片上跑起来。

折腾的过程中,我做出了 sanoTTS 这个系列:

支持 11 种嗓音、6 种语言

参数规模从 29.4 万到 220 万不等,对比一下,比 kokoro 小 1000 倍,比 voxtral TTS 小 9000 倍

150 万参数版本 SCOREQ 4.13、UTMOS 4.10

29.4 万参数版量化成 int8 后只有 337KB

能在网页里用 WebAssembly 跑,装个 sanotts-web 就行

还给了扩展教程,可以自己加语言、加嗓音

我可以很确定地说,这次发的一堆模型里包含了史上最小的神经 TTS 模型,在 whisper 上词错率大概 2%。

在 SCOREQ 上,sanoTTS-Amy(151 万)比 Inflect Nano(463 万)和 KittenTTS(1500 万)都强:4.13 对 3.81 对 3.02。

在 esp32 上实时因子 0.225,说白了就是 1 秒能生成 4 秒音频。

有啥问题随便问。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OCO7d0Onp69OdRAzWn6-umxw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券