发布于 2021-07-24 18:20:01
估计语音片段的质量的任务称为语音质量估计。一个稍微简单的任务公式是语音可理解性,它只衡量理解语音的难易程度,而不是语音信号的主观“质量”。这些都是语音信号处理中的既定任务,并且有行业标准以及前沿研究。这些方法(通常称为客观指标)考虑了人类的听觉系统和对语音的感知,以便对一组人在听力测试中如何评估结果给出一个很好的估计。由于人类感知的复杂性,好的方法比音频的差异要复杂得多。
如果您可以访问原始语音(无噪声),则可以使用基于全引用的方法。早期的国际电信联盟标准是PESQ,而截至2021年的最新标准是POLQA。开源实现的一个很好的指标是VISQOL。
如果您无法访问没有噪声的原始语音,则必须使用无引用/单端/非干扰方法。国际电信联盟的标准是P.563。目前有许多研究使用深度神经网络来更好地解决这一任务。示例包括NISQA、Gamper2019
有关更多详细信息,请访问https://github.com/jonnor/machinehearing/tree/master/audio-quality
https://stackoverflow.com/questions/68448062
复制相似问题