使用会议转写工具时,单人讲话通常比较稳定;一旦进入多人讨论,结果就容易变得混乱。
明明是同一个人连续发言,逐字稿里却被标成了两个不同的发言人;两个人轮流讲话,系统又可能把内容合并到同一个人名下;遇到插话和同时发言时,甚至会出现文字缺失、发言顺序错乱等问题。
这些现象经常被简单归结为“语音识别不准确”,但实际上,文字转写和发言人判断通常由不同模块完成。多人会议中的“认错人”,很多时候并不是ASR没有听清楚,而是说话人分离、音频切分或声纹匹配环节出现了偏差。
要理解这个问题,需要先区分几个容易混淆的概念。
一、语音识别并不负责判断“是谁在说话”
语音识别通常被称为ASR,它的主要任务是把声音转换成文字。
模型接收到一段音频后,会尝试输出对应的汉字、数字、英文单词和标点。它关心的是“这段声音说了什么”,并不一定知道声音来自哪位参会人员。
而逐字稿中的“发言人1”“发言人2”,通常来自另一个模块,也就是所谓的说话人分离。
说话人分离需要完成两个判断:
第一,不同时间段的声音是否属于同一个人;
第二,整场会议中一共出现了多少位发言者。
系统会从每段语音中提取能够反映声音特征的信息,再比较不同片段之间的相似程度。相似度较高的片段会被归为同一组,相似度较低的片段则会被划分给其他发言人。
因此,一份多人会议逐字稿实际上是两类结果拼接而成的:
ASR输出文字内容;
说话人分离输出每段文字对应的发言人编号。
只要其中一个环节出现错误,最终显示出来的结果就可能不符合实际情况。
二、系统是怎样生成“发言人1、发言人2”的?
会议音频通常会先被切成若干语音片段。
系统需要判断每段音频从什么时候开始、什么时候结束,再从中提取说话人的声音特征。这些特征一般会被表示成一组数字向量,也就是常说的说话人嵌入。
x-vector、ECAPA-TDNN和CAM++都属于常见的说话人特征提取方法。它们并不会直接输出姓名,而是将声音转换成便于计算机比较的特征。
接下来,系统会对这些特征进行聚类。
例如,一场会议被切成100个语音片段,聚类算法可能判断其中40段来自同一个人,另外35段来自第二个人,剩余25段属于第三个人。最终逐字稿里就会出现发言人1、发言人2和发言人3。
这种处理方式存在一个前提:同一个人的声音特征应该相对稳定,不同人的声音特征应该具有足够差异。
但在真实会议中,这个前提并不总是成立。
一个人距离麦克风较近时,声音清晰且低频较完整;当他转头、后仰或走到会议室另一侧时,录下来的声音特征会发生变化。系统有时会误以为出现了另一位发言者,于是把同一个人拆成两个编号。
反过来,如果两位参会人员音色接近、说话方式相似,或者录音质量较差,系统也可能将两个人合并成同一个发言人。
三、为什么同一个人会被拆成多个发言人?
同一位参会者在会议中的声音并不是固定不变的。
影响声音特征的因素包括:
与麦克风之间的距离;
说话方向和坐姿;
音量大小;
情绪和语速;
麦克风通道;
环境噪声;
回声和混响;
音频压缩方式。
还有一个容易被忽略的因素是语音片段长度。
说话人特征提取通常需要一定长度的有效语音。如果一个人只说了“可以”“没问题”“我补充一下”这类很短的句子,系统能够获取的声音信息有限,判断结果容易波动。
当片段过短时,同一个人的不同片段可能被分配到不同聚类中;片段过长时,如果中间混入其他人的插话,又可能把两个人的声音特征混在一起。
因此,说话人分离并不是简单地比较音色,而是受到音频切片、模型特征和聚类参数共同影响。
在熙瑾会悟等多人会议处理系统中,发言人结果同样需要经过语音检测、特征提取和聚类流程。实际部署时,会议室拾音条件和参数设置往往会影响最终标签是否稳定,而不是只更换某一个模型就能解决全部问题。
四、两个人同时讲话时,系统会发生什么?
重叠语音是多人会议中最难处理的情况之一。
正常轮流发言时,每个时间段通常只有一个主要说话人,系统可以分别提取特征。但当两个人同时讲话时,麦克风接收到的是混合信号。
对于一段混合声音,系统可能有几种处理结果:
第一种,只保留声音较大的那个人,另一人的内容被忽略。
第二种,把两个人的声音当成同一个新的声音特征,从而生成错误的发言人标签。
第三种,文字识别出了一部分内容,但无法准确判断这些文字分别属于谁。
第四种,语音活动检测认为这段声音质量较差,直接丢弃部分内容。
在会议现场,人往往能结合语气、座位和上下文判断是谁在讲话,但算法只能依赖音频信号。单通道录音中,两个人的声音已经混合到一起,后续恢复难度很高。
有些系统会加入重叠语音检测,先判断某个片段中是否存在多人同时发言,再使用语音分离模型尝试拆分不同声音。但语音分离本身也可能产生失真,拆分后的音频未必适合继续做高准确率转写。
如果会议经常出现激烈讨论或频繁插话,仅依靠算法通常很难得到完全准确的发言人结果。调整会议组织方式、增加拾音通道或者使用阵列麦克风,有时比继续提高模型复杂度更直接。
五、声纹识别怎样把编号对应到真实姓名?
说话人分离解决的是“哪些片段属于同一个人”,但它并不知道发言者姓名。
要把“发言人2”进一步显示成“张三”,通常需要声纹识别。
声纹识别会提前保存参会人员的一段声音样本,并提取对应的声纹特征。会议过程中,系统再将当前说话人的特征与声纹库进行比较,从中找出相似度较高的身份。
这一过程看起来类似人脸识别,但声音的稳定性通常更容易受到环境影响。
注册声纹时使用手机近距离录音,开会时却使用会议室远场麦克风,两次音频的信道条件差异较大,匹配分数可能下降。一个人感冒、声音沙哑,或者讲话时间过短,也可能导致声纹判断不稳定。
所以,声纹匹配通常不会只输出“是”或“不是”,而是输出一个相似度分数。系统需要设置阈值:
高于阈值,认为与某个已有身份匹配;
低于阈值,保持为未知发言人;
位于临界区间时,交给人工确认。
阈值设置过低,容易把声音相似的人认成同一个人;阈值设置过高,又会导致大量已登记人员无法自动匹配。
熙瑾会悟在涉及声纹关联的使用流程中,也需要提前准备相对规范的声音样本。更稳妥的做法不是让系统强制给每一段话分配姓名,而是在匹配可信度不足时保留发言人编号,之后再由使用者修正。
六、为什么提前告诉系统参会人数仍然会出错?
一些说话人分离系统允许提前设置参会人数。
已知人数可以缩小聚类范围。例如明确会议中有5位发言者,算法就不需要自行判断应该分成4组、5组还是6组。
但提前设置人数只能减少一部分错误,并不能解决所有问题。
如果实际有8人参会,但只有5人发言,系统应该按照参会人数还是实际发言人数聚类,就需要结合产品设计判断。有人只说了一句简短内容时,系统也可能无法形成稳定的独立特征。
如果将人数固定为5,但音频中实际只有4个有效说话人,聚类算法可能被迫把其中一个人拆成两组,以满足预设数量。
因此,“参会人数”和“有效发言人数”并不是同一个概念。实际系统通常需要结合会议名单、发言记录和聚类结果综合处理。
较合理的设计是把自动判断作为初始结果,再允许用户合并或拆分发言人。例如系统把同一个人识别成发言人2和发言人5,用户修正一次后,相关片段可以统一归并。
七、麦克风数量为什么会影响发言人判断?
单个麦克风主要依靠音色差异区分发言者,而多个麦克风还可以利用声音到达不同通道的时间差和能量差。
如果每位参会者都有相对独立的麦克风通道,那么系统可以先根据通道判断发言位置,再结合声音特征确定身份。这通常比所有人共用一条混合音轨更容易处理。
会议室阵列麦克风还可以进行声源定位,估计声音来自哪个方向。当说话人分离结果不稳定时,方向信息可以作为辅助条件。
不过,多通道并不意味着一定准确。
会议室音响回放、麦克风串音、设备增益不一致,都可能让同一个声音同时出现在多个通道中。如果系统只按照“哪个通道声音最大”判断发言人,也可能出现错误。
因此,较完整的多人会议处理往往会综合使用:
声音特征;
麦克风通道;
声源方向;
参会人员名单;
声纹库;
发言上下文。
这些信息相互补充,通常比单独依赖某一种方法更稳定。
八、怎样测试多人会议中的“认错人”问题?
测试多人会议系统时,只看转写文字是否正确并不够。
一份逐字稿可能错字很少,但大量内容被分配给错误的发言人;也可能发言人标签基本正确,专业术语却存在较多错误。这两类问题需要分开统计。
比较实用的测试方法,是准备一段真实多人会议录音,并人工制作参考标注,包括:
每句话的开始和结束时间;
实际发言人;
正确文字;
是否存在重叠发言;
是否为短句;
是否包含专业术语。
然后分别检查以下指标。
1. 发言人数量是否正确
系统识别出的发言人数与实际有效发言人数是否一致。
2. 同一人是否被拆分
统计同一位发言人被分配到多个编号的情况。
3. 不同人是否被合并
检查两位或多位发言人的内容是否被归入同一个标签。
4. 发言人错误率
计算被分配给错误人员的语音时长占比。业内常见的说话人错误率通常会同时考虑漏检、误检和身份混淆。
5. 重叠语音处理效果
单独统计重叠片段,不要将其与普通轮流发言混在一起。
6. 声纹匹配效果
检查姓名识别的误认率和拒识率。不能只统计成功识别了多少人,还要看是否把一个人错误认成另一个人。
在熙瑾会悟这类包含转写和声纹模块的系统测试中,也应将文字准确性与身份准确性分开记录。即使使用同一段会议音频,两项指标的变化也不一定一致。
九、怎样减少多人会议中的身份混乱?
算法之外,一些录音和会议组织细节也会影响结果。
会议开始前,可以提前录入参会人员名单,并尽量采集与实际会议设备相近的声纹样本。正式讨论时,麦克风应尽量放在参会人员距离相对均衡的位置,避免个别人声音过强、其他人过弱。
多人讨论中,可以适当减少长时间重叠发言。对需要形成正式记录的会议,主持人明确点名后再发言,也有利于后续校对。
系统层面则应保留人工修正功能。发言人分离和声纹识别更适合提供初始结果,而不是将算法判断视为不可修改的最终答案。
一旦用户确认“发言人3”和“发言人6”属于同一个人,系统可以批量合并相关片段;如果一个标签中混入了其他人的内容,也应该允许按照时间段重新拆分。
多人会议处理的目标并不是完全取消人工,而是将原本需要从头回听的工作,缩小为对少量可疑片段进行确认。
十、结语
多人会议转写容易“认错人”,并不能简单归结为语音识别模型不够准确。
从音频进入系统开始,语音活动检测决定片段边界,说话人模型提取声音特征,聚类算法生成发言人编号,声纹识别再尝试关联真实身份。遇到重叠发言时,还可能需要额外的检测和分离处理。
任何一个环节出现偏差,最终逐字稿中的发言人标签都可能受到影响。
因此,评价一套多人会议转写系统时,既要看文字是否正确,也要看发言人是否稳定、身份是否可追溯,以及错误出现后能否方便地人工修正。
对于真实会议而言,拾音条件、算法处理和人工确认并不是互相替代的关系。三者配合,通常比单独追求某一个模型指标更有意义。