近日,一项研究表明,研究表明主流大模型普遍暗藏对男性的性别偏见,而且研究者终于找到了背后的原因。
研究人员对13款主流大语言模型开展测试发现:在多种对话场景下,模型对男性会产出具有统计学意义的负面倾向。
实验设计很巧妙:使用完全相同的陈述内容,仅仅修改发言者的性别设定(中性、男性、女性),其余信息全部保持不变。
目的就是验证:AI的评判结论,是否会仅仅因为发言者性别而发生改变。
实验结果,撕开了AI自动化系统潜藏的缺陷。
所有被测模型全部存在性别敏感偏差。
有10%‑35%的相同表述,仅仅因为发言者性别不同,就被给出完全矛盾的真伪判定标签。
对比男性、女性两种版本的测试样本,结论反转的最高比例达到23.6%。
也就是说:同一句话是真是假,AI的判断完全取决于这句话是谁说的。
研究总结出两种核心偏见模式:
• 判断不稳定性:面对完全一致的客观事实,给出前后割裂、摇摆不定的评判。
• 倾向性偏差:带有系统性的偏袒倾向。
其中最突出的现象,就是明显的「对男性持怀疑」模式。
一模一样的观点,当设定为男性身份说出时,对比中性、女性版本,模型会更加严苛、充满怀疑,更容易直接标记为虚假错误信息。
如今大模型已经大规模落地,接管内容审核、合规筛查、事实核验这类关键工作。
如果模型底层本身就暗藏针对特定群体的偏见,那我们运行的就不是客观中立的程序。
而是在把固有的刻板偏见,交给AI自动化放大。