美国宾夕法尼亚大学认知科学研究团队近日完成一项针对ChatGPT、Google Gemini、GPT-4等主流大语言模型聊天机器人的专项研究,结果显示超82%的测试场景中,AI会根据用户提问内容产生隐性人格评判,这种评判进一步导致输出内容出现不公平偏差,涉及个人背景、价值取向的提问中偏差率高达61%。本文梳理研究核心发现,探讨AI隐性偏见对普通用户的实际影响。
研究团队设计了一组对照测试:同一个寻求职业发展建议的问题,分别向AI提问时,一组透露出“曾因小额盗窃获刑6个月”的个人背景,另一组则隐去这段经历,其余提问内容完全一致。测试结果显示,几乎所有参与测试的主流AI,给出的回应都出现了明显差异——带背景标签的提问得到的建议更笼统消极,AI明显更不倾向于推荐雇主容错率高的岗位。
过去行业对AI偏见的讨论,大多集中在AI输出内容本身的歧视性,比如对特定群体的负面描述,但本次研究发现了一个此前被忽略的环节:AI会主动对用户本人做出人格、可信度层面的评判,再基于这个评判生成回应。
研究统计,在所有测试场景中,82%的情况里AI都表现出了这种隐性评判,当提问涉及用户的个人身份、过往经历、价值取向时,偏差率飙升至61%。这种偏差不是AI主动输出歧视,而是藏在回应的详略、倾向性、语气中,普通用户很难轻易察觉,但会实实在在影响最终决策。
为什么AI会养成“评判用户”的习惯?研究团队分析,大语言模型的训练逻辑是学习人类文本的统计规律,而人类生产的网络文本本身就充满了对不同人群的刻板印象,模型在学习语言模式的同时,也习得了这套隐性的评判逻辑。
本次测试中,闭源大模型比如GPT-4、Google Gemini的偏差率略低于中小厂商的开源模型,主要因为头部厂商在对齐阶段做了更多偏见校准,但依然没能完全消除隐性评判偏差。哪怕是表现最好的GPT-4,偏差率也超过了40%。
目前,全球主流AI厂商的安全对齐工作,大多聚焦于避免AI主动输出歧视内容,很少将“AI对用户的评判公平性”纳入测试指标,这让隐性偏差成了行业未被重视的治理盲区。
本次研究的核心成员指出,随着AI越来越多地介入医疗分诊、职业咨询、信贷审核等对公平性要求极高的场景,隐性评判偏差带来的风险会被不断放大。未来不管是大模型厂商的安全测试,还是全球范围内的AI监管,都需要把对用户评判的公平性纳入考核标准,补上这块治理短板。而普通用户在向AI寻求涉及个人背景的重要决策建议时,也需要对AI回应的中立性保留一定警惕。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。