反馈循环究竟如何放大偏见与幻觉?
反馈循环的运作方式如下:语言模型生成文本,人类(或自动化系统)对该文本提供反馈,模型随后根据反馈进行重新训练以保持一致。如果模型的初始输出包含细微的偏见或错误,人类反馈可能会强化这些偏见,模型便会在下一轮迭代中生成更极端的版本。这便形成了一种“滚雪球效应”——微小的偏见逐渐演变为严重的偏差。在一项包含1401名参与者的系列实验中,研究人员发现,人机交互对感知、情感及社会判断中偏见的放大程度,显著高于人与人之间的交互[2]。人工智能放大偏见的倾向,加之人类往往难以察觉其影响,使得这一效应尤为显著[2]。
对于幻觉现象,其机制类似:若模型生成了听起来合理但虚假的陈述,而人工审核者(或自动奖励系统)未能发现错误,模型便会认为此类编造是可以接受的。经过多轮迭代,模型可能对生成虚假信息更加自信,因为反馈回路无意中对其进行了奖励。尽管本文更侧重于偏见问题,但同样的原理也适用于幻觉——若反馈信号存在噪声或偏差,该循环便会强化不准确性。
研究显示,偏见能增长到什么程度?
证据表明,偏差放大是可测量的,且可能相当显著。在知识库问题生成任务中,与现有方法相比,一种经过偏差校正的基于人类反馈的强化学习(RLHF)框架在三个数据集上的性能分别提升了24.5%、4.21%和2.16%[1]。这些提升具体源于减少了反馈循环中的谄媚偏差和确认偏差——这意味着,若未进行校正,这些偏差会使性能相应下降[1]。另一项研究发现,RLHF可能延续人类反馈中存在的偏差,且若缺乏稳健的缓解机制,模型会随时间推移变得更加有偏差[4]。
这种放大效应并非只是理论上的担忧。在人机交互实验中,反馈循环导致判断中最初的小错误在多领域内逐步升级为更大的错误[2]。其影响显著大于人与人之间的互动,因为人工智能系统往往更激进地放大偏见,而人类又倾向于认为AI比实际更客观[2]。这意味着,即便是最初微小的偏差——比如对某个群体稍显偏好——经过几轮反馈后,也可能演变成巨大的差异。
为什么反馈循环会让写作变得更趋同?
反馈循环往往促使模型生成安全、常规且泛泛的输出,因为人类反馈通常更青睐那些礼貌、不具争议性且符合通用语言习惯的回应。一项针对经RLHF优化的聊天机器人的修辞分析发现,该流程强化了主流语言的使用,并使学习过程脱离具体语境——这意味着模型学会生成广泛可接受但缺乏人类写作多样性与创造性的文本[3]。这是因为反馈机制会隐性惩罚新颖性或冒险行为,即便这些特质在某些情况下可能值得推崇。
问题在于,RLHF(基于人类反馈的强化学习)的设计目标是最大化人类认可度,这通常意味着要避免任何可能被视为冒犯、异常或错误的内容。因此,模型会收敛到狭窄的安全、通用回答范围内。这与生成对抗网络(GANs)中出现的模式崩溃问题类似,即模型仅产生有限种类的输出[5]。这种反馈循环会降低生成文本的多样性,使其显得平淡且公式化。一项关于生成式相关性反馈的研究发现,改变生成子任务(例如查询与论文)可以提升多样性,但默认的RLHF训练往往朝着相反方向推进[6]。
关于这些来源
该回答基于6篇经同行评审的研究——发表于2023年至2025年间,其中4篇为2024年及以后发表,3篇发表于Q1期刊,总被引次数达1108次——这些研究是从通过质量筛选的6项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的47篇文献。
本文引用的文献
迈向类人提问:基于偏差校正的人类反馈强化学习的知识库问题生成
一种针对知识库问题生成的偏差校正RLHF框架,有效减少了谄媚倾向和确认偏差,在三个数据集上相较于现有方法分别取得了24.5%、4.21%和2.16%的相对性能提升。
人机反馈循环如何改变人类的感知、情感与社会判断
在包含1,401名参与者的实验中,人机反馈循环在感知、情感和社会判断方面放大的偏差显著超过人与人之间的互动,这是因为人工智能系统会放大偏差,而人类往往意识不到人工智能的影响。
基于人类反馈的强化学习中的伦理与说服:一种程序修辞学方法
对基于RLHF增强的聊天机器人进行的修辞分析发现,该流程强化了霸权语言的使用,延续了偏见,使学习脱离语境,并侵蚀了人际关系,从而导致输出内容趋于同质化且缺乏多样性。
减轻大型语言模型中基于人类反馈的强化学习中的偏见
一项关于减轻大语言模型RLHF中偏见的综合研究发现,人类反馈可能引入偏见,并提出了减少这些偏见的机制,从而展示了与伦理标准更优的对齐效果。
生成式人工智能
一篇关于生成式AI的综述指出,GAN训练常面临不收敛、模式崩溃及超参数敏感等问题,这可能限制生成内容的多样性与创造性。
基于大语言模型的生成式相关性反馈
使用大语言模型进行生成式相关性反馈,相比伪相关性反馈,在MAP上提升了5-19%,在NDCG@10上提升了17-24%,这表明不同的生成子任务能够提高输出多样性。
