WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

使用AI助手的人类标注员会污染训练数据吗?

是的,使用AI助手的人类标注者可能会污染训练数据,形成反馈循环,从而扭曲模型输出。

直接答案

是的,使用AI助手的人类标注者确实可能污染训练数据,且这一风险真实存在且日益加剧。一项研究发现,约三分之一的调查参与者已在借助AI辅助,而他们产出的数据逻辑连贯,足以被误认为高质量的人类成果,由此产生的系统性偏差看似有效信号,实则并非随机噪声[2]。这种污染会形成递归效应:经AI中介的反馈被重新注入未来模型的训练数据,催生反馈循环,最终导向一种狭隘且被模型塑造的共识[2]。危险在于,最终训练AI的将不再是真实的人类判断,而是其自身的输出结果。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

AI辅助标注如何实际污染训练数据?

核心问题在于一个反馈循环。当人类标注者使用AI工具来加快工作时,AI的建议会影响人类的标注结果。这些标注随后成为下一代AI模型的训练数据。一项研究将这种现象称为“递归威胁”——AI中介的回应成为训练数据,用于训练那些中介未来回应的模型,从而形成朝向模型塑造的共识的反馈循环[2]。这意味着AI实际上是在用自己的输出进行训练,而非基于独立的人类判断。

污染已广泛蔓延。2025年的一项研究估计,约三分之一的调查参与者报告使用了人工智能辅助工具[2]。这些由AI辅助生成的回答并非草率或随机的——它们有99.8%的概率通过注意力检测,并能产生心理测量学上可靠、符合假设的数据,与认真完成的人类工作难以区分[2]。传统的质量检查之所以失效,是因为它们旨在捕捉低投入的人类行为,而非高投入的AI模式。其结果是系统性偏差表现为信号而非噪声,使得标准检测方法几乎无法察觉。

AI辅助能否在不污染数据的前提下提升标注质量?

是的,但这完全取决于AI工具的设计和使用方式。在受控环境中,当AI增强而非取代人类判断时,标注质量实际上可能得到提升。一项研究测试了人机协同标注系统(HALS),该系统让AI实时向人类学习,从而减轻标注者的工作量。在七位病理学家的参与下,该系统将人工工作量减少了90.60%,并在四个应用场景中将数据质量平均提升了4.34%[4]。在此案例中,AI是向人类学习的工具,而非相反。

关键区别在于影响的方向。在HALS系统中,人工智能适应了人类标注员的专业能力,而非人类屈从于人工智能[4]。另一项关于“批量标注”的研究发现,当人工智能算法质量较差时,标注者容易过度依赖人工智能的建议,从而损害准确性[5]。研究人员专门探讨了缓解这种过度依赖的机制[5]。因此,当人工智能主导标注过程时,污染风险最高;而当人类保持主导权、人工智能仅用于加速重复性任务时,风险最低。

哪些因素会增加或降低污染的可能性?

风险取决于任务、工具设计以及标注者的行为。在学术写作中,一项研究发现,以迭代、高度互动的方式使用生成式AI工具(将其视为协作者)的博士生,其写作表现优于将其视为被动信息源的使用者[3]。然而,若AI的建议存在偏见,这种互动模式反而可能加剧污染。该研究指出,人类与AI在写作中的互动机制仍鲜有探索,这意味着我们尚不清楚协作何时会演变为污染[3]

在医学标注领域,风险更高,相关证据也更为复杂。一项关于病理诊断的研究发现,当病理学家使用具备可解释推理能力的人工智能工具(PathNarratives)时,其信任与信心评分(5分制)从3.88提升至4.63,分类准确率也从79.56%提高至85.26%[1]。但该研究仅招募了8名病理学家,并采用了一种旨在保持人类参与度的特定标注格式[1]。当标注人员专业水平较低、人工智能建议以权威方式呈现,以及标注工作面临时间压力时——这些在商业数据标注中十分常见——污染风险很可能会增加。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2021年至2025年间,其中2篇为2024年及以后发表,4篇发表于Q1期刊,累计被引用292次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的40篇文献。

本文引用的文献

1

PathNarratives:病理学人机协作诊断的数据标注

在一项涉及8位病理学家的研究中,一款具备可解释推理能力的人工智能工具(PathNarratives)将分类准确率从79.56%提升至85.26%,并将信任评分从3.88提高至4.63,这表明设计良好的人工智能辅助工具能在人类保持主导权的情况下提升标注质量。

2

合成受访者与人类数据的幻象

一项2025年的研究发现,约三分之一的调查参与者使用人工智能辅助,而AI生成的回答在注意力检测中通过率高达99.8%,产出的数据与人类认真完成的结果难以区分——这构成了递归污染威胁,即AI介入的数据将成为未来模型的训练数据。

3

AI辅助学术写作中的人机协作模式

一项针对10名博士生使用生成式AI工具进行学术写作的研究发现,迭代式、高度互动的协作能带来更好的写作表现,而将其作为被动来源进行线性使用则导致表现下降——这凸显出人机交互的性质对结果具有重要影响。

4

通过人类增强型AI标注系统进行生物数据注释

一种采用三种深度学习模型的人机协同标注系统(HALS),在涉及七位病理学家的四个应用场景中,将人工标注工作量减少了90.60%,并将数据质量提升了4.34%,这表明当AI被设计为向人类学习时,能够在无污染的情况下增强人类标注能力。

5

AI辅助人工标注

一项包含156名参与者在Mechanical Turk平台上进行的大规模研究发现,批量标注(AI辅助)虽能提升效率,但低质量的AI算法会导致标注者过度依赖,从而降低准确性——该研究明确探讨了缓解这种过度依赖的机制。