WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

高质量人类数据在人工智能时代会变得更有价值吗?

在人工智能时代,高质量的人类数据正变得愈发珍贵,因为AI无法复制人类的情感、细微差别以及多元化的价值观。

直接答案

是的,在人工智能时代,高质量的人类数据正变得更有价值,而非更少。像ChatGPT这样的人工智能系统无法复制人类情感体验的丰富性和价值多元性——一项研究发现,人工智能回应缺乏人类数据的情感深度[1],另一项研究则表明,只有当人工智能生成的价值覆盖范围比其自身更广时,人类才会更偏好这些价值[4]。综合这些研究,证据一致表明,人类数据在捕捉细微差别、伦理复杂性以及真实人类视角方面是不可替代的。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

AI真的能取代人类数据吗?证据表明:不能。

简短的回答是:不能——至少对于捕捉人类经验的丰富定性数据而言,无法做到。在2024年一项关于移动交友的故事补全研究中,研究人员意外地在数据集中发现了AI生成的回答。以女性主义新唯物主义为理论视角,他们发现AI回答缺乏人类生成数据所具有的情感和话语特质——AI根本无法复制定性研究核心所需的“人类经验的丰富性”[1]。这种差异并非细微;研究人员能够通过AI回答缺乏情感深度和叙事真实性来识别它们。

类似地,2023年一项关于不诚实行为的实验发现,人工智能建议(由自然语言处理算法生成)对人类行为的影响方式与人类建议相同——但仅限于助长不诚实行为时。来自任何一方的诚实促进建议均未提升诚实度[6]。这表明人工智能能够模仿人类的某些影响力,但无法完全捕捉人类道德推理的完整光谱。这对数据价值的启示显而易见:若你需要反映真实人类情感、伦理细微差别或生活经验的数据,人工智能生成的替代品将难以胜任。

为何人类价值观让人类数据具有独特价值

人类决策深受多元价值观的影响——这些价值观有时相互冲突,例如诚实与友谊之间的权衡。作为统计学习系统,AI倾向于平均化这些冲突,从而抹去了人类数据中那些富有张力的关键要素。2024年的一项研究推出了ValuePrism数据集,包含21.8万个与3.1万个人类撰写的场景相关联的价值观、权利和义务。这些价值观由AI(GPT-4)生成,人类标注员在91%的情况下认为其质量较高[4]。但关键在于:当研究人员构建了一个明确建模价值多元性的模型(Kaleido)时,人类实际上更偏好Kaleido的输出结果,认为其比GPT-4更准确、覆盖范围更广[4]。这意味着,即便AI生成了看似高质量的数据,它仍未能充分呈现人类价值观的全貌——这使得能够捕捉这些张力的人类生成数据变得更有价值,而非相反。

另一篇2024年的软件工程研究论文指出,尽管AI能在访谈和调查中模拟人类行为,但“让AI与人类生成的数据共存的一体化方法,很可能产生最有效的成果”[2]。这并非否定AI,而是承认人类数据提供了AI无法替代的东西:在社会技术领域中“根本不可或缺”的真实、富含情境的视角[2]

人类数据的需求正在上升,而非下降

颇具讽刺意味的是,人工智能时代反而增加了对高质量人类数据的需求。2022年一份关于医疗数据的政策文件指出,“医疗人工智能技术依赖数据来拓展其应用范围”,而数据匮乏则会“阻碍未来应用的开发”[3]。作者主张建立更完善的激励机制,鼓励患者共享数据,这恰恰是因为人工智能系统需要海量高质量的人类数据来持续优化。这并非小众议题——医疗人工智能正是最渴求数据的领域之一,而该文件强调,当前数据共享的限制已成为发展瓶颈。

即使在教育学领域,一篇2024年关于宗教研究的论文也指出,人工智能与人类专家能够“相互启发、相互丰富,甚至相互教导”[5]。作者将其视为一种协作关系,其中人类专长——包括智识上的卓越能力,而不仅仅是基于规则的推理——仍处于核心地位。各领域得出的结论是一致的:人工智能并未取代对人类数据的需求,而是放大了这种需求,因为AI系统基于人类数据进行训练,其输出质量完全取决于训练数据本身。

关于这些来源

该回答基于6篇经同行评审的研究——发表于2022年至2024年间,其中4篇为2024年及以后发表,3篇发表于Q1期刊,累计被引用156次——这些研究是从通过质量筛选的6项研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的62篇文献。

本文引用的文献

1

超越人类还是不及人类?评估AI作为参与者在在线质性研究中的作用

在一项关于移动交友的故事补全研究中,AI生成的回答因缺乏情感与话语特质而被识别出来,与人类数据相比存在明显差距;该研究得出结论,AI无法复刻人类经验的丰富性[1]。

2

AI能否在软件工程研究中替代人类受试者?

这篇关于软件工程研究的愿景论文指出,尽管人工智能能够在定性研究中模拟人类行为,但将AI与人类数据相结合的综合方法才能产生最有效的成果[2]。

3

在人工智能时代激励医疗健康数据的共享

一份关于医疗数据的政策文件指出,人工智能技术依赖人类数据来改进,而当前的数据共享限制阻碍了AI的发展,并呼吁建立更好的激励机制以促进数据共享[3]。

4

价值万花镜:以多元人类价值观、权利与义务赋能人工智能

研究利用来自31,000种情境的218,000个价值观数据,发现明确表征价值多元性的模型(Kaleido)在准确性和覆盖范围上比GPT-4更受人类青睐,这表明人工智能在处理多元人类价值观方面仍存在困难[4]。

5

《专注(于精湛技艺)即是一切所需:宗教学教学法与生成式人工智能》

一篇教育学论文指出,人工智能与人类专家可在教育领域协同合作,其中人类的智识卓越性仍应居于核心地位,而人工智能则作为辅助工具发挥作用[5]。

6

被算法腐蚀?AI生成与人类建议如何塑造(不)诚实行为

在一项实验中,AI提供的不诚实建议与人类建议一样,均增加了不诚实行为,但无论是AI还是人类提供的诚实建议,都未能提升诚实行为;算法的透明度对行为没有影响[6]。