AI评估重塑是否改变了绩效衡量方式?

AI评估的重新设计将绩效衡量从记忆转向过程,但引发了公平性和诚信方面的担忧,需要新的指标来应对。

直接答案

是的,人工智能评估的重新设计从根本上改变了绩效衡量的方式,将重点从知识记忆转向过程、推理以及人机协作。有证据表明,像ChatGPT这样的人工智能聊天机器人仅能正确回答约一半的医学委员会试题(2023年一项研究显示为46%)[1],这意味着当人工智能能够生成答案时,传统的基于记忆的测试变得不可靠。相反,评估必须考察学生如何使用人工智能工具、他们的批判性思维能力以及验证人工智能输出的能力,因为高等教育领域的利益相关者有条件地接受基于人工智能的评估,但要求透明度和公平性[2]。综合这些研究,最有力的证据始终指向需要重新设计衡量标准,以捕捉伦理推理、协作和过程,而不仅仅是正确答案。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何传统绩效指标(如考试成绩)在AI面前变得不可靠

当人工智能能够生成复杂的答案时,仅凭选择题的正确数量来衡量一个人的知识水平已不再可靠。2023年一项关于ChatGPT在眼科委员会考试题目中的研究发现,该AI在2023年1月仅答对了46%的题目,而一个月后这一比例升至58%[1]。这意味着学生可能通过让AI作答来获得及格分数,但分数反映的是AI的知识,而非学生本人的水平。同一项研究还发现,ChatGPT仅44%的情况下会与人类受训者选择相同答案,这表明AI的推理过程往往与人类的临床判断存在差异[1]。因此,如果继续使用传统的基于记忆的测试,你将无法判断成绩究竟应归功于学生还是AI。

这一问题并不仅限于医学领域。一项2026年全球医学教育概念分析指出,基于个人原创与知识复现的传统评估模式,正因能够生成令人信服的临床叙述与分析结果的生成式AI而“日益承压”[4]。作者呼吁对评估体系进行根本性重新设计,以维护信任与公平。换言之,旧的衡量标准已无法再测出你原本以为它能测出的东西。

旧指标应被什么取代:过程、协作与伦理推理

这些研究逐渐形成共识:衡量表现的标准应取决于人与AI协作的能力,而非能否在记忆检索上胜过AI。2026年一项针对420名高校学生、教师及管理人员的调查显示,利益相关方有条件地接受基于AI的评估工具——他们看重效率与个性化反馈,但要求AI评分过程透明、算法公平且有人类监督[2]。接受度的最强预测因子是感知有用性(每单位有用性使接受度提升0.42),其次是感知公平性(0.29),而隐私担忧则会降低接受度(-0.31)[2]。这意味着新的表现评估指标必须包含:学生是否批判性评估了AI的输出?是否合乎道德地使用工具?能否解释自己的推理过程?

2025年一项关于AI驱动图形设计工具的研究印证了这一转变。研究发现,当学生与AI协同创作——使用生成式模型和自适应反馈系统时——相较于传统教学,他们的创造力、参与度和概念清晰度均有所提升[3]。作者指出,评估应衡量人机协作中的"流畅性、原创性和视觉连贯性",而非仅关注最终作品。同样,医学教育分析报告主张将"与专业素养相匹配的AI素养"作为核心能力纳入评估体系[4]。在这些领域中,新的评估标准聚焦于过程、判断与协作,而非仅仅追求正确答案。

难点:公平与诚信难以衡量——且易出错

重新设计评估并不会自动使其变得公平或可信。2022年一项针对三家科技公司人工智能从业者的研究发现,当他们试图通过按人口群体细分表现来评估AI系统的公平性时,他们在选择正确指标、确定哪些群体重要以及收集足够数据方面遇到了困难[5]。商业压力往往使客户优先于边缘群体,而从业者也缺乏与领域专家的互动[5]。这对任何重新设计评估的人都是一个直接警示:如果从一开始就不将公平性融入指标中,你可能会创建一个看似客观实则放大偏见的系统。

高等教育调查发现,STEM专业的学生比人文学科的学生更信任自动评分系统(这一学科间的差异具有统计学意义)[2]。这意味着,即便算法在技术上准确无误,一刀切式的人工智能评估仍可能被某些群体视为不公。医学教育分析进一步指出,评估体系的重构必须包含“协同治理”和教师发展,以维持专业标准[4]。简言之,新的绩效指标必须透明、可解释且因地制宜——否则将无法通过公平性检验。

关于这些来源

该答案基于5篇经同行评审的研究——发表于2022年至2026年间,其中3篇为2024年及以后发表,2篇发表于Q1期刊,累计被引用421次——这些研究是从通过质量筛选的5项研究中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的54篇文献。

本文引用的文献

1

人工智能聊天机器人在眼科知识评估中的表现

2023年1月,ChatGPT在125道眼科委员会考试题中仅答对了46%(2月升至58%),且与人类受训者的答案匹配率仅为44%,这显示了人工智能在基于记忆的测试中的局限性。

2

对高等教育中基于人工智能的评估工具的认知

在一项针对420名高等教育利益相关者的混合方法研究中,AI评估的接受度受到感知有用性(β=0.42)和公平性(β=0.29)的预测,而隐私担忧则降低了接受度(β=−0.31);学生比教师更倾向于接受。

3

AI驱动的图形设计工具:艺术课程中的范式转变

与传统教学相比,AI驱动的图形设计工具提升了学生的创造力、参与度和概念清晰度,这表明评估应侧重衡量人机协作与创意过程。

4

人工智能、评估诚信与医学教育中的专业精神:全球性颠覆与海湾合作委员会地区的经验启示

生成式人工智能颠覆了传统基于记忆与个人独立完成的医学评估模式,要求重新设计融合AI素养、职业素养与伦理责任的评估体系。

5

评估AI系统的公平性:AI从业者的流程、挑战与支持需求

三家科技公司的人工智能从业者在设计公平的分项评估时面临诸多挑战,包括选择评估指标、识别相关人口群体,以及克服优先考虑客户而非边缘群体的商业压力。