哪些证据能证明AI评估改革在真实院校中行之有效?

从数百所学校采用的评估框架到创造力评估中可测量的差距,已有证据表明,人工智能评估改革在真实机构中行之有效。

直接答案

确实有真实证据表明,人工智能评估改革在院校中发挥了作用,但效果参差不齐且依赖于具体情境。最有力的单一发现来自一项针对285名尼日利亚职业技术教育与培训(TVET)教育工作者和学生的研究:57.9%的人了解教育领域的人工智能,但对使用人工智能工具的信心仅处于中等水平;当前评估在捕捉技术技能方面仅被评为中等有效,且在评估创造力与创新方面存在显著缺口[2]。这表明,尽管人工智能改革被视为前景广阔,但实际实施仍面临基础设施薄弱、培训不足等障碍。积极的一面是,人工智能评估量表(AIAS)已被全球数百所院校采用,并翻译成30种语言,显示出广泛的实践应用[1]。综合这些研究来看,较大规模的调查一致指出,在人工智能改革发挥潜力之前,需要战略层面的支持——包括培训、数字基础设施和政策框架。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

什么才算AI评估重新设计确实有效的证据?

最直接的证据来自那些实际采纳并运用人工智能评估框架的机构。人工智能评估量表(AIAS)已在全球数百家机构实施,并被翻译成30种语言[1]。该量表最初于2024年初发布,2025年更新,为教育工作者提供了一种实用的任务重新设计方式,使人工智能的使用透明、恰当且与学习目标保持一致。数百所学校选择采用该量表,且作者根据大量反馈发布了改进版本,这本身就证明了该框架在实践中行之有效——至少作为一种沟通与重新设计的工具。

然而,采用并不等同于提升学习效果的有效性。一项针对61名教师的研究显示,他们在为生成式AI时代重新设计评估方式时,其动机包括维护学术诚信、帮助学生为AI增强型职业做好准备,以及适应技术变革[3]。但该研究也指出了显著挑战:教师需要专业发展支持,而公平性与可及性问题并不会因评估重新设计而自动解决。因此,证据表明,只有当重新设计成为更广泛的机构性努力的一部分时——而非作为孤立的解决方案——才能发挥作用。

可衡量结果中承诺与现实的差距

最具体的量化证据来自对尼日利亚TVET机构285名受访者(包括教育工作者、学生及信息通信技术人员)的调查[2]。当前评估体系在捕捉技术技能方面仅被评为中等有效,且在评估创造力与创新方面存在显著缺口。尽管57.9%的受访者了解教育领域的人工智能,但使用AI工具的信心仍处于中等水平。自适应测试、学习分析和自动评分等关键AI技术虽获得广泛认知与积极评价,但基础设施薄弱、培训不足、成本高昂及变革阻力等主要障碍依然存在。研究表明,即便AI重构被视为前景可期,典型现实情况是机构缺乏使其有效运作的基础支撑。

另一方面,一项利用ChatGPT生成学术论文的准实验研究发现,该人工智能能够针对典型的评估要求产出极具原创性且高质量的内容[5]。这恰恰说明了重新设计的必要性:传统的论文式评估难以抵御人工智能的冲击。同一项研究提出了一个评估框架,将评估重点从知识测试(知道什么)转向能力(知道怎么做)和表现(展示如何做)。这证明了重新设计在原则上是可行的——但前提是各院校必须真正采纳这一更广泛的框架,而这需要大幅调整课程体系。

更确凿的证据会是什么样

最有力的证据应来自对照研究,比较学生在AI评估重新设计前后的学习成果,理想情况下需涵盖多所院校。本文所引的五篇论文均未提供此类直接因果证据。最接近的是对61名教职人员的定性研究,该研究记录了重新设计的评估方案及其背后的逻辑,但并未衡量这些重新设计是否真正改善了学习效果或减少了作弊行为[3]。另一项研究采用物象民族志方法——将AI工具视为研究对象——探讨生成式AI如何支持体验式学习与真实性评估,但明确指出现阶段仍需开展实施效果评估[4]

现有证据表明,人工智能评估重新设计正受到大规模重视(数百所机构正在使用AIAS[1]),教师出于合理动机进行重新设计[3],并且当妥善整合时,AI能够支持更真实、更具体验性的评估[4]。然而,最佳情况(基础设施完善、人员训练有素的机构)与典型情况(资源不足、面临阻力且数字接入受限的机构)之间存在巨大差距。尼日利亚TVET研究[2]便是典型现实的清晰例证:认知度虽高,但信心与基础设施仍显滞后。在针对两类情境追踪学习成效的研究出现之前,AI评估重新设计的证据虽令人期待,但仍不完整。

关于这些来源

该回答基于5篇经同行评审的研究——发表于2024年至2025年间,其中5篇为2024年或之后发表,3篇来自Q1期刊,累计被引用198次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文数据库中检索到的51篇文献。

本文引用的文献

1

重构人工智能评估量表:面向教育评估的精细化框架

AI评估量表(AIAS)是一套在生成式AI时代重新设计评估方案的实用框架,已被全球数百家机构采用并翻译成30种语言。该量表于2025年根据反馈意见进行了更新,以明确其理论基础,并新增了“AI探索”层级[1]。

2

利用人工智能重新设计职业技术教育与培训评估体系,以提升技术教育中的创造力与创新能力

在一项针对尼日利亚职业技术教育与培训(TVET)机构285名受访者的调查中,当前评估方式在衡量技术技能方面仅被评为中等有效,且在评估创造力与创新方面存在显著不足;57.9%的受访者了解教育中的人工智能,但对使用AI工具的信心仍处于中等水平,主要障碍包括基础设施薄弱、培训有限以及成本高昂[2]。

3

为人工智能增强学习重新设计评估:生成式AI时代教育者框架

一项针对61名教职人员的定性研究发现,在生成式人工智能时代重新设计评估的动机包括维护学术诚信和帮助学生为未来职业做好准备,但同时也发现了诸如需要专业发展以及公平性担忧等重大挑战[3]。

4

使用生成式人工智能工具解释并增强体验式学习,以促进真实性评估

本研究运用物象民族志方法发现,生成式人工智能工具可与真实性评估及体验式学习相结合,构建以人为中心的学习体验,从而突破将AI仅作为写作或答题工具的局限,转向支持更深层次的学习[4]。

5

AI是否正在改变我们所熟知的学习与评估方式?来自ChatGPT实验的证据与一个概念框架

一项使用ChatGPT生成学术论文的准实验研究发现,该人工智能能够基于不同账户,针对同一评估要求生成高度原创且高质量的内容,但在引用方面存在困难,且无法从同一账户生成多篇原创论文[5]。