为何基于监控的评估无法大规模推广
教育领域对人工智能的默认应对措施一直是加强检测——包括抄袭检查、作者身份验证和监控工具。但这种方法存在根本性缺陷,使其难以大规模持续推行。一项对2020年至2025年研究的系统综述发现,人工智能驱动的诚信工具仍存在偏见、误报和透明度有限的问题,这意味着它们可能错误地指控学生,或完全无法识别复杂的AI使用情况[1]。在一项涉及三所大学36名学者的多地点研究中,教职员工明确拒绝将“以检测为主导的监管”作为策略,认为这会破坏信任,且未能解决根本问题[4]。证据清晰表明:监控会引发一场军备竞赛,侵蚀教育关系,并且无法跟上快速演变的AI工具的步伐。
已被验证的替代方案:评估过程而非仅评估结果
这种方法具有可扩展性,因为它不依赖于抓作弊者,而是通过设计让作弊变得无关紧要。当评估需要人类判断、个人反思或实时协作时,人工智能便成为合作伙伴而非替代品。研究一致认为,这种转变还能让学生为未来将AI作为标准工具的职业做好准备,使评估更贴近他们未来的工作[2][5]。
各机构需采取哪些措施才能实现规模化应用
在没有监控的情况下推广过程导向的评估并非自动实现——它需要制度支持。研究中的教师指出了关键推动因素:学习新评估技术的专业发展、确保所有学生公平使用AI工具(以避免公平差距),以及为重新设计工作提供保障时间[4][5]。一篇论文将评估建模为受十种因素影响,包括市场压力和对灵活、以学生为中心的学习的需求,并认为由AI和学习分析支持的 formative assessment(形成性评估)可以促进这一转变[2]。关键在于:机构必须投资于培训和基础设施,而非监控软件。没有这种投入,默认做法仍将是监管,而证据表明监管既无效又损害信任。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2023年至2026年间,其中4篇为2024年及之后发表,2篇发表于Q1期刊,累计被引用63次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文数据库中检索到的44篇文献。
本文引用的文献
人工智能与高等教育学术诚信的转型:一项系统性综述
一项针对2020至2025年间研究的系统性回顾发现,人工智能诚信工具(如剽窃检测器、作者身份核查工具)仍存在偏见、误报及透明度有限等问题,并指出各机构应聚焦于伦理数字素养与评估体系的重构,而非依赖监控手段。
人工智能、分析技术及大学新型评估模型
对当前评估实践的SWOT分析指出,人工智能与学习分析是关键因素,并认为在这些技术支持下,形成性评估能够实现更灵活、以学生为中心的学习评估。
在人工智能时代,真实且富有创意的评估方式
一项关于真实性评估实践的综述提供了示例活动,展示了如何利用人工智能设计评估,以培养创造力、批判性思维和反思能力,这与美国心理学会(APA)为心理学专业学生设定的学习目标相一致。
从警务到设计:生成式人工智能与高等教育中可持续发展目标4的定性多站点研究
一项针对三所大学36名教职人员的定性研究发现,教师们拒绝以检测为主导的监管方式,更倾向于奖励过程、批判性思维和溯源能力的评估设计,并提出了一个与可持续发展目标4(SDG 4)相契合的实践框架。
为人工智能增强学习重新设计评估:生成式AI时代教育工作者的框架
对61名教职员工的访谈揭示了在生成式人工智能时代重新设计评估的动机与挑战,由此形成了“反对、规避、采纳、探索”框架,该框架可指导教育工作者选择恰当的评估策略。
