关于AI评估重新设计,实地证据究竟揭示了什么?
最有力的证据来自2024年的一项研究,该研究测试了一种针对人机协作写作的特定评估方法[1]。研究人员以证据为中心进行设计,并利用CoAuthor写作工具的数据开展认知网络分析,发现不同用户群体在写作过程中存在显著差异。这意味着该方法能够区分人们在有AI辅助和无AI辅助情况下的写作方式,这是任何重新设计的评估方案中至关重要的第一步。该研究的样本量及特定工具(CoAuthor)限制了其普适性,但它提供了一个概念验证,表明涉及AI的写作可以通过结构化、数据驱动的方式进行评估。
一项2025年针对多所院校61名教职员工的研究,通过访谈和焦点小组探讨了重新设计评估的动机与挑战[2]。主要动机包括维护学术诚信、培养学生适应人工智能赋能的职业需求,以及遵循院校政策。然而,研究也揭示了显著障碍:教师需要专业发展支持,而公平性与可及性问题仍未解决。研究者提出了名为"反对、规避、采纳与探索"的概念框架以指导重新设计,但明确呼吁未来研究对其进行验证。这意味着现有证据支持教师希望重新设计评估的意愿,但实现这一目标的具体工具仍在测试中。
一篇2026年的论文[3]提出了一个基于“暴露度”和“脆弱性”的实用风险度量模型,旨在帮助教育工作者评估不同评估类型对AI辅助作弊行为的敏感程度。尽管该论文属于概念性研究(而非实证研究),但它借鉴了成熟的风险评估框架,并提供了具体实例,因此对实践者而言是一个有用的工具。该论文是此处最新的一篇,这表明该领域正朝着可操作、针对具体情境的指导方向发展,而非寻求一刀切的解决方案。
证据揭示的主要注意事项和挑战是什么?
2025年的一场专题讨论会[4]得出了一个关键发现,揭示了一个重大的文化障碍:当一位教授重新设计在线课程,明确允许并鼓励使用人工智能(只需注明来源)时,几乎没有学生承认自己使用了AI,尽管教授自己的分析强烈表明许多学生确实用了。这种围绕AI使用的“恐惧与保密文化”意味着,如果学生不坦诚,即使设计再精良的评估也可能失效。该讨论会还提出了更深层次的问题:我们究竟看重学习的结果还是过程?以及为什么某些认知任务(如写作)被视为“神圣不可侵犯”,而其他任务(如计算)则不然?这些并非仅仅是理论上的担忧——它们直接影响着重新设计的评估是否真正衡量了学习效果。
一项针对2019-2025年文献(含马来西亚案例研究)的2025年结构化综述[5]证实,人工智能工具虽能实现个性化与高效学习,但也警示了持续存在的隐忧:伦理问题、数据隐私、算法偏见、学术诚信及教师准备度。该综述强调,成功实施取决于“教学法适配、伦理保障机制及持续的制度支持”。这意味着人工智能评估重构的证据具有条件性——只有当机构投入培训、公平措施及政策制定时才能奏效。若缺乏这些条件,重构可能适得其反,甚至加剧现有不平等。
在这五篇论文中,有一个共同的主题:证据虽有前景,但仍不完整。[1]和[2]提供了实证数据,但两者都呼吁进行更多研究。[3]纯属概念性探讨。[4]和[5]则强调了文化与系统性障碍。目前没有一项研究提供了关于重新设计的评估体系的大规模纵向试验。因此,尽管现有证据支持开展试点项目并谨慎采纳,但尚不足以全面取代传统评估方式。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2024年至2026年间,其中5篇为2024年或之后发表,1篇来自Q1期刊——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的53篇文献。
本文引用的文献
基于生成式人工智能的以证据为中心的写作评估
研究基于证据中心设计与认知网络分析,对CoAuthor写作工具的数据进行分析,发现不同人机协作写作者群体在写作过程中存在显著差异,并提出了一种可行的评估方法[1]。
为人工智能增强学习重新设计评估:生成式AI时代教育者框架
对61名教职员工的访谈和焦点小组讨论揭示了重新设计评估的动机(学术诚信、职业准备)与挑战(培训需求、公平性),由此形成了“反对、规避、采纳与探索”框架[2]。
开发风险度量指标:人工智能与评估
提出了一种双维度风险度量方法(暴露度与脆弱性),用于评估各类评估方式对AI辅助不当行为的敏感程度,并附有供实践者参考的实例[3]。
人工智能
一场小组讨论报告指出,当一位教授重新设计课程,明确允许学生在注明出处的前提下使用人工智能时,尽管有确凿证据表明学生确实使用了AI,却几乎无人承认,这揭示了某种隐瞒文化[4]。
人工智能与教学变革:高等教育中的机遇与挑战
一项针对2019-2025年文献(包括马来西亚案例研究)的结构化综述发现,人工智能工具虽能实现个性化学习,但也引发了关于伦理、偏见、学术诚信及教师准备度的担忧,并得出结论:其成功取决于教学适配性与机构支持[5]。
