对AI辅助同行评审的公平评估需要衡量哪些方面?

对AI辅助同行评审的公正评估,必须衡量公平性、准确性、透明度和人类监督,而不仅仅是速度或成本节约。

直接答案

对AI辅助同行评审的公平评估,不能仅衡量速度或成本节约,还需追踪论文与作者之间的公平性、决策的统计准确性、透明度与可审计性,以及人类判断力的保留。例如,一项研究表明,优化最差论文而非平均论文的表现可以提升公平性[1],而另一项研究则警告AI可能复制现有偏见[5]。在本文所涉各项研究中,最有力的证据指向一种混合模式:由AI负责筛选与验证,但最终决定权仍保留在人类手中[2][4]

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

当AI介入时,我们如何衡量公平?

AI辅助同行评审中的公平性不仅仅关乎避免明显的歧视,更在于确保每篇论文都能获得公平的机会,尤其是那些非传统或来自知名度较低机构的论文。一种方法是优先优化“最弱势论文”的评审结果,而非追求所有论文的平均质量,正如2022年一篇论文所提出的那样[1]。这意味着评审过程的评判标准应着眼于它如何服务于那些原本可能获得最差评审结果的论文,而不仅仅是整体平均水平。

但公平也意味着要警惕人工智能可能从人类数据中继承的偏见。2021年的一项研究利用3300篇论文及其评审意见训练了一个人工智能,结果发现该AI能够揭示评审分数与其他质量指标之间的相关性,从而可能暴露出人类评审过程中隐藏的偏见[5]。这表明,公平的评估必须包含偏见审计——即检查AI辅助评审是否系统性地偏向或贬低某些主题、作者群体或机构。

AI辅助评审真的能带来更好的决策吗?

准确性关乎评审过程能否正确识别哪些论文应当被录用。一篇2022年的论文通过统计分析表明,一种为公平性设计的分配算法在恢复应当被录用的论文集合方面,也能达到接近最优的准确性[1]。这是一个关键指标:公平的评审系统不应为了公平而牺牲准确性,反之亦然。

然而,准确性不仅仅关乎最终的接受/拒绝决定,还涉及评审本身的质量——即反馈是否实质且有用。一篇2026年的论文警告称,AI辅助评审可能变得“程序化”而非“智识化”,侧重于清单和模板,而非深度的批判性参与[4]。因此,公平的评估必须衡量评审内容的深度和实用性,而不仅仅是结果。

您如何确保透明度和问责制?

透明度意味着流程接受公众监督,而问责制则意味着有人对决策负责。FAIR框架(公平、问责、诚信、责任)提出通过透明的审计追踪和记录在案的决策来确保问责制[2]。这一点至关重要,因为人工智能系统可能是不透明的,如果没有清晰的记录,就无法评估流程是否公平。

2026年的一项理论物理学协议更进一步,提出了一种“机器可读的科学结构”以及多层人工智能评审架构,并辅以与政府对齐的审计机制[3]。这表明,公平的评估应包含对AI推理过程是否可追溯、以及是否存在申诉或更正机制的检查。若无此类透明度,AI辅助评审可能沦为“不透明过滤器”[4]

在AI辅助评审中,人类应扮演什么角色?

证据有力地支持了一种混合模式,即人工智能提供辅助,但不会取代人类的判断。FAIR框架明确保留了人类在新颖性评估、伦理评价和最终决策方面的监督权[2]。同样,一篇2026年的论文也主张,人工智能应支持而非取代批判性评估[4]。这是因为人工智能能够处理诸如初步筛选和抄袭检测之类的重复性任务,但人类审稿人仍然需要承担细致入微的判断工作。

2013年的一篇论文提出了一种半自动化系统,其中人工辅助分类器有助于克服人类偏见和信息稀疏性问题[6]。这项早期工作预示了当前的共识:人工智能可以帮助减轻审稿人的负担和偏见,但前提是人类必须始终参与其中。因此,公平的评估必须衡量人机分工是否最优——即人工智能是真正在辅助,而非主导。

关于这些资料来源

这个回答基于6项研究(3篇同行评审,3篇预印本)——发表于2013年至2026年间,其中3篇为2024年或之后发表,1篇发表于Q1期刊,合计被引用271次——这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文的数据库中检索到的66篇文献。

本文引用的文献

1

PeerReview4All:同行评审中公平且准确的审稿人分配

提出了一种为最弱势论文最大化审稿质量的分配算法,证明了其在恢复被录用论文方面具有接近最优的公平性和统计准确性。

2

FAIR框架:道德混合同行评审

介绍FAIR框架(公平性、问责性、诚信性、责任性),用于混合同行评审,强调算法偏见检测、透明审计追踪以及人工对最终决策的监督。

3

理论物理学的受监管AI同行评审协议:恢复诚信、减少偏见、推动前沿科学发现

提出了一套用于理论物理学的受监管AI同行评审协议,包括机器可读结构及多层AI评审架构,并辅以与政府对齐的审计机制,以确保公平性与可复现性。

4

关于人工智能对同行评审实践影响的思考及其对更绿色科学评估的启示

警告称,人工智能辅助评审可能使程序性评估常态化,从而削弱对学术内容的实质性审视,并提议建立“元评估”框架,用以评价评审过程本身的质量与透明度。

5

人工智能辅助的同行评审

训练了一个AI模型,输入3300篇论文及其评审意见,结果表明AI能够根据文本预测评审分数,并揭示人类评审过程中可能存在的偏见,同时也引发了关于算法偏见的伦理担忧。

6

半自动化同行评审系统

提出了一种用于同行评审的半监督、人工辅助分类器,利用假设的ROC曲线展示了其在克服偏见和不完整性方面相较于传统方法的潜在优势。