[AtS 协议] DeepFact:当 AI 挑战专家,如何重构学术报告的事实基准?
DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
本文提出了 DeepFact,一套针对深度研究报告(DRR)事实性校验的体系,包含自动化验证智能体 DeepFact-Eval 和动态演进数据集 DeepFact-Bench。该方法通过 Audit-then-Score (AtS) 协议,实现了基准测试与智能体能力的协同进化,在处理复杂、多步推理的科学命题校验上达到了 SOTA 水平。
TL;DR
验证深度学术报告(DRR)的事实性是一项“博士级”的挑战。本文指出,即便是 PhD 专家在面对此类任务时,单次标注的准确率也仅有 60.8%。为了解决这一痛点,作者提出了 Audit-then-Score (AtS) 协议,允许基准测试与模型协同进化。配套推出的 DeepFact-Eval 智能体在准确率上超越了所有现有基准,将 DRR 校验推向了新的高度。
1. 痛点:专家也会“翻车”的静态准绳
在 AI 辅助科研的今天,LLM 已经能写出长达数页的学术综述(DRR)。但问题是:谁来审计这些 AI 写的论文?
传统的校验方法(如原子事实提取)在学术语境下往往失效,因为学术命题通常涉及多篇论文的综合推理,而非简单的文本匹配。更糟糕的是,作者通过一项受控实验发现:所谓的“专家金标准”其实充满了噪声。受限于认知负荷,专家在处理高度专业且复杂的长文本时,极易产生疏漏。
2. 核心机制:Audit-then-Score (AtS) 演进式协议
作者的核心洞察是:科学知识不是冻结的快照,而是一场持续的对话。

AtS 协议将评测过程分为四个阶段:
- 评估 (Evaluate):运行 Challenger 智能体,产生判定。
- 挑战 (Challenge):当 AI 的判定与当前基准不符时,AI 必须提交证据和理由(Rationale)。
- 审计 (Audit):审计员(人或更强的 AI) adjudication 这一冲突。如果 AI 提供的证据更充分,则修改标签。
- 演化与计分 (Evolve & Score):更新基准库(Snapshots),并根据最新的“共识”为模型打分。
这种模式将专家从繁重的“从零标注”中解放出来,转变为“法官”,利用 AI 的检索能力来辅助人类决策。
3. 深度分析:DeepFact-Eval 架构
为了配合这一协议,作者设计了 DeepFact-Eval 校验智能体。

其工作流程体现了学术检索的直觉:
- 上下文提取:阅读整份报告以消除歧义。
- 广度规划:生成多样化的查询(Queries)覆盖相关文献。
- 深度追问:针对检索到的文档,动态生成细节问题(Detail Questioning)以捕捉微小的技术差异。
- 分组验证 (Lite 版):通过语义分组技术,将 10 个相关命题合并验证,在保持 76.3% 准确率的同时显著降低计算成本。
4. 实验战绩与洞察
在包含 6 个领域、20 份研究报告的 DeepFact-Bench 上,DeepFact-Eval 表现强劲。
4.1 性能对比
| 模型 | 准确率 (Acc) | F1 Score | 备注 |
|---|---|---|---|
| SAFE (GPT-4) | 55.9 | 53.0 | 基于 Snippet 的传统方法 |
| GPT-Researcher | 69.1 | 79.7 | 现有的深度搜索工具 |
| DeepFact-Eval | 83.4 | 86.9 | 本文方法 (SOTA) |
4.2 为什么 AtS 有效?
实验数据显示,随着 AtS 轮次的增加,专家在隐藏测试集上的表现从 60.8% 飙升至 90.9%。这印证了一个深刻的结论:在极复杂的专业任务中,人类更擅长做“选择题(审计)”而非“填空题(标注)”。

5. 总结与反思
DeepFact 的意义在于它打破了“人类标注者是绝对真理”的幻想。在未来,当 AI 能够处理数万篇文献并生成深度见解时,我们不仅需要更强的 AI 科学家,更需要一套像 AtS 这样动态的、可溯源的“司法系统”来确保证据链的严密性。
局限性:目前的 DeepFact-Eval 仍属于“文献综述者”而非“实验室科学家”,它能验证现有文献中已有的结论,但对于尚未发表的实验数据和前沿争议仍显乏力。
