[ICLR 2025 投稿] DARE-bench:让数据科学智能体告别“结果论”,走向过程忠实

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

总结
问题
方法
结果
要点
摘要

本文推出了 DARE-bench,一个包含 6,300 个基于 Kaggle 任务的大规模数据科学(Data Science, DS)智能体基准测试。该基准通过引入可验证的 Ground Truth,重点评估大语言模型(LLMs)在机器学习建模(MM)和指令遵循(IF)方面的过程忠实度,填补了现有评价体系的空白。

TL;DR

AI 真的能替代数据科学家吗?目前的瓶颈不在于写不出代码,而在于“过程失控”。Snowflake AI Research 联合休斯顿大学提出了 DARE-bench,一个拥有 6,300 个任务的大规模数据集。它不仅能测试模型预测得准不准,还能测试模型是否“听话”地执行了特定的预处理步骤。通过该基准训练,小模型 Qwen3-4B 在 DS 任务上的表现暴涨 8 倍。


痛点深挖:为何 DS 智能体总是“差之毫厘”?

在真实的数据科学场景中,我们不仅关心模型最终的 F1 分数,还关心逻辑的严密性。例如,资深科学家要求你在处理数据时必须使用特定的随机种子、特定的 Missing Value 填充策略。

现有的基准测试(如列表中的 DSBench, MLE-bench 等)大多存在以下局限:

  1. 评价维度单一:只看最终预测 Target 的准确率,不看中间过程。
  2. 不可复现性:由于环境变化和随机因子,模型同样的脚本可能跑出不同的结果。
  3. 训练资源匮乏:缺乏高质量、可直接用于强化学习的可验证反馈(Verifiable Rewards)。

现有基准对比


核心贡献:DARE-bench 的自动化炼金术

作者构建了一个自动化的构建流水线,将 Kaggle 的原始数据通过 LLM 辅助的任务设计、噪声注入和沙盒验证,转化为标准化的任务。

1. 任务双子星:IF vs. MM

  • Instruction Following (IF):模型必须复写参考工作流。如果要求用均值填充,你用了中位数,即便结果凑巧对了,评分也是 0。这测试的是模型的指令遵循能力。
  • ML Modeling (MM):结果导向。给模型最大限度的自由,看其能否在限定时间内训练出性能最强的模型。

2. 确定性沙盒环境

为了解决“复现难”的问题,DARE-bench 在 Docker 沙盒中运行。通过严格控制随机种子和库版本,作者发现复杂的 DS 流程也可以产生确定的输出,这为 RLVR(基于可验证奖励的强化学习) 铺平了道路。

DARE-bench 自动化流水线


实验战绩:微调的力量

作者测试了包括 GPT-5 (o系列预览版), Claude-Sonnet-3.7 在内的众多顶尖模型。

关键发现:

  • 顶级模型也翻车:即使是 Claude 3.7,在处理复杂的时间序列(Time-series CF)任务时,得分也偏低。
  • 开源模型的崛起:基座模型 Qwen3-32B 的初始得分仅 23.25,但在使用 DARE-bench 进行监督微调(SFT)后提升至 42.42。
  • 强化学习的奇迹:Qwen3-4B(仅 40 亿参数)在经过 GRPO 算法强化后,得分从 4.39 疯狂提升到 37.40,充分证明了“可验证奖励”在 DS 领域的巨大潜力。

微调结果对比


深度洞察:为什么智能体会失败?

通过对轨迹(Trajectories)的定性分析,作者总结了三大失败主因:

  1. API 滥用:生成了正确的代码,但在调用工具(Tool Calling)时漏掉了文件名等关键参数。
  2. 指令疏忽:跳过了必要的转换步骤(如忘了固定随机种子,见下图)。
  3. 推理脆弱:在时间序列任务逻辑中,往往只会简单的“取均值”或“取最后一个值”,缺乏真正的时序推理。

指令遵循失败案例


总结与展望

DARE-bench 不仅仅是一个“考试卷”,它更是一本高质量的“教科书”。它告诉我们:要训练出一个合格的数据科学智能体,不仅要告诉它什么是对的(Outcome),还要教它如何正确地执行(Process)。未来,这一基准将扩展到多模态(如图表、音频)和更复杂的异常检测领域。

Takeaway:如果你正在尝试构建端到端的 DS Agent,DARE-bench 提供的 6,300 个可验证任务将是你最好的预训练和 RL 资源。

发现相似论文

试试这些示例

  • 查找最近其他利用沙盒环境(Sandbox)和可验证奖励(Verifiable Rewards)来训练大语言模型代码或数学能力的论文。
  • 哪篇论文最早将 Kaggle 竞赛大规模转化为 LLM 训练集,DARE-bench 在数据多样性和噪声注入方面有哪些改进?
  • 有哪些研究探讨了将强化学习算法(如 GRPO 或 PPO)应用于多步骤数据科学(Data Science)决策任务中的稳定性问题?
目录
[ICLR 2025 投稿] DARE-bench:让数据科学智能体告别“结果论”,走向过程忠实
1. TL;DR
2. 痛点深挖:为何 DS 智能体总是“差之毫厘”?
3. 核心贡献:DARE-bench 的自动化炼金术
3.1. 1. 任务双子星:IF vs. MM
3.2. 2. 确定性沙盒环境
4. 实验战绩:微调的力量
4.1. 关键发现:
5. 深度洞察:为什么智能体会失败?
6. 总结与展望