[ICLR 2025 投稿] DARE-bench:让数据科学智能体告别“结果论”,走向过程忠实
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
本文推出了 DARE-bench,一个包含 6,300 个基于 Kaggle 任务的大规模数据科学(Data Science, DS)智能体基准测试。该基准通过引入可验证的 Ground Truth,重点评估大语言模型(LLMs)在机器学习建模(MM)和指令遵循(IF)方面的过程忠实度,填补了现有评价体系的空白。
TL;DR
AI 真的能替代数据科学家吗?目前的瓶颈不在于写不出代码,而在于“过程失控”。Snowflake AI Research 联合休斯顿大学提出了 DARE-bench,一个拥有 6,300 个任务的大规模数据集。它不仅能测试模型预测得准不准,还能测试模型是否“听话”地执行了特定的预处理步骤。通过该基准训练,小模型 Qwen3-4B 在 DS 任务上的表现暴涨 8 倍。
痛点深挖:为何 DS 智能体总是“差之毫厘”?
在真实的数据科学场景中,我们不仅关心模型最终的 F1 分数,还关心逻辑的严密性。例如,资深科学家要求你在处理数据时必须使用特定的随机种子、特定的 Missing Value 填充策略。
现有的基准测试(如列表中的 DSBench, MLE-bench 等)大多存在以下局限:
- 评价维度单一:只看最终预测 Target 的准确率,不看中间过程。
- 不可复现性:由于环境变化和随机因子,模型同样的脚本可能跑出不同的结果。
- 训练资源匮乏:缺乏高质量、可直接用于强化学习的可验证反馈(Verifiable Rewards)。

核心贡献:DARE-bench 的自动化炼金术
作者构建了一个自动化的构建流水线,将 Kaggle 的原始数据通过 LLM 辅助的任务设计、噪声注入和沙盒验证,转化为标准化的任务。
1. 任务双子星:IF vs. MM
- Instruction Following (IF):模型必须复写参考工作流。如果要求用均值填充,你用了中位数,即便结果凑巧对了,评分也是 0。这测试的是模型的指令遵循能力。
- ML Modeling (MM):结果导向。给模型最大限度的自由,看其能否在限定时间内训练出性能最强的模型。
2. 确定性沙盒环境
为了解决“复现难”的问题,DARE-bench 在 Docker 沙盒中运行。通过严格控制随机种子和库版本,作者发现复杂的 DS 流程也可以产生确定的输出,这为 RLVR(基于可验证奖励的强化学习) 铺平了道路。

实验战绩:微调的力量
作者测试了包括 GPT-5 (o系列预览版), Claude-Sonnet-3.7 在内的众多顶尖模型。
关键发现:
- 顶级模型也翻车:即使是 Claude 3.7,在处理复杂的时间序列(Time-series CF)任务时,得分也偏低。
- 开源模型的崛起:基座模型 Qwen3-32B 的初始得分仅 23.25,但在使用 DARE-bench 进行监督微调(SFT)后提升至 42.42。
- 强化学习的奇迹:Qwen3-4B(仅 40 亿参数)在经过 GRPO 算法强化后,得分从 4.39 疯狂提升到 37.40,充分证明了“可验证奖励”在 DS 领域的巨大潜力。

深度洞察:为什么智能体会失败?
通过对轨迹(Trajectories)的定性分析,作者总结了三大失败主因:
- API 滥用:生成了正确的代码,但在调用工具(Tool Calling)时漏掉了文件名等关键参数。
- 指令疏忽:跳过了必要的转换步骤(如忘了固定随机种子,见下图)。
- 推理脆弱:在时间序列任务逻辑中,往往只会简单的“取均值”或“取最后一个值”,缺乏真正的时序推理。

总结与展望
DARE-bench 不仅仅是一个“考试卷”,它更是一本高质量的“教科书”。它告诉我们:要训练出一个合格的数据科学智能体,不仅要告诉它什么是对的(Outcome),还要教它如何正确地执行(Process)。未来,这一基准将扩展到多模态(如图表、音频)和更复杂的异常检测领域。
Takeaway:如果你正在尝试构建端到端的 DS Agent,DARE-bench 提供的 6,300 个可验证任务将是你最好的预训练和 RL 资源。
