[arXiv 2025] 像研究员一样思考:首个大规模科研 AI 助手行为数据集 Asta Interaction 深度解析
Understanding Usage and Engagement in AI-Powered Scientific Research Tools: The Asta Interaction Dataset
本文介绍了 Asta Interaction Dataset (AID),这是首个公开的大规模科研 AI 助手交互数据集,包含超过 20 万条真实用户查询及行为日志。通过对比 PaperFinder (PF) 和 ScholarQA (SQA) 两类界面,揭示了研究人员如何从传统搜索转向协作式的 AI 驱动科研流。
TL;DR
科研人员正在把 AI 助手当成“数字工位上的二老板”,而不仅仅是加强版的 Google。Allen Institute for AI 发布的 Asta Interaction Dataset (AID) 揭示:用户不再满足于简单的关键词检索,而是倾向于输入段落级的上下文,要求 AI 寻找研究空白、解读实验数据,甚至起草论文大纲。
核心发现:
- 协作大于搜索:查询长度是传统学术搜索的 3-7 倍。
- 非线性阅读:用户经常跳过摘要(43% 的情况),直接根据证据卡片定位关键结论。
- 经验法则:老手用户对具体引用(Evidence)的点击率提升了 27%,显示出对验证 AI 幻觉的警惕。
痛点深挖:我们真的了解科研 AI 怎么被使用吗?
过去两年,集成 LLM 和检索增强生成 (RAG) 的工具如雨后春笋。然而,学术界一直面临一个“黑盒”:用户到底在框里输入了什么?
传统的信息检索 (IR) 理论(如 Broder 的三分类:信息性、导航性、事务性)已难以覆盖复杂的科研需求。此前缺乏公开的大规模日志,研究者无法回答:用户是把 AI 当成搜索器、润色器,还是真正的合作者?
方法论:AID 数据集与定制化分类学
为了填补这一空白,作者发布了基于 Asta 平台的交互数据。该平台包含两个主要界面:
- PaperFinder (PF):偏向传统搜索,返回排序后的论文列表。
- ScholarQA (SQA):生成结构化的研究综述,附带行内引用。
作者利用 GPT-4 对 3 万条查询进行了多维度标注,建立了一套针对 AI 助手的 新分类学 (Query Taxonomy)。这套分类不再只看关键词,而是关注 复杂上下文叙述 (Complex Contextual Narrative) 和 多步任务指令。

深度洞察:科研行为的范式迁移
1. 从“关键词”到“小作文”
数据显示,Asta 的平均查询长度(17-37 词)远高于 Semantic Scholar (S2) 的基准(5.4 词)。用户开始大规模使用“小作文”式的提问:先粘贴一段自己的实验描述,再要求 AI 解释为什么结果不符合预期(见下表)。

2. 用户学习效应 (Learning Effects)
随着使用经验增加,用户的行为发生了显著演变:
- 更精准的攻击:Broad Topic Exploration(广义主题探索)比例显著下降。用户学会了添加 Methodology-Specific Criteria(特定方法论约束)。
- 批判性阅读:经验丰富的用户点击“证据卡片”验证引用的频率大幅增加,反映了用户在学习如何通过系统工具交叉验证 AI 的输出质量。
3. 非线性阅读地图
SQA 的点击流分析展示了研究员独特的阅读轨迹:他们并非从头读到尾,而是频繁地在多个章节间跳转,甚至直接忽略“引言”。这证明了 TL;DR (摘要缩略图) 设计的巨大价值,它允许用户快速过滤信息。

结论:对未来工具设计的启示
- 不要只做搜索框:既然用户喜欢提供输入大量论文上下文,界面应原生支持“长文本输入”并提供“研究 Situtation”描述模板。
- 重视“持续回访”:系统应允许用户将生成的报告标记为持续更新的“动态资产”。
- 延迟容忍度差异:用户对生成高质量报告(SQA)的延迟容忍度较高,但对搜索列表(PF)的延迟极其敏感。首屏成功率对留存率的影响(从 10% 到 53% 的差异)提示我们,第一印象依然是成败关键。
AID 数据集的开源为我们理解 AI 时代的学术生产力提供了一面镜子。它告诉我们,AI 并没有取代思考,而是正在重塑科研的需求边界。
注:数据集已在 Allen Institute 官网开源,涵盖 258,935 条查询,科研工具开发者必读。
