[arXiv 2026] MiroThinker-H1:深度研究智能体的新范式——从“堆步数”转向“高质量交互”
MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification
本文推出了 MiroThinker-1.7 和 MiroThinker-H1,一套专为复杂长程推理设计的深度研究智能体(Research Agent)。通过引入“智能体中期训练(Agentic Mid-training)”和双层验证机制,该系统在 BrowseComp 和 GAIA 等基准测试中刷新了 SOTA 记录,显著提升了多步交互的可靠性。
TL;DR
MiroMind 团队发布的 MiroThinker-1.7 与 MiroThinker-H1 代表了深度研究智能体(Deep Research Agents)的最新演进。与以往通过盲目增加交互轮数(Interaction Length)来换取性能的路径不同,该工作核心强调了高效交互缩放(Effective Interaction Scaling)。通过“中期训练+双层验证”的组合拳,MiroThinker-H1 在 GAIA 和 BrowseComp 等大模型“硬核”榜单上大幅超越 GPT-5 和 Claude-4.6。
1. 痛点深挖:为什么“长”不代表“强”?
在复杂的科学分析或财务审计任务中,模型需要进行长达上百步的 Web 搜索、代码执行和证据合成。
- 错误累积 (Error Propagation):传统 ReAct 模式下,如果第 10 步的搜索结果有偏,模型会基于错误信息继续推进,最终导致整个推理轨迹溃败。
- 计算浪费:很多智能体在原地打转,生成了大量重复的 Thought 但毫无进展。
- 缺乏反馈:模型往往“自信”地执行错误指令,直到 Token 耗尽也未能触发自我修正。
2. 核心方法论:MiroThinker 的技术重构
2.1 智能体原子能力的“中期训练”(Mid-training)
作者认为,要让长程推理可靠,首先要保证每一小步(Step-level)都是准的。他们在预训练和 SFT 之间加入了一个 Agentic Mid-training 阶段:
- 规划增强:训练模型如何从零开始构建结构化计划。
- 上下文推理:在观察到部分结果时,如何修正后续路径。
- 工具交互对齐:减少 malformed tool calls(格式错误)。
2.2 验证中心化推理(Verification-Centric)
这是 MiroThinker-H1 区别于传统模型的杀手锏。它引入了两个验证器:
- Local Verifier (局部验证者):在每一步 Tool Call 之后,立即审计该动作是否有效。如果发现模型在“原地打转”,会强制其探索替代路径。
- Global Verifier (全局验证者):当整条证据链完成后,对其进行系统性审计。如果证据不足以支撑结论,则触发重采样(Resampling)。
Figure: MiroThinker-1.7 & H1 系统架构,展示了从感知到验证的闭环过程。
3. 实验结果:效率与强度的双重突破
3.1 刷新 SOTA
在针对 Web 浏览能力的 BrowseComp 测试中,MiroThinker-H1 达到了 88.2 分,超越了 Gemini-3.1-Pro。在 GAIA 榜单上更是以 88.5 分的高分傲视群雄,将前代标杆远远甩在身后。
3.2 令人惊叹的效率提升
最令人印象深刻的是它的“短干精悍”。实验显示,MiroThinker-1.7-mini 在处理同样的难题时,交互轮数比 1.5 版本减少了 43%,但准确率反而上升了 16.7%。这有力证明了:提升每一轮交互的“信息密度”和“准确度”,远比单纯通过强化学习延长思考轨迹有效。
Figure: 性能 vs. 交互轮数对比图。所有箭头向左上方移动,意味着“更少的步数,更好的效果”。
4. 深度洞察与总结
MiroThinker 的成功揭示了 Agent 领域的一个新趋势:验证即推理 (Verification is Planning)。
- 局限性:虽然本地验证器减少了步数,但引入了额外的推理开销(Compute-over-verification),在极端低延迟场景下可能受限。
- 未来展望:随着 Inference-time Scaling(推理侧扩展)成为主流,如何通过更廉价的验证模型来驱动更昂贵的生成模型,将是下一个竞争高地。
Takeaway:MiroThinker-H1 告诉我们,一个优秀的 AI 研究员不仅要会找资料,更要学会时刻质疑自己的中间结论。这种“边走边审”的策略,才是通往 Heavy-duty AI 的必经之路。
