[CVPR 2026 预研] MiroFlow:开源 Agent 框架新标杆,打通深度调研的“最后一步”

MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks

总结
问题
方法
结果
要点

本文推出了 MiroFlow,一个专为复杂深度调研任务设计的高性能、鲁棒性开源 Agent 框架。通过引入 Agent Graph、重推理模式(Heavy-Reasoning Mode)和鲁棒工作流机制,MiroFlow 在 GAIA、HLE 和 FutureX 等多个权威榜单上刷新了 SOTA 纪录。

TL;DR

虽然 LLM 的单体能力在趋于平台期,但 Agentic System(智能体系统)的潜力才刚刚爆发。MiroMind AI 团队发布的 MiroFlow 是一个高性能开源框架,它不只是简单地给 LLM 挂载工具,而是通过 Agent Graph(有向图编排)Heavy-Reasoning Mode(重推理模式) 将 LLM 转化为具备自我纠错、多步规划和跨工具协作能力的“超级调研员”。

在 GAIA、HLE 等公认“极难”的 Benchmarks 上,MiroFlow 成功超越了 OpenAI Deep Research 和各路商业闭源方案。


1. 为什么现在的 Agent 看起来很笨?

在处理需要数小时甚至数天的“深度研究”任务时,普通 Agent 经常陷入以下泥潭:

  • 脆弱的线性逻辑:一旦中间某一步搜索结果有误,错误会沿着逻辑链无限放大。
  • 指令遵从性波动:模型可能突然忘记输出格式,导致解析失败。
  • 工具误判:由于网络波动或 API 超时,Agent 常将系统错误误认为“查不到信息”,从而开始瞎编( hallucination)。

MiroFlow 的动机非常明确:与其奢求 LLM 永远不犯错,不如建立一套极其鲁棒的“系统工程”来检测并修正错误。


2. 核心架构:Agent Graph 与三层分级

MiroFlow 抛弃了传统的简单顺序流,采用了高度解耦的三层架构:

  1. 控制层 (Control Tier):负责全局调度、预算管理和重推理策略。
  2. Agent 层 (Agent Tier):每个节点是一个独立的单元,拥有特定的职责(如:搜索 Agent、代码 Agent、视觉 Agent)。
  3. 基础层 (Foundation Tier):管理底层模型接口(GPT, Claude, Qwen 等)和 MCP 协议工具集。

核心亮点:Agent Graph

MiroFlow 支持“声明即定义”的图结构。开发者可以定义 complex 的拓扑关系,让 Agent 之间不仅能上下级调用,还能进行复杂的互操作。

MiroFlow 三层架构图


3. 推理时扩展:重推理模式 (Heavy-Reasoning)

这是 MiroFlow 刷榜的神器。当任务进入“高价值/高难度”阶段时,系统会启动重推理模式:

  • Ensemble Policy(集成策略):同时启动多个同构或异构 Agent(如 GPT-5 + Claude 3.7),通过权重投票过滤掉随机性错误。
  • Verification Policy(验证策略):开启“生成-验证”循环,只有通过验证节点初审的代码片段或结论才能进入下一步。

重推理模式示意图


4. 实验战绩:全线 SOTA

MiroFlow 在多个维度上对现有框架进行了“降维打击”。

GAIA(通用助手基准)和 FutureX(未来事件预测)上,MiroFlow 表现出恐怖的泛化性。值得注意的是,它在 FutureX 上的表现(42.5%) 几乎是原生 GPT-5(25.6%)的两倍,这充分说明了 好的框架能极大榨取模型的智力上限。

性能对比表

消融实验揭示的真相

有趣的一个点是,作者发现 I/O Processing(输入输出处理) 对性能影响极大。仅仅通过给模型添加 structured hints(结构化提示)和对最终输出进行格式校验(Post-hoc processing),GAIA 的分数就从 59.6 提升到了 71.9。这印证了:Agent 的强弱,一半看脑子(LLM),一半看规矩(Workflow)。


5. 深度洞察:单 Agent 还是多 Agent?

论文提出了一个非常深刻的观察:在 GAIA 这种强顺序任务中,多 Agent 协作反而可能因为“语境碎片化”导致性能下降。

  • Single-Agent:保持了连续的推理轨迹和完整的全局 Context,更不容易在多模态理解中掉链子。
  • Multi-Agent:在需要并行处理和大规模搜索(如 BrowseComp)的任务中优势巨大。

MiroFlow 的 Agent Graph 允许用户根据任务特性弹性切换这两种模式,这才是它真正的竞争力所在。

6. 总结与展望

MiroFlow 不仅是一个工具库,它更像是一套 Agent 工业化生产的协议。它通过引入错误隔离、消息规范化等“枯燥”但至关重要的系统设计,解决了 Agent 从“Demo”走向“产品”过程中最痛苦的稳定性问题。

对于开发者而言,MiroFlow 提供的开源基准和丰富的消融数据,为未来构建“全自动 AI 科学家”提供了一份极其宝贵的施工图纸。


项目地址:[Github Placeholder - 详见原论文] 关键术语:Agent Graph, MCP Protocol, Heavy-Reasoning, Inference-time Scaling.

发现相似论文

试试这些示例

  • 查找最近其他利用有向图(Directed Graph)而非线性链式结构来编排联接大模型 Agent 的框架或研究。
  • 哪篇论文最早系统性地定义了推理时扩展(Inference-time Scaling)在 Agent 任务中的应用,本文的重推理模式与其有何异同?
  • 调研将类似 MiroFlow 的开源 Agent 框架应用于生物信息学、法律文档扫描等垂直领域深度研究(Deep Research)的最新案例。
目录
[CVPR 2026 预研] MiroFlow:开源 Agent 框架新标杆,打通深度调研的“最后一步”
1. TL;DR
2. 1. 为什么现在的 Agent 看起来很笨?
3. 2. 核心架构:Agent Graph 与三层分级
3.1. 核心亮点:Agent Graph
4. 3. 推理时扩展:重推理模式 (Heavy-Reasoning)
5. 4. 实验战绩:全线 SOTA
5.1. 消融实验揭示的真相
6. 5. 深度洞察:单 Agent 还是多 Agent?
7. 6. 总结与展望