[CVPR 2026] XSKILL:解耦视觉经验与技能,赋予多模态智能体持续进化的“肌肉记忆”

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

总结
问题
方法
结果
要点
摘要

本文提出了 XSKILL,一种面向多模态智能体的双流持续学习框架。该框架通过从历史轨迹中提取“经验(Experiences)”和“技能(Skills)”,在不更新模型参数的情况下,显著提升了智能体在 VisualToolBench 等 5 个基准测试中的工具使用效率和任务编排灵活性。

TL;DR

面对复杂的视觉推理任务,多模态智能体(MLLM Agents)往往因为“记不住”之前的教训而反复掉坑。本文提出的 XSKILL 框架,通过构建由 任务级技能(Skills)动作级经验(Experiences) 组成的双流知识库,在无需任何参数微调的前提下,让智能体学会了从失败中总结规律。实验证明,该方法能显著减少工具调用的语法错误,并展现出极强的跨任务 Zero-shot 迁移能力。

核心动机:智能体的“健忘症”与视觉缺失

尽管当前的 MLLM 在单次对话中表现惊人,但它们本质上是“无状态”的。

  • 痛点 1(效率低下):在处理简单问题时步骤繁冗,面对复杂问题却又缺乏深度探索,缺乏成熟的 Workflow。
  • 痛点 2(逻辑僵化):难以根据视觉环境的微小变化调整工具组合策略。
  • 致命缺陷:现有的记忆机制大多基于文本(Text-only),在视觉推理中,如果不知道“那是张上下颠倒的图”,仅凭文本指令根本无法触发“旋转图片”的经验。

XSKILL 架构详解:双流并进

XSKILL 的核心在于将知识进行分层管理:

1. 积累阶段 (Accumulation Phase)

智能体在训练集中进行多次尝试(Rollouts),随后由一个更强的模型(MLLM-kb)进行“复盘”:

  • 视觉接地总结:不仅记录做了什么,还记录“哪个视觉特征触发了这个动作”。
  • 跨轨迹批判 (Cross-Rollout Critique):对比成功和失败的路径,提炼出“避坑指南”。
  • 分级整合:将零散的发现转化为结构化的 Markdown 技能文档和 JSON 经验条目。

模型架构图 图 1:XSKILL 框架概览,展示了知识的积累与推理适配流程

2. 推理阶段 (Inference Phase)

当遇到新任务时,不再是硬扣查询语句,而是:

  • 任务分解检索:将复杂问题拆解为“图像增强”、“几何计算”等子任务,精准匹配知识。
  • 上下文适配 (Adaptation):基于当前图片,动态改写检索到的经验。例如将“若图片模糊则增强”改写为“当前图片光线较暗,建议调用曝光补偿”。

实验战果:更聪明、更稳健

XSKILL 在 VisualToolBench 和 TIR-Bench 等五个领域表现出色:

  • 性能暴涨:在 Gemini-3-Flash 上,Average@4 提升显著,超越了 AWM 和 Agent-KB 等一众基准。
  • 错误消减:如图 3 所示,技能流(Skills)的加入显著减少了语法错误(Syntax Error)和运行错误,赋予了模型稳健的执行能力。

模型架构图 图 2:错误分析显示,Skills 极大地增强了工具使用的规范性

深度洞察:为什么双流架构有效?

论文通过消融实验给出了极具启发性的结论:

  1. Skills 是“骨架”:它降低了工具调用的门槛,解决了“怎么用工具”的问题,通过模板化代码减少了幻觉。
  2. Experiences 是“灵魂”:它解决了“什么时候用什么工具”的战术问题。实验发现,加入经验后,模型更倾向于使用 Python 代码解释器进行精确像素处理,而非盲目猜测。
  3. 零样本迁移 (Zero-shot Generalization):由于提取的知识经过了抽象和占位符处理,从 VisualToolBench 学到的技巧可以直接用到 TIR-Bench,这证明了它学到的是“通用推理准则”。

总结与局限

XSKILL 迈出了智能体持续学习的重要一步,它证明了非参数化方法在多模态领域仍有巨大潜力。 局限性:目前的实验主要基于单次积累测试循环,未来在长期、无限任务流下的知识库灾难性遗忘或冗余问题,仍需进一步探讨。此外,跨模型迁移(如用大模型生成的知识带教小模型)的效率在不同 Backbones 间仍存在波动。


本文由资深学术技术主编重构。更多细节请参考原项目主页:xskill-agent.github.io

发现相似论文

试试这些示例

  • 查找最近其他尝试通过非参数化(Training-free)方法让多模态大模型智能体从历史失败案例中学习的论文。
  • 哪篇论文最早区分了智能体研究中的“技能库(Skill Library)”与“经验记忆(Experience Memory)”,本文的视觉接地改进与其有何本质区别?
  • 有哪些研究探讨了将 XSKILL 的双流架构应用到实时 GUI 导航或具身智能(Embodied AI)任务中的潜力?
目录
[CVPR 2026] XSKILL:解耦视觉经验与技能,赋予多模态智能体持续进化的“肌肉记忆”
1. TL;DR
2. 核心动机:智能体的“健忘症”与视觉缺失
3. XSKILL 架构详解:双流并进
3.1. 1. 积累阶段 (Accumulation Phase)
3.2. 2. 推理阶段 (Inference Phase)
4. 实验战果:更聪明、更稳健
5. 深度洞察:为什么双流架构有效?
6. 总结与局限