[ArXiv 2025] HYMEM:混合自演化图记忆,助开源 GUI 智能体超越 GPT-4o

Hybrid Self-evolving Structured Memory for GUI Agents

总结
问题
方法
结果
要点
摘要

本文提出了 Hybrid Self-evolving Structured Memory (HYMEM),一种受大脑启发的 GUI 智能体图结构外部记忆系统。该方法结合了离散的高层符号节点与连续的轨迹嵌入,使 7B/8B 规模的开源模型在 WebVoyager 等基准测试中超越了 GPT-4o 和 Gemini-Pro-Vision。

TL;DR

虽然 Vision-Language Models (VLMs) 赋予了智能体类人的感知力,但在面对复杂的网页操作和长程任务时,Agent 往往“记不住事”或“想不明白”。本文提出的 HYMEM 是一种受神经科学启发的混合记忆系统,它通过图结构(Graph)管理离散的策略节点和连续的视频轨迹嵌入。实验显示,仅 7B 规模的小模型在 HYMEM 的加持下,不仅性能飙升 22.5%,还在多个基准测试中斩落 GPT-4o 和 Gemini 2.5-Pro。


1. 痛点:为什么扁平化记忆不够用?

在 GUI 自动化领域,现有的外部记忆方法通常存在两个极端:

  • 离散文本记忆 (Textual Memory):将操作概括为几句话。虽然易于推理,但丢失了极其关键的 UI 视觉细节(例如,按钮的确切颜色、复杂的布局波动)。
  • 连续向量记忆 (Continuous Memory):将轨迹压缩为 Embedding。保留了细节,但缺乏“灵魂”,模型难以从中提取出可解释的高层交互策略。

此外,这些记忆多是“静态”的,无法像人类大脑一样,在学到新操作时自动合并相似经验、替换过时方案。


2. 核心机制:双通路混合图记忆

HYMEM 的核心是一个演化的图

2.1 模拟大脑的“双通路”结构

  • 连续通路 (Continuous Pathway):模拟海马体,将完整的交互轨迹编码为 8 个潜变量 Embedding,直接输入 VLM 的层中,保留视觉“手感”。
  • 离散通路 (Discrete Pathway):模拟新皮层,提取高层 Strategy (如“按价格从低到高过滤”) 和语义标签 (如 #Search, #Filter)。

2.2 全局自演化 (Global Self-evolution)

当智能体完成一个新任务时,HYMEM 不会盲目存储,而是调用一个 VLM Judge 决定如何操作:

  • ADD:发现新策略,创建新节点。
  • MERGE:虽然策略相似,但有新的 UI 变体或操作路径,则合并信息,通过亚线性增长控制存储压力。
  • REPLACE:发现更高效的多步操作(步数更少、成功率更高),则替换旧策略。

系统架构与推理流程图 图1:HYMEM 概览。上方显示轨迹如何通过冗余检查融入图记忆;下方显示推理时的四阶段循环。


3. 推理时的“动态刷新”策略

在长程任务中,初始检索到的记忆可能随着任务进入新阶段(如从“搜索商品”转到“支付结算”)而失效。HYMEM 引入了 On-the-fly Refresh

  1. 阶段转移检测:每一步操作后,VLM 都会对比当前状态与工作记忆,判断是否发生 Phase Shift。
  2. 局部刷新:一旦检测到新阶段,系统保留长期目标,但会基于当前屏幕重新从图数据库中检索相关的操作细节。

4. 实验战绩:开源模型的逆袭

研究团队在 WebVoyager, Mind2Web 等权威基准上进行了测试。

4.1 量化提升

  • Qwen2.5-VL-7B 原本只有 12.5% 的成功率,在集成 HYMEM 后直接跃升至 35.0%
  • 这一成绩超越了 GPT-4o (19.7%)Gemini-Pro-Vision (29.6%),且大幅领先于其他纯文本或纯向量的记忆方法。

各模型性能对比表 表1:在不同 Backbone 下,HYMEM (Hybrid) 均取得了 SOTA 战果。

4.2 记忆压缩与缩放

实验发现,随着存储轨迹增加到 8000 条,成功率稳步上升,而图节点的增长却非常缓慢。这意味着 HYMEM 的冗余检查机制成功实现了“知识浓缩”。

记忆规模与压缩分析 (a) 显示了随检索项增加性能的提升;(b) 证明了图节点呈亚线性增长,体现了极高的压缩效率。


5. 深度洞察与总结

HYMEM 的成功证明了对于 GUI Agent 而言,“结构化”比“规模化”更重要

  • 多样性与相关性的权衡:通过在图中进行 1-hop 扩展检索,Agent 能找到那些“视觉上不相似但策略上极其重要”的参考案例。
  • 局限性:目前节点更新仍依赖 VLM 的启发式判断,而非强化学习的最优决策。

结论:HYMEM 为轻量级开源模型提供了一条通往 SOTA 的成本效益极高的路径。未来,这种自演化的混合记忆结构有望成为所有长程 Agent 的标配大脑。

发现相似论文

试试这些示例

  • 查找最近一年内其他结合了符号逻辑与连续向量空间的混合记忆增强型智能体(Agentic Memory)论文。
  • 哪篇论文最早在 GUI 智能体领域提出了 Continuous Memory 的概念,HYMEM 在轨迹压缩技术(如 CoMEM)上做了哪些具体改进?
  • 探索自主演化记忆机制(Self-evolving Memory)在具身智能或机器人操作任务中的跨领域应用研究。
目录
[ArXiv 2025] HYMEM:混合自演化图记忆,助开源 GUI 智能体超越 GPT-4o
1. TL;DR
2. 1. 痛点:为什么扁平化记忆不够用?
3. 2. 核心机制:双通路混合图记忆
3.1. 2.1 模拟大脑的“双通路”结构
3.2. 2.2 全局自演化 (Global Self-evolution)
4. 3. 推理时的“动态刷新”策略
5. 4. 实验战绩:开源模型的逆袭
5.1. 4.1 量化提升
5.2. 4.2 记忆压缩与缩放
6. 5. 深度洞察与总结