[ICRA 2025] SeedPolicy:突破时程瓶颈,让扩散策略在长任务中动态进化

SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation

总结
问题
方法
结果
要点
摘要

本文提出了 SeedPolicy,一种旨在解决扩散策略(Diffusion Policy)在长时程(Long-horizon)机器人操控任务中性能退化问题的模仿学习框架。核心方法是引入了自进化门控注意力机制(SEGA),通过循环更新的隐状态来压缩并保留关键时空信息,在 RoboTwin 2.0 标杆测试中显著超越了现有的 SOTA 方法。

TL;DR

传统的扩散策略(Diffusion Policy)在处理长距离机器人操作时面临“越看越糊涂”的尴尬局面——随着观察帧数的增加,性能反而下降。本文提出的 SeedPolicy 通过 Self-Evolving Gated Attention (SEGA) 模块,引入了一个能够循环更新、自我进化的隐状态(Latent State),成功实现了观察时程的有效扩展,在复杂随机化任务中性能提升高达 169%。

1. 痛点:为什么 Diffusion Policy “记不住”长任务?

在模仿学习(Imitation Learning)领域,Diffusion Policy 凭借捕捉多模态行为分布的能力大放异彩。然而,作者发现它存在一个致命弱点:时程缩放问题(Horizon Scaling Problem)

  • 简单的帧堆叠(Frame Stacking):现有方法大多通过堆叠图像帧来提供历史上下文,但这无法有效提取深层时序逻辑。
  • 性能倒挂:随着堆叠帧数的增加,模型容易被冗余信息和视觉噪声(如背景移动、遮挡)淹没,导致推理精度下降。
  • 计算灾难:若单纯增加 Transformer 的 Attention 长度,计算量会随序列长度呈二次方爆炸。

2. 核心机制:自进化门控注意力 (SEGA)

为了打破这一限制,作者设计了名为 SEGA 的模块,它的直觉非常类似于人类的短时记忆:不仅要记录,更要学会遗忘无关噪声。

2.1 双流架构 (Dual-Stream Design)

SEGA 模块由两个并行的处理路径组成:

  1. 状态更新流 (State Update):将当前的观察特征 融入到之前的隐状态 中,生成新的状态
  2. 状态检索流 (State Retrieval):利用丰富的历史状态去增强当前的观察特征,输出更能代表任务进度的 Enhanced Observation。

2.2 自进化门 (Self-Evolving Gate, SEG)

这是 SeedPolicy 的灵魂所在。通过利用**交叉注意力(Cross-Attention)**产生的注意力图(Attention Maps)作为门控信号,模型可以动态判断当前帧信息是否对任务有贡献。

  • 如果当前帧充满了背景噪声,SEG 会关闭大门,保护隐状态不被污染。
  • 这种设计实现了“时序稀疏性”,让模型只关注那些产生关键物理交互(如抓取、落袋)的瞬间。

SeedPolicy 框架总览

3. 实验验证:以小博大的力量

作者在 RoboTwin 2.0(包含 50 个复杂任务)以及真实硬件 DOS-W1 平台上进行了严苛测试。

3.1 性能表现

在 Easy 设定下,SeedPolicy 相比基线提升了 21%-52%;而在更接近真实环境的 Hard(带随机扰动)设定下,SeedPolicy 展现了极强的韧性,相对提升达到了惊人的 169%

更令人印象深刻的是与大模型的对比:参数量仅为 33M-147M 的 SeedPolicy,在单任务表现上竟能超越参数量高达 1.2B 的 VLA 模型(如 RDT),展现了极致的效率。

3.2 解决“状态混淆”

在现实任务(如反复放置和取回物体)中,机器人常遇到 State Aliasing(状态混淆):即两个不同阶段的画面看起来完全一样。

  • 基线模型:因为只看几个短帧,会因为画面相同而卡在原地(Execution Stagnation)。
  • SeedPolicy:依靠隐状态“记得”之前已经放过一次了,从而顺利进入下一阶段。

实验结果对比

4. 深度洞察:消融实验揭示成功的秘诀

通过消融实验(Ablation Study),作者揭示了三个关键结论:

  • 不仅仅是 Attention:单纯加 Temporal Attention 只能部分缓解问题,引入 State 机制 才是长时程任务成功的关键。
  • SEG 优于 FFN 门控:利用注意力图作为门控比传统的 MLP 门控效果更好,因为它提供了内容感知的关联性。
  • 隐状态长度不是越长越好:实验发现 是最优平衡点,太长反而会引起注意力分散。

5. 总结与展望

SeedPolicy 填补了扩散策略在长时序建模上的空白。它通过创新的 SEGA 模块,证明了循环状态更新 + 动态稀疏门控是提升具身智能模型鲁棒性的有效路径。

局限性:虽然在学习过的任务上表现极佳,但在完全陌生的开放域场景下,其泛化能力仍弱于拥有海量预训练知识的 VLA 大模型。作者指出,未来将研究如何将 SEGA 这种高效的时序建模能力集成到 VLA 架构中,实现真正的“长时程、大泛化”。


关键词:Robotic Manipulation, Diffusion Policy, Long-horizon, Gated Attention, Imitation Learning.

发现相似论文

试试这些示例

  • 查找最近一年关于解决 Diffusion Policy 在长时程操控任务中时序建模瓶颈的其他改进架构。
  • 哪篇论文最早在 Transformer 架构中提出了 Gated Attention(门控注意力),SeedPolicy 的 SEG 机制与其有何异同?
  • 评估目前 SOTA 的 Vision-Language-Action (VLA) 模型在长序列任务中相比于轻量化扩散策略的优势与局限性。
目录
[ICRA 2025] SeedPolicy:突破时程瓶颈,让扩散策略在长任务中动态进化
1. TL;DR
2. 1. 痛点:为什么 Diffusion Policy “记不住”长任务?
3. 2. 核心机制:自进化门控注意力 (SEGA)
3.1. 2.1 双流架构 (Dual-Stream Design)
3.2. 2.2 自进化门 (Self-Evolving Gate, SEG)
4. 3. 实验验证:以小博大的力量
4.1. 3.1 性能表现
4.2. 3.2 解决“状态混淆”
5. 4. 深度洞察:消融实验揭示成功的秘诀
6. 5. 总结与展望