NoiseGate:将去噪进度转化为信息门控,打造更精准的世界动作模型

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

总结
问题
方法
结果
要点
摘要

本文提出了 NoiseGate,一种针对世界动作模型 (WAM) 的学习型调度算法。该方法将视频-动作联合去噪过程中的“每帧潜在时间步”(per-latent timestep)视为可学习的信息门控策略,在 RoboTwin 机器人操纵基准测试中显著提升了生成策略的成功率(平均 SOTA 达到 94.28%)。

TL;DR

在机器人控制领域,世界动作模型(World Action Models, WAMs)通过同时构想未来画面和生成动作来提升决策能力。然而,通常这类模型会让所有“构想画面”共用同一个去噪进度(Timestep)。NoiseGate 打破了这一惯例,它赋予每一帧画面独立的“进度条”,并学习如何像调节阀门一样开关这些画面的信息流,从而在 RoboTwin 任务中刷新了性能上限。

痛点深挖:整齐划一的进度是一种“过度假设”

在传统的联合去噪框架(如 Motus 或 Fast-WAM)中,模型会并行地从噪声中恢复未来 帧视频和当前的动作序列。目前主流做法是让所有 token 共享一个时间步

但这存在一个逻辑盲区:并非所有的未来预测都同样可靠。 比如在“抓取”动作发生前,远期未来的预测往往充满不确定性。如果强迫模型在这个阶段就给动作生成提供完全清晰的远期特征,这些“不可靠的构想”反而会误导机器人产生错误的动作(例如提前松手或位置偏移)。

核心直觉:噪声等级 = 门控强度

作者提出了一个极具物理直觉的观点:在 Transformer 的 Mixture-of-Transformers (MoT) 架构中,动作 token 通过全局注意力机制读取视频 token。如果某一帧视频的噪声水平(Timestep)较高,由于噪声的随机性,它在注意力机制中贡献的信息就更“模糊”,起到了天然的**信息遮蔽(Masking)**作用。

通过为每一帧设定独立的时间步 ,NoiseGate 实际上是在每一轮去噪迭代中,动态地决定“先展示哪些成熟的构想给动作层看,遮住哪些还不确定的构想”。

方法论:三位一体的 NoiseGate 架构

模型架构图

  1. 训练基座(Stage-1):借鉴了 Diffusion Forcing 的思路,在训练阶段让每一帧随机抽取独立的时间步。这让模型在推理时即使面对高维度的异构噪声分布(即某些帧快,某些帧慢)也不会“出戏”。
  2. 门控策略网络 (GPN):这是一个轻量级的网络,它观察当前的观测图和已预测的潜在帧,输出每一帧的进度增量
  3. GRPO 强化学习优化:调度策略不使用传统的模仿学习,而是直接面向结果——通过 GRPO 算法,根据机器人是否最终成功完成任务来优化调度器。

实验与结果:非均匀进度的威力

在包含 50 个复杂任务的 RoboTwin 随机场景基准上,NoiseGate 展现了强大的统治力。

实验结果对比

  • 精度提升:在“挂杯子”、“放面包”等对精度要求极高的任务中,NoiseGate 表现出明显的优势。
  • 消融分析:如上表所示,单纯通过独立噪声训练(Stage-1)只能达到 61.3% 的成功率,而加上 GPN 学习后的调度策略直接跃升至 67.5%(注:此为消融组数据对比)。

为什么有效?——任务感知的进度表

可视化分析揭示了 NoiseGate 的工作模式。在不同的任务中,GPN 学习到了完全不同的“进度表”。

任务特定的时间步轨迹

如上图所示,在某些任务中,第一帧被迅速去噪以指导即时动作,而后续帧则保持较高的噪声水平。这种任务相关性证明了这种门控策略并非随机,而是捕获了任务背后的物理规律和不确定源。

深度洞察与总结

NoiseGate 的意义在于它重新定义了扩散投影在决策任务中的角色。它告诉我们:生成模型的采样权重不应该是预设的数学曲线(如余弦调度),而应该是一个能够感知环境实时反馈的“大脑组件”。

局限性:目前的 GRPO 训练依然依赖仿真环境的奖励反馈,在现实世界且奖励稀疏的任务中,如何高效训练这类调度策略仍是挑战。

展望:这一思路可以无缝迁移到自动驾驶(预测周围车辆轨迹)或多模态导航中。任何涉及到“预测未来并基于预测去行动”的架构,都值得引入这样一个智能的“进度调节阀”。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决扩散模型/流匹配模型中非均匀采样或异构时间步调度的论文。
  • 哪篇论文最早提出了 Diffusion Forcing 框架,NoiseGate 在多节点/并行去噪处理上对其做了哪些改进?
  • 有哪些研究将类似 GRPO 的强化学习算法应用到了机器人视觉语言动作 (VLA) 模型之外的视频生成或控制任务中?
目录
NoiseGate:将去噪进度转化为信息门控,打造更精准的世界动作模型
1. TL;DR
2. 痛点深挖:整齐划一的进度是一种“过度假设”
3. 核心直觉:噪声等级 = 门控强度
4. 方法论:三位一体的 NoiseGate 架构
5. 实验与结果:非均匀进度的威力
5.1. 为什么有效?——任务感知的进度表
6. 深度洞察与总结