FASTER:通过值引导采样加速强化学习,实现扩散策略的“降维打击”

FASTER: Value-Guided Sampling for Fast RL

总结
问题
方法
结果
要点
摘要

本文提出了 FASTER,一种针对扩散策略(Diffusion Policies)的高效值引导采样方法。通过将动作去噪过程建模为 MDP 并引入噪声级评论家(Noise-level Critic),该方法在保持采样缩放(Test-time Scaling)性能增益的同时,显著降低了推理和训练的计算成本。

TL;DR

在强化学习(RL)领域,基于扩散模型(Diffusion Models)的策略因其极强的表达能力而备受青睐。然而,为了追求极致性能,研究者通常采用 Best-of-N 采样:采样 N 个噪声,全部去噪成动作,再选最好的。这导致计算成本飙升了 N 倍。FASTER 提出了一种天才的方案:在噪声还是“乱码”的时候就预测哪个会成为“神来之笔”,只对最有潜力的那一个进行去噪。结果?性能不减,计算量暴跌。

背景:昂贵的“优中选优”

当前的 SOTA 算法(如 IDQL, EXPO)在处理复杂机器人操控任务时,往往通过增加测试时计算量(Test-time Scaling)来提高成功率。

  • 痛点:对于像 3.3B 参数的 VLA 大模型,原本跑一次推理就挺费劲,如果还要做 8 次全量去噪,机器人还没动,系统就卡死了。
  • 直觉:作者发现,动作的好坏其实在初始噪声(Seed)阶段就已经定调了。我们不需要看到最后的动作,就能提前“预判”谁是赢家。

方法论:将去噪过程视为 MDP

FASTER 的核心是将去噪过程建模为一个过滤 MDP(Filtering MDP)

1. 架构解析

传统的 Best-of-N 需要 次 Actor 前向传播(T 为去噪步数)。而 FASTER 引入了一个轻量级的 Denoise Critic ()

  • 输入:当前环境状态 和初始噪声
  • 输出:该噪声产生的动作在未来的期望回报。
  • 训练逻辑:采用回归损失,强制 去逼近训练好的动作级评论家 的输出。

模型架构图 图 1:FASTER 流程示意图。通过 快速评估噪声,仅对冠军候选进行全量去噪。

2. 计算开销的质变

计算成本对比:

  • 传统 Best-of-N:
  • FASTER: 由于 (尤其是噪声级评论家)通常比 小得多,FASTER 成功将 的倍率效应从重负载的 Actor 中解耦出来。

实验结果:效率与性能的完美平衡

1. 任务表现

在 Robomimic 各项任务中,FASTER-EXPO 不仅在样本效率上优于 RLPD 等单纯的 RL 算法,更重要的是,它在仅消耗约 1/8 推理计算量的情况下,完全追平了完整版 EXPO 的成功率。

实验结果对比 图 2:在线强化学习成功率对比。FASTER 在不同任务上均展现了极强的竞争力和极高的计算效率。

2. VLA 上的降本增效

在 3.3B 参数的 OpenPI 模型上,FASTER 的优势极其显著:

  • 推理延迟:从 566ms 降至 335ms。
  • FLOPs:从 骤降至 (约 8 倍节省)。
  • 训练速度:每步更新快了 4.5 倍。

VLA 计算效率 图 3:在大型 VLA 模型上的时间与功耗收益,证明了其在大规模模型时代的实用性。

深度洞察:为什么不直接做蒸馏?

一个常见的策略是“蒸馏”:训练一个策略直接输出高价值动作。但文章通过消融实验(Ablation Study)指出,由于 Q 函数在训练中是动态变化的,蒸馏会面临严重的**非平稳(Non-stationarity)**问题。相比之下,FASTER 的过滤机制更稳定,因为它不强迫模型改变生成分布,只是做了一个“聪明的选择”。

总结与展望

FASTER 成功证明了:在生成式强化学习中,我们不需要在“计算开销”和“决策质量”之间做单选题。

  • 价值:它为具身智能(Embodied AI)的低功耗、低延迟部署打开了新大门。
  • 局限:目前主要针对具有初始噪声结构的策略(如 Diffusion, Flow Matching),对于自回归(Autoregressive)模型(如常用的 Transformer 动作基元)的适配尚需进一步探索。

未来,这种“噪声级预判”的思想可能会进一步扩展到多步过滤,甚至集成到硬件加速层中,让机器人反应更加迅捷。

发现相似论文

试试这些示例

  • 查找最近其他试图通过在扩散模型去噪早期阶段进行剪枝或选择来优化推理效率的论文。
  • 哪篇论文最早探讨了扩散模型初始噪声(Initial Noise)与最终生成质量之间的相关性(如 Crystal Ball Hypothesis)?
  • 目前有哪些研究在尝试将类似 FASTER 的过滤机制应用到多模态视频生成或长序列决策任务中?
目录
FASTER:通过值引导采样加速强化学习,实现扩散策略的“降维打击”
1. TL;DR
2. 背景:昂贵的“优中选优”
3. 方法论:将去噪过程视为 MDP
3.1. 1. 架构解析
3.2. 2. 计算开销的质变
4. 实验结果:效率与性能的完美平衡
4.1. 1. 任务表现
4.2. 2. VLA 上的降本增效
5. 深度洞察:为什么不直接做蒸馏?
6. 总结与展望