FASTER:通过值引导采样加速强化学习,实现扩散策略的“降维打击”
FASTER: Value-Guided Sampling for Fast RL
本文提出了 FASTER,一种针对扩散策略(Diffusion Policies)的高效值引导采样方法。通过将动作去噪过程建模为 MDP 并引入噪声级评论家(Noise-level Critic),该方法在保持采样缩放(Test-time Scaling)性能增益的同时,显著降低了推理和训练的计算成本。
TL;DR
在强化学习(RL)领域,基于扩散模型(Diffusion Models)的策略因其极强的表达能力而备受青睐。然而,为了追求极致性能,研究者通常采用 Best-of-N 采样:采样 N 个噪声,全部去噪成动作,再选最好的。这导致计算成本飙升了 N 倍。FASTER 提出了一种天才的方案:在噪声还是“乱码”的时候就预测哪个会成为“神来之笔”,只对最有潜力的那一个进行去噪。结果?性能不减,计算量暴跌。
背景:昂贵的“优中选优”
当前的 SOTA 算法(如 IDQL, EXPO)在处理复杂机器人操控任务时,往往通过增加测试时计算量(Test-time Scaling)来提高成功率。
- 痛点:对于像 3.3B 参数的 VLA 大模型,原本跑一次推理就挺费劲,如果还要做 8 次全量去噪,机器人还没动,系统就卡死了。
- 直觉:作者发现,动作的好坏其实在初始噪声(Seed)阶段就已经定调了。我们不需要看到最后的动作,就能提前“预判”谁是赢家。
方法论:将去噪过程视为 MDP
FASTER 的核心是将去噪过程建模为一个过滤 MDP(Filtering MDP)。
1. 架构解析
传统的 Best-of-N 需要 次 Actor 前向传播(T 为去噪步数)。而 FASTER 引入了一个轻量级的 Denoise Critic ()。
- 输入:当前环境状态 和初始噪声 。
- 输出:该噪声产生的动作在未来的期望回报。
- 训练逻辑:采用回归损失,强制 去逼近训练好的动作级评论家 的输出。
图 1:FASTER 流程示意图。通过 快速评估噪声,仅对冠军候选进行全量去噪。
2. 计算开销的质变
计算成本对比:
- 传统 Best-of-N:
- FASTER: 由于 (尤其是噪声级评论家)通常比 小得多,FASTER 成功将 的倍率效应从重负载的 Actor 中解耦出来。
实验结果:效率与性能的完美平衡
1. 任务表现
在 Robomimic 各项任务中,FASTER-EXPO 不仅在样本效率上优于 RLPD 等单纯的 RL 算法,更重要的是,它在仅消耗约 1/8 推理计算量的情况下,完全追平了完整版 EXPO 的成功率。
图 2:在线强化学习成功率对比。FASTER 在不同任务上均展现了极强的竞争力和极高的计算效率。
2. VLA 上的降本增效
在 3.3B 参数的 OpenPI 模型上,FASTER 的优势极其显著:
- 推理延迟:从 566ms 降至 335ms。
- FLOPs:从 骤降至 (约 8 倍节省)。
- 训练速度:每步更新快了 4.5 倍。
图 3:在大型 VLA 模型上的时间与功耗收益,证明了其在大规模模型时代的实用性。
深度洞察:为什么不直接做蒸馏?
一个常见的策略是“蒸馏”:训练一个策略直接输出高价值动作。但文章通过消融实验(Ablation Study)指出,由于 Q 函数在训练中是动态变化的,蒸馏会面临严重的**非平稳(Non-stationarity)**问题。相比之下,FASTER 的过滤机制更稳定,因为它不强迫模型改变生成分布,只是做了一个“聪明的选择”。
总结与展望
FASTER 成功证明了:在生成式强化学习中,我们不需要在“计算开销”和“决策质量”之间做单选题。
- 价值:它为具身智能(Embodied AI)的低功耗、低延迟部署打开了新大门。
- 局限:目前主要针对具有初始噪声结构的策略(如 Diffusion, Flow Matching),对于自回归(Autoregressive)模型(如常用的 Transformer 动作基元)的适配尚需进一步探索。
未来,这种“噪声级预判”的思想可能会进一步扩展到多步过滤,甚至集成到硬件加速层中,让机器人反应更加迅捷。
