[TNNLS 2025] 悲观辅助策略:破解离线强化学习价值高估的新范式

Pessimistic Auxiliary Policy for Offline Reinforcement Learning

总结
问题
方法
结果
要点
摘要

本文提出了针对离线强化学习(Offline RL)的悲观辅助策略(Pessimistic Auxiliary Policy, PAP)。该方法通过在 TD 更新中引入一个最大化 Q 函数置信下界(LCB)的辅助策略来采样动作,显著缓解了分布偏移导致的价值高估问题,并在 Gym、Adroit 和 AntMaze 等多个 Benchmark 上刷新了 SOTA 性能。

TL;DR

离线强化学习(Offline RL)中最令人头疼的是评估那些“没见过”的动作,这往往会导致 Q 值虚高并拖垮策略。本文提出了一种全新的悲观辅助策略(Pessimistic Auxiliary Policy)。不同于传统方法死磕策略约束,它通过在价值评估(TD Update)阶段引入一个专门寻找“高价值且稳健”动作的辅助策略,从根源上截断了误差累积。实验显示,在最具挑战性的 AntMaze 任务中,该方法将基准模型性能提升了 159%


1. 痛点深挖:离线学习的“幻觉”

在离线场景下,智能体无法通过与环境交互来纠错。当我们计算贝尔曼偏差时: 如果 产生了一个 OOD(分布外)动作,Q 函数由于泛化误差可能会给出一个异常高的评分。TD 更新会像滚雪球一样放大这个错误,最终导致智能体沉溺于“幻觉”中的高收益,在实际部署时彻底崩溃。


2. 核心直觉:寻找“稳健的替代品”

作者认为,既然我们无法完全避免噪声,那就在采样时表现得“悲观”一点。

核心动机 (Motivation):如果我们在进行 TD 更新采样时,不直接用当前的策略,而是用一个在当前策略邻域内、且能够最小化不确定性的辅助策略 ,是否能抑制误差?

为了实现这一点,作者利用了认识不确定性(Epistemic Uncertainty)。通过两个 Q 网络之间的差异来定义不确定性上限,进而构造 Q 函数的置信下界(Lower Confidence Bound, LCB):


3. 方法论详解:从泰勒展开到悲观导向

直接优化上面的非线性函数开销巨大,本文的妙处在于使用一阶泰勒展开 在当前策略 邻域内进行线性近似:

悲观辅助策略构建原理

通过推导(详见论文中的命题 1),作者得到了悲观辅助策略的解析解:

abla_a Q_{LB}(s, a) $$ 这个公式直观地告诉我们:辅助策略 $\mu_p$ 是在原始策略的基础上,沿着“价值增加且不确定性降低”的方向挪动了一小步。 --- ## 4. 实验与结果:全线飘红 该方法被验证为一种“插件”式的增强。作者将其分别应用在经典基线 **TD3BC** 和最前沿的 **Diffusion-QL** 上,命名为 TD3PA 和 DQLPA。 ### 性能飞跃 在 D4RL 标准测试集中,改进后的算法几乎在所有维度上都优于原算法: - **Gym 任务**:DQLPA 达到了 811.2 的总分,稳步超越 DQL。 - **AntMaze 任务**:这是考验处理极长序列能力的关卡,TD3PA 直接将 TD3BC 的 163.8 分提升到了 **425.6 分**。 ![不同任务下的性能对比](https://cdn.atominnolab.com/wisdoc/jobs/20260303-3a36e663-0522-4755-adce-a254ed42de7b/page_005_block_004.png) ### 误差抑制的可视化 通过对比 Q 估计值与真实折扣回报(Actual Return),实验发现 TD3PA 的评估误差在 HalfCheetah 任务上降低了约 **90%**。这意味着模型不再“自嗨”,其感知的价值非常接近真实情况。 ![价值估计误差分析](https://cdn.atominnolab.com/wisdoc/jobs/20260303-3a36e663-0522-4755-adce-a254ed42de7b/page_006_block_007.png) --- ## 5. 深度洞察:为什么这种“辅助”更有效? 传统的离线 RL 方法往往陷入**探索与偏差的两难**: 1. **CQL** 通过强行压低所有 OOD 动作的 Q 值,虽然安全但容易失去寻找最优解的动力。 2. **TD3BC** 依靠行为克隆(BC)项拉住策略,但这取决于数据质量。 **PAP 策略**的优势在于,它不是简单地“禁锢”策略,而是通过一种**“预测性悲观”**来优化路径。它告诉 TD 更新:“如果你不确定,那就假设那个方向是有坑的,选保守一点的动作来做参照”。这种基于梯度的一阶优化方案既保留了深度学习的泛化能力,又具备了理论上的收敛保障。 --- ## 6. 总结与启示 这篇论文提出的悲观辅助策略为离线强化学习提供了一个简洁而强大的视角:**不改变优化目标,只改变评估时的采样偏好**。 **局限性**:尽管实验效果显著,但该方法依赖于不确定性的准确建模。对于某些极度稀疏或高维噪声的数据集,基于 Ensemble 方差的不确定性估计可能会失效,未来结合更强大的生成模型(如 Diffusion 逆扩散过程中的分步不确定性)可能会有更大的潜力。

发现相似论文

试试这些示例

  • 查找最近一年内在离线强化学习中利用不确定性量化(Uncertainty Quantification)来缓解过拟合或高估问题的 SOTA 论文。
  • “悲观主义原则 (Pessimism Policy)” 在强化学习理论中是如何演进的,本文提出的辅助策略与传统的 Conservative Q-Learning (CQL) 有何本质数学联系?
  • 探索基于扩散模型 (Diffusion Models) 的强化学习策略如何通过引入类似 LCB 的置信度评估来提升超长路径规划任务的稳定性。
目录
[TNNLS 2025] 悲观辅助策略:破解离线强化学习价值高估的新范式
1. TL;DR
2. 1. 痛点深挖:离线学习的“幻觉”
3. 2. 核心直觉:寻找“稳健的替代品”
4. 3. 方法论详解:从泰勒展开到悲观导向
5. 4. 实验与结果:全线飘红
5.1. 性能飞跃
5.2. 误差抑制的可视化
6. 5. 深度洞察:为什么这种“辅助”更有效?
7. 6. 总结与启示