[CVPR 2026] APPO:视频推理的核心不在脑子(Reasoning),而在眼睛(Perception)
APPO: Attention-guided Perception Policy Optimization for Video Reasoning
本文提出了 APPO(Attention-guided Perception Policy Optimization),一种通过强化学习(RL)提升多模态大模型(MLLM)视频细粒度感知能力的算法。该方法利用注意力权重识别关键视频帧,并引入 Token 级稠密奖励来优化感知环节,在多个视频推理基准测试中超越了 GRPO 和 DAPO 等主流算法。
TL;DR
在视频推理任务中,模型看不清(感知弱)比想不明白(逻辑弱)更致命。本文提出 APPO (Attention-guided Perception Policy Optimization),通过分析模型自身的 Attention 轨迹,挖掘出高分答案重点关注的视频帧,并以此作为“细粒度奖励”来强化模型对视频细节的感知。实验显示,这一方法在零样本泛化和推理精度上全面超越了现有的 GRPO 和 DAPO 框架。
背景定位:感知 vs. 推理,谁才是短板?
在视频问答(Video QA)领域,学术界长期倾向于提升模型的逻辑推理能力。然而,本文作者通过一系列精密的“控制变量”实验得出了惊人的结论:
- 逻辑的边际效应:当感知模型相同时,将推理后端从 8B 换成 OpenAI-o3 级的博士级模型,性能仅增长 0.7%。
- 感知的决定力量:保持推理器不变,仅仅将感知器规模从 7B 提升到 32B,性能直接跃升 1.4%。
结论一针见血:当前视频 MLLM 的瓶颈不在于“想不出答案”,而在于“根本没看清关键帧”。
痛点深挖:昂贵的标注与稀疏的信号
要提升感知,最粗暴的方法是给视频做细粒度的地面真值(Ground Truth)标注,但这太贵了。现有的强化学习方法(如 DeepSeek-R1 使用的 GRPO)主要依赖最终答案的正确性(Outcome Reward),这种奖励信号对于几十秒的视频来说太“稀疏”了。模型可能因为蒙对答案而领赏,但其实它根本没看那个关键的动作帧。
APPO 核心机制:让模型“学会观察”
APPO 的核心直觉是:高分样本(High-reward paths)的 Attention 轨迹揭示了视频中的“真相”。
1. 自动定位关键帧 (Attention-guided Frame Selection)
APPO 不同于传统的 RL,它会回溯模型内部的注意力权重(Attention Scores)。如果一组高奖励的回答都强力关注了第 15 帧,而低奖励回答忽略了它,那么第 15 帧就是解题的“关键感知锚点”。
2. Token 级的“感知激励” (Perception Token Re-weighting)
一旦锁定了关键帧,APPO 会识别出所有关注该帧的 Token(称为 Intra-group Perception Tokens)。通过计算这些 Token 概率分布的 KL 散度,算法会给予那些能准确捕捉关键信息的 Token 更高的学习权重,从而实现在没有额外标注的情况下,对模型进行“手术刀”式的感知能力修正。
图 1:APPO 算法流程,利用 Attention 轨迹将稀疏奖励转化为稠密的帧级引导信号。
实验战绩:低成本、高收益
作者在 SEED-Bench-R1、Perception Test 等多个权威榜单进行了测试:
- SOTA 性能:在 Qwen2.5-VL 系列模型上,APPO 相比于 GRPO 和 DAPO 均有显著提升。尤其在 3B 小模型上,由于其底座感知较弱,APPO 带来的补强效果甚至超过了 4%。
- 极端高效:仅用 34K 的训练数据,APPO 就在 OOD(分布外)测试中击败了那些使用 260K 数据训练的巨型模型(如 Video-R1)。这证明了“高质量细粒度信号”优于“大规模暴力训练”。
表 1:APPO 在不同规模和基准上的表现,全面领先 baseline。
深度洞察:为什么 APPO 有效?
通过对训练过程的消融实验(Ablation Study),作者发现 APPO 在训练中维持了更高的 Generation Entropy(生成熵) 和 Gradient Norm。这意味着模型不仅没有陷入过早的崩溃,反而因为有了细粒度的感知信号,在一个更广阔的空间里进行有效的探索(Exploration)。
图 2:训练动态曲线显示 APPO 具有更强的探索能力和更优的收敛奖励。
总结与局限
APPO 为视频强化学习指明了一个新方向:通过推理(Reasoning)来反馈感知(Perception)。
优势:
- 不需要昂贵的细粒度空间/时间标注。
- 相比传统的 outcome-reward 训练更鲁棒,泛化性更强。
局限性: 由于需要提取 Attention 权重,目前无法直接使用极致优化的推理引擎(如 Flash Attention 某些特定的快速实现或直接使用 vLLM 的某些加速模式可能会受限),导致训练效率约为 DAPO 的 80%-90%。但考虑到它在精度上的巨大收益,这点算力开销是完全值得的。
未来的启示:这一范式可以轻易扩展到其他多模态领域(如医疗影像或图表推理),只要该领域存在“感知决定推理”的逻辑,APPO 就能大显身手。
