[CVPR 2025] StreamReady:不仅要答得对,更要答得准时 —— 开启流式视频理解的新维度
StreamReady: Learning What to Answer and When in Long Streaming Videos
本文提出了 StreamReady,一个旨在解决流式视频理解中“何时回答”问题的框架。通过引入 Answer Readiness Score (ARS) 评价指标和轻量化就绪机制(Readiness Mechanism),该方法在保持高准确率的同时,实现了对视觉证据出现时机的精准捕捉,在 ProReady-QA 等多个长视频基准测试中达到 SOTA。
TL;DR
在实时视频流处理中,AI 常常面临一个尴尬的境地:要么在证据未显现时“抢答”造成幻觉,要么在证据消失后“迟到”失去意义。StreamReady 提出了首个就绪感知(Readiness-aware)流式框架,通过层次化记忆树和学习型 <RDY> Token,让模型学会“看准证据再开口”。
核心速览
流式视频理解(Streaming Video Understanding)是迈向具身智能和实时监控的关键。StreamReady 不仅在内容准确性上刷榜,更通过全新的 Answer Readiness Score (ARS) 指标,定义了“有效准确率”的概念。其在长达一小时的视频测试中表现极其稳健,是目前平衡推理效率与响应时机的顶流方案。
1. 痛点:被忽视的时间维度
传统的 Video MLLM 大多工作在离线模式,或者假设提问时证据已存在。但在现实世界中,我们往往会先提问(例如:“等会儿那个人出门时告诉我”),模型必须持续观察未来的流。
- 现有方法的局限:缺乏判断“证据是否充分”的能力,导致在长序列中容易产生幻觉或过度延迟。
- 度量的缺失:现有的准确率只管对错,不管你是在视频第 1 秒还是第 59 分钟给出的答案。
2. Methodology:StreamReady 的三大利器
A. 层次化视觉记忆树 (Visual Memory Tree)
面对数小时的视频流,模型无法存储所有帧。StreamReady 构建了一个三层架构:
- Level 1 (FIFO Buffer):保留最近帧的高清细节。
- Level 2 (Centroids):通过 K-means 聚类将旧帧压缩为质心,保留中等粒度的语义。
- Level 3 (Prototypes):进一步抽象为原型,支持快速的全局跨度检索。

B. 查询感知推理 (Query-Aware Reasoning)
模型不再盲目扫描记忆。它采用两阶段检索:首先根据问题在 Level 3 寻找相关区域(语义图查找),然后在选定的区域内深入 Level 2 提取精细证据。这种设计模仿了人类的“闪回式记忆”提取过程。
C. 就绪机制与 <RDY> Token
作者在长程隐藏状态中插入了一个特殊的 <RDY> Token。
- 直觉逻辑:当模型检索到的视听证据与问题高度契合时,该 Token 对应的 Readiness Head 会输出高分。
- 训练策略:采用对比损失(Contrastive Loss),利用伪标签监督模型:当证据足够时响应,不足时屏息观察。
3. 实验战绩:ARS 指标的降维打击
论文引入了 ProReady-QA 基准,这是首个包含证据窗口标注的长视频流数据集。
核心性能对比
实验显示,StreamReady 在 SSR(步骤识别)、REC(重复计数)等任务中全面领先。
- 有效准确率 (Acc_e):考虑时机后的准确率,StreamReady 领先第二名约 9%。
- 延迟与内存:得益于固定大小的层次化记忆,其推理延迟不随视频增长而爆炸,完美适配边缘计算设备。

4. 深度洞察:为什么 ARS 指标如此重要?
ARS 指标引入了非对称惩罚(Asymmetric Penalties):
- Early Penalty (EP):极其严厉。如果证据还没出现你就回答,这被视为“瞎猜”,分数骤减。
- Late Penalty (LP):相对宽容。如果证据过去了一会儿才回答,这被视为“反应慢”,分数轻微下降。
这种数学定义契合物理直觉:在自动驾驶或安防任务中,抢答导致的误报比迟到的警报后果更严重。
5. 总结与启示
StreamReady 告诉我们,流式理解的本质是时序证据的累积与决策的博弈。
- 贡献总览:统一了局部与全局推理、提出了适应性的层次化记忆、开发了首个带证据窗口的基准。
- 局限性:目前主要针对单一查询。在面临多个并行异步问题时,如何高效分配计算资源仍是挑战。
对于未来的 MLLM 开发者而言,StreamReady 提供了一个清晰的信号:是时候让模型学会如何“沉得住气”了。
