[CVPR 2025(?)] RIVER:打破离线局限,赋予视频 LLM 实时交互的“灵魂”
RIVER: A Real-Time Interaction Benchmark for Video LLMs
总结
问题
方法
结果
要点
摘要
本文推出了 RIVER Bench,这是一个专门用于评估视频大语言模型(Video LLMs)实时交互能力的基准测试。该框架涵盖了回顾性记忆(Retro-Memory)、即时感知(Live-Perception)和主动响应(Pro-Response)三大任务,并在长视频理解上取得了显著的评估突破。
TL;DR
传统的视频大模型(Video LLMs)更像是一个“影评人”,看完整个片子才能发表见解。而 RIVER (Real-tIme intERaction) 旨在将它们变成“实时同声传译”或“生活助力者”。该工作定义了实时视频交互的三大核心任务,并提出了一个能显著降低长视频记忆衰减的长短期记忆模块。
痛点深挖:为什么 LLM 在视频面前总是“慢半拍”?
在 AR 导航或机器人作业场景中,我们需要 AI 能够:
- 回头看(Retro-Memory):刚才我把扳手放哪了?
- 盯着看(Live-Perception):现在锅里的水开了吗?
- 等着看(Pro-Response):当看到公交车进站时,立刻提醒我。
然而,现有的模型(如 LLaVA-Video, InternVL)大多是离线架构。它们在处理超长视频(1小时以上)时,要么显存爆炸,要么通过极端抽帧丢失了所有的时序细节。最关键的是,它们缺乏“主动性”,无法在流媒体中等待特定信号并触发响应。
核心贡献:RIVER Bench 的三位一体
RIVER Bench 引入了更加符合人类交互直觉的评估维度:
- Retro-Memory:通过设置 15s 到 3600s 不等的时间间隔,测试模型对过去事件的记忆稳定性,甚至绘制出了 AI 的“遗忘曲线”。
- Live-Perception:测试模型对当前几秒钟内发生动作的即时理解。
- Pro-Response:这是最难的任务,要求模型持续监控视频流,直到某一预设条件达标(如:看到某人招手)才输出。

技术秘密:长短期记忆(Long-Short Term Memory)
为了让离线模型变“在线”,作者没有简单地堆砌显存,而是设计了一套精妙的缓存管理机制:
- 短期窗口:保留当前窗口的高分辨率特征,捕捉动作细节。
- 长期记忆槽 (Memory Slots):将历史帧通过平均池化压缩,并利用最近邻平均策略(Nearest-neighbor Averaging)更新记忆。
- 时间戳注入:在 Prompt 中明确告诉模型“长期记忆涵盖了 0-100s,当前窗口是 100-105s”,增强模型的时间感知。

实验战绩与深度洞察
- 性能天花板:GPT-4o 依然是目前实时交互的王者,尤其在即时感知上遥遥领先。
- 打破“遗忘曲线”:实验发现,配备了记忆模块的模型,其记忆随时间衰减的斜率明显变平。有趣的是,AI 的记忆曲线与人类的“艾宾浩斯遗忘曲线”不同,AI 在一小时内的稳定性远超人类,这预示着 AI 在协助人类进行长时监控任务中的巨大潜力。
- 微调的价值:仅仅通过 RIVER 提供的 4.2k 高质量训练数据进行 LoRA 微调,VideoLLM-Online 的主动响应能力就提升了 11% 以上。

总结与局限
RIVER 填补了视频模型从“事后分析”到“实时交互”的鸿沟。不过,作者也诚实地指出,目前的 Bench 还缺乏音频模态。在真实的实时交互中,声音(如呼救声、警报声)是极为关键的触发信号。未来的 RIVER 2.0 可能会是一个真正的全模态(Omni)实时交互基准。
对于开发者而言,这篇论文最大的启示在于:不要盲目增加输入帧数,高效的记忆压缩策略方案才是解决长视频实时性的唯一出路。
