[CVPR 2025] InfinityStory:无限长视频生成的“稳”与“顺”,解决背景漂移与角色突变

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

总结
问题
方法
结果
要点
摘要

InfinityStory 是一个旨在生成长篇故事视频的崭新框架,通过引入“位置感知背景注入”和“多角色转换合成”技术,实现了小时级视频的视觉连贯性。该方法在 VBench 评测中取得了背景一致性(88.94)和主体一致性(82.11)的双项第一,显著提升了长视频生成的逻辑稳定性。

TL;DR

生成一段精美的 5 秒视频已不再是难事,但如何让这些视频连成一段长达 1 小时、物理逻辑自洽且运镜平滑的电影故事?Adobe Research 等机构提出的 InfinityStory 给出了答案:它通过层次化智能体规划显式背景锁定,辅以首个多角色转场数据集,在长视频生成的稳定性(Consistency)上刷写了 SOTA。

背景定位

目前长视频生成领域主要分为两条路径:一是纯模型端的长上下文建模(如 Long Context Tuning),二是基于 Multi-Agent 的导演式协作规划。InfinityStory 属于后者的高级形态,它不满足于仅仅生成孤立的镜头,而是试图建立一套“世界观准则”,确保在镜头切换间,背景不模糊、人影不乱晃。

痛点深挖:为什么目前的视频“接不住”?

  1. 背景感官漂移 (Scene Drift):现有模型在生成每一镜头时,即便 Prompt 相同,背景的灯光、地砖纹理、物体摆放也会因随机种子而产生微小偏差。累加起来,场景就像在不断变形。
  2. 角色“瞬移”挑战 (Shot Transition):电影中最常见的“人从画外走入”或“两人擦肩而过”在 AI 生成中极其困难。大多数模型直接拼接镜头,导致角色在这一秒还没出现,下一秒突然出现在画面中央,极其违和。

核心方案:空间锚定与转场合成

InfinityStory 的核心架构包含两个关键创新:

1. 显式的背景位置注入 (Location Injection)

系统不再让 AI 随机发挥。

  • 预规划位置库:Agent 首先定义故事发生的固定地点(如“森林”、“城堡内部”),并生成一组高质量的静态背景
  • I2I 角色融合:在生成每个镜头前,将角色参考图和固定背景图进行合成融合,生成锚定关键帧 ,强迫模型在确定的物理框架内进行动力学生成。

模型架构图 图 1:InfinityStory 的交替生成管线:奇数镜头负责叙事,偶数镜头负责转场过渡。

2. CMTS:电影级多角色转场合成

为了解决转场生硬的问题,作者构建了一个包含 10,000 条高质量合成视频的转场数据集。

  • 五类转场逻辑:系统显式训练模型如何处理 Entry(进入)、Exit(退出)、No Change、Combination(组合)和 Replacement(替换)。
  • FLF2V 模型:采用“首帧-末帧-视频”生成模式。转场镜头会自动衔接前一镜头的最后一帧和下一镜头的首帧,确保动作在时序上的完整性。

实验战绩:一致性的双冠王

在 VBench 的严苛评测下,InfinityStory 展现了极强的统治力。尤其是在背景一致性 (Background Consistency)主体一致性 (Subject Consistency) 两个关键维度,大幅甩开了此前的 baseline(如 MovieAgent)。

实验结果对比

关键数据亮点:

  • 背景一致性:88.94(第一名)。
  • 主体一致性:82.11(第一名)。
  • 消融实验验证:若移除背景注入模块,其背景一致性指标会直接下降 1.6% 以上,验证了空间锚定的重要性。

深度洞察:走向“可控叙事”

InfinityStory 的成功揭示了一个趋势:视频生成的质量已经从“单点生成”转向“时空约束”。 它不再寄希望于 Diffusion Model 自动理解电影蒙太奇(Montage),而是通过外挂 Agent 和特定任务的微调(LoRA),把电影制作中的“空镜”、“走位”等导演思维通过显式元数据赋能给生成器。

局限性: 目前模型对未知且复杂的角色组合(如 4 人以上频繁交互)仍有挑战。且在 480p 向上采样至 720p 时,背景注入模块引入的微量降质仍需进一步通过高清修复模型(Refiner)来解决。

未来展望

随着 InfinityStory 这种具备“时空记忆”的框架日益成熟,我们离“输入一本小说,产出一部电影”的目标又近了一大步。未来的研究重点可能会转向如何在这种稳定的框架下注入更多复杂的镜头语言(如 Dolly Zoom 或长推镜头)。

发现相似论文

试试这些示例

  • 针对生成视频中的镜头转场,现有的哪些基于 Mask 或 Attention 导引的方法能实现除淡入淡出外更复杂的运镜一致性?
  • 哪篇早期的视觉叙事论文首次提出了 Image-to-Video 与 Video-to-Video 交替生成的两阶段长视频合成思路?
  • 除了本研究提出的合成数据集,目前有哪些开源的专业电影剪辑数据集包含具体的“角色登场/退场”元数据标签?
目录
[CVPR 2025] InfinityStory:无限长视频生成的“稳”与“顺”,解决背景漂移与角色突变
1. TL;DR
2. 背景定位
3. 痛点深挖:为什么目前的视频“接不住”?
4. 核心方案:空间锚定与转场合成
4.1. 1. 显式的背景位置注入 (Location Injection)
4.2. 2. CMTS:电影级多角色转场合成
5. 实验战绩:一致性的双冠王
6. 深度洞察:走向“可控叙事”
7. 未来展望