[CVPR 2026] SPATIALALIGN:让视频模型学会“空间位移”,突破 DSR 生成瓶颈

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

总结
问题
方法
结果
要点

本文提出了 SPATIALALIGN,一个旨在增强视频生成模型(T2V)遵循动态空间关系(DSR)指令能力的自改进框架。该方法引入了基于几何规则的 DSR-SCORE 评价指标,并利用零阶正则化的直接偏好优化(DPO)对主流视频模型进行微调,显著提升了生成视频在空间逻辑上的准确性。

TL;DR

尽管当前的视频生成模型(T2V)如 Wan2.1 或 Sora 已经能生成大片级的视觉效果,但在处理“从左移动到顶部”这种简单的**动态空间关系(Dynamic Spatial Relationships, DSR)**时,往往表现得像个“空间感缺失”的初学者。本文提出的 SPATIALALIGN 框架,通过一套基于几何计算的评分系统 DSR-SCORE 结合零阶正则化 DPO 微调,成功让视频模型学会了理解并执行复杂的空间动作指令。

技术定位:这是一款针对视频生成模型指令遵循能力的“逻辑补丁”,是提升生成视频物理真实性的 SOTA 之作。


痛点深挖:为什么 AI 视频总是“左右不分”?

目前的 T2V 模型在处理静态空间(如“一只猫在桌子上”)时尚可,但一旦涉及到运动(Dynamic),就会出现以下痛点:

  1. 语义误解:模型往往只抓住了“狐狸”和“树墩”两个实体,却忽略了“从右到左”的动作约束。
  2. 评估荒漠:之前的研究依赖 GPT-4V 等 VLM 来判断生成视频是否正确,但 VLM 本身在空间感知上就表现欠佳,经常给错误的视频打高分。
  3. 微调陷阱:直接用 SFT(有监督微调)训练,模型容易为了凑分而产生色彩过饱和(Saturation Hacking)或直接崩坏。

核心方法论:DSR-SCORE 与零阶 DPO

1. 几何落地的 DSR-SCORE

作者摒弃了不靠谱的 VLM 评估,回归物理本质,利用几何计算来衡量空间关系:

  • 目标提取:使用 Grounded-SAM 获取每一帧中动物和物体的 Bounding Box。
  • SSR 计算:定义每一帧的静态空间得分(SSR-Score),包含距离(Normalized Distance)和方向(Cosine Distance)。
  • 动态曲线分析:理想的 DSR 视频应该在 SSR 得分曲线上表现出“交叉模式”。例如,“左移到右”意味着“左侧得分”逐渐下降,而“右侧得分”逐渐上升。

模型架构图 图注:SPATIALALIGN 完整流程。左侧生成样本,中间进行几何评分,右侧执行基于偏好的优化。

2. 零阶正则化 DPO (Zeroth-Order DPO)

如何在不破坏预训练模型审美能力的前提下,注入空间逻辑?作者采用了 DPO 偏好对齐,并加入了一个关键的 **LZO(零阶正则化)**项:

  • 为什么要正则化? 纯 DPO 容易为了满足偏好差距而让模型“走捷径”,导致生成画质劣化。
  • LZO 的作用:将参考模型作为锚点(Anchor),约束微调后的模型不要偏离原始分布太远。计算公式通过梯度推导证明,LZO 能有效保留模型的“共同背景”理解能力。

实验结果:空间感的大幅跃迁分析

在自建的 DSR-DATASET 上的评测显示,SPATIALALIGN 的表现令人惊艳:

模型空间准确率 (Correct@0.7)画质 (CLIP-IQA)
Wan2.1-1.3B (Baseline)12.5%0.8481
SPATIALALIGN (Ours)58.5%0.8243
HunyuanVideo v1.5-8B49.0%0.9299

核心观察

  • 逻辑翻倍:在 1.3B 的小模型上,我们的方法直接将空间准确率翻了近 5 倍,甚至超越了参数量更大的 8B 模型。
  • 结构化理解:消融实验证明,即便改变提示词(Prompt)的结构(如从“then...”改为“from... to...”),微调后的模型依然能保持高性能,说明它确实理解了空间语义。

实验结果对比 图注:定性结果对比。可以看到 baseline 模型往往将动物生成在固定位置,而 SPATIALALIGN 准确实现了跨越式的位移。


深度总结与展望

Takeaway: SPATIALALIGN 的成功在于它意识到:高级语义对齐不应仅依赖神经网络的黑盒感知(VLM),而应引入明确的物理规律(几何规则)作为信号。

局限性: 目前该方法主要针对单动物、单静态物体的简单交互。但在实际场景中,多物体交互、动态背景下的空间关系仍极具挑战。此外,DSR-SCORE 严重依赖于 Grounded-SAM 的追踪质量,在极端遮挡或模糊下可能失效。

未来启示: 这为“具身智能”的模拟环境提供了新思路。如果 T2V 模型能精准遵循空间指令,它就能成为机器人训练中最完美的“物理模拟器”。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决文本生成视频(T2V)模型中物体运动轨迹和物理一致性问题的论文。
  • 直接偏好优化(DPO)在扩散模型(Diffusion Models)中的应用最早起源于哪篇论文,本文提出的零阶正则化改进与其有何关联?
  • 有哪些研究利用 Grounded-SAM 或其他检测跟踪工具为生成式视频模型构建自动评分系统或数据集?
目录
[CVPR 2026] SPATIALALIGN:让视频模型学会“空间位移”,突破 DSR 生成瓶颈
1. TL;DR
2. 痛点深挖:为什么 AI 视频总是“左右不分”?
3. 核心方法论:DSR-SCORE 与零阶 DPO
3.1. 1. 几何落地的 DSR-SCORE
3.2. 2. 零阶正则化 DPO (Zeroth-Order DPO)
4. 实验结果:空间感的大幅跃迁分析
5. 深度总结与展望