[CVPR 2026] SPATIALALIGN:让视频模型学会“空间位移”,突破 DSR 生成瓶颈
SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation
本文提出了 SPATIALALIGN,一个旨在增强视频生成模型(T2V)遵循动态空间关系(DSR)指令能力的自改进框架。该方法引入了基于几何规则的 DSR-SCORE 评价指标,并利用零阶正则化的直接偏好优化(DPO)对主流视频模型进行微调,显著提升了生成视频在空间逻辑上的准确性。
TL;DR
尽管当前的视频生成模型(T2V)如 Wan2.1 或 Sora 已经能生成大片级的视觉效果,但在处理“从左移动到顶部”这种简单的**动态空间关系(Dynamic Spatial Relationships, DSR)**时,往往表现得像个“空间感缺失”的初学者。本文提出的 SPATIALALIGN 框架,通过一套基于几何计算的评分系统 DSR-SCORE 结合零阶正则化 DPO 微调,成功让视频模型学会了理解并执行复杂的空间动作指令。
技术定位:这是一款针对视频生成模型指令遵循能力的“逻辑补丁”,是提升生成视频物理真实性的 SOTA 之作。
痛点深挖:为什么 AI 视频总是“左右不分”?
目前的 T2V 模型在处理静态空间(如“一只猫在桌子上”)时尚可,但一旦涉及到运动(Dynamic),就会出现以下痛点:
- 语义误解:模型往往只抓住了“狐狸”和“树墩”两个实体,却忽略了“从右到左”的动作约束。
- 评估荒漠:之前的研究依赖 GPT-4V 等 VLM 来判断生成视频是否正确,但 VLM 本身在空间感知上就表现欠佳,经常给错误的视频打高分。
- 微调陷阱:直接用 SFT(有监督微调)训练,模型容易为了凑分而产生色彩过饱和(Saturation Hacking)或直接崩坏。
核心方法论:DSR-SCORE 与零阶 DPO
1. 几何落地的 DSR-SCORE
作者摒弃了不靠谱的 VLM 评估,回归物理本质,利用几何计算来衡量空间关系:
- 目标提取:使用 Grounded-SAM 获取每一帧中动物和物体的 Bounding Box。
- SSR 计算:定义每一帧的静态空间得分(SSR-Score),包含距离(Normalized Distance)和方向(Cosine Distance)。
- 动态曲线分析:理想的 DSR 视频应该在 SSR 得分曲线上表现出“交叉模式”。例如,“左移到右”意味着“左侧得分”逐渐下降,而“右侧得分”逐渐上升。
图注:SPATIALALIGN 完整流程。左侧生成样本,中间进行几何评分,右侧执行基于偏好的优化。
2. 零阶正则化 DPO (Zeroth-Order DPO)
如何在不破坏预训练模型审美能力的前提下,注入空间逻辑?作者采用了 DPO 偏好对齐,并加入了一个关键的 **LZO(零阶正则化)**项:
- 为什么要正则化? 纯 DPO 容易为了满足偏好差距而让模型“走捷径”,导致生成画质劣化。
- LZO 的作用:将参考模型作为锚点(Anchor),约束微调后的模型不要偏离原始分布太远。计算公式通过梯度推导证明,LZO 能有效保留模型的“共同背景”理解能力。
实验结果:空间感的大幅跃迁分析
在自建的 DSR-DATASET 上的评测显示,SPATIALALIGN 的表现令人惊艳:
| 模型 | 空间准确率 (Correct@0.7) | 画质 (CLIP-IQA) |
|---|---|---|
| Wan2.1-1.3B (Baseline) | 12.5% | 0.8481 |
| SPATIALALIGN (Ours) | 58.5% | 0.8243 |
| HunyuanVideo v1.5-8B | 49.0% | 0.9299 |
核心观察:
- 逻辑翻倍:在 1.3B 的小模型上,我们的方法直接将空间准确率翻了近 5 倍,甚至超越了参数量更大的 8B 模型。
- 结构化理解:消融实验证明,即便改变提示词(Prompt)的结构(如从“then...”改为“from... to...”),微调后的模型依然能保持高性能,说明它确实理解了空间语义。
图注:定性结果对比。可以看到 baseline 模型往往将动物生成在固定位置,而 SPATIALALIGN 准确实现了跨越式的位移。
深度总结与展望
Takeaway: SPATIALALIGN 的成功在于它意识到:高级语义对齐不应仅依赖神经网络的黑盒感知(VLM),而应引入明确的物理规律(几何规则)作为信号。
局限性: 目前该方法主要针对单动物、单静态物体的简单交互。但在实际场景中,多物体交互、动态背景下的空间关系仍极具挑战。此外,DSR-SCORE 严重依赖于 Grounded-SAM 的追踪质量,在极端遮挡或模糊下可能失效。
未来启示: 这为“具身智能”的模拟环境提供了新思路。如果 T2V 模型能精准遵循空间指令,它就能成为机器人训练中最完美的“物理模拟器”。
