[arXiv 2026] SkyReels-V4:音视频联合生成、修复与编辑的大一统基石

How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1

总结
问题
方法
结果
要点

SkyReels-V4 是一种统一的多模态视频基础模型,基于双流 MMDiT 架构,实现了视频与音频的联合生成、修复(Inpainting)与编辑。该模型支持 1080p、32 FPS 及 15 秒长的影院级画质,并在 Artificial Analysis Arena 排行榜中位列全球第二。

TL;DR

SkyReels-V4 不仅仅是一个视频生成器,它是一个全能型视频创作引擎。它在单一架构下完美融合了视频生成、音频对齐、局部修复(Inpainting)和视频编辑。它能理解文本、图片、视频剪辑等多种模态输入,生成长达 15 秒、分辨率高达 1080p 且自带同步音效的影院级内容。

背景:从“默片时代”到“全能导演”

早期的 AI 视频生成像是电影史上的“默片时代”,音轨和画轨是割裂的。即使是后来的音画联合模型,在面对“改一下主角衣服”或者“根据这张图生成特定人物的对话”这种精细活儿时也显得捉襟见肘。SkyReels-V4 的定位非常清晰:它是首个将多模态输入、音视频联合生成、以及生成/修复/编辑任务全部统一在一个框架下的基础模型。

核心架构:双流 MMDiT 的交响乐

SkyReels-V4 的心脏是由两个对称的 Multimodal Diffusion Transformer (MMDiT) 分支组成的。

  1. 视频流与音频流:两个分支并行工作,分别处理视觉和听觉。
  2. 双向同步(Bidirectional Cross-Attention):为了解决“口型对齐”和“声画同步”的顽疾,模型在每一层都让音频特征去“询问”视频特征,反之亦然。
  3. 共享 MLLM 编码器:使用强大的多模态大模型作为编码器,这意味着你可以输入类似“穿着 @image_1 衣服的人在 @video_1 的背景下说 <dialogue>你好</dialogue>”这种复杂的混合指令。

模型架构图 图 1:SkyReels-V4 双流架构与多模态指令输入流程

破解效率魔咒:联合关键帧生成

直接生成 1080p 的长视频在计算上是灾难性的。SkyReels-V4 采用了一套聪明的“套娃”策略:

  • 基础模型:同时预测一个“低分辨率的全序列”和若干个“高分辨率的关键帧”。
  • Refiner 模块:利用超分辨率和帧内插(Frame Interpolation)技术,将上述两者融合,补全细节和运动轨迹。
  • VSA(Video Sparse Attention):引入稀疏注意力机制,将注意力开销降低了 3 倍,使 15 秒长视频的生成变得触手可及。

统一修复逻辑:万物皆可 Inpainting

SkyReels-V4 最令人惊叹的设计是其通道拼接(Channel Concatenation)。它将不同的任务描述为特定的“遮罩(Mask)”配置:

  • I2V(图生视频):遮住第一帧以外的所有帧。
  • 视频编辑:遮住需要修改的局部区域。
  • 视频扩展:遮住已有的前几秒内容。 这种“大一统”设计极大地简化了训练逻辑。

实验战绩:竞技场上的领跑者

在权威的 Artificial Analysis Arena 排行榜上,SkyReels V4 预览版以 1090 的 Elo 得分紧随 Kling 3.0 Pro 之后,超越了 Google 的 Veo 3.1 和 OpenAI 的 Sora 2(12月版)。

实验结果对比 表 1:Artificial Analysis 视频竞技场排名(截至 2026 年 2 月)

人类评估(GSB 对比)显示,SkyReels-V4 在指令遵循(Prompt Following)和运动质量(Motion Quality)上拥有压倒性优势,尤其在处理复杂的多镜头描述时表现稳健。

人类评估结果 图 4:SkyReels V4 在五大维度的绝对评分对比

总结与洞察

SkyReels-V4 的成功不仅在于它“大而全”,更在于它对效率可控性的平衡。通过将极其复杂的编辑任务简化为 Inpainting,它为专业影视制作提供了一个极低门槛的工具。

局限性:尽管模型表现强劲,但在空间音频的精细定位和极端动态下的结构保持上仍有提升空间。

随着 Skywork AI 团队持续迭代,我们可以预见,未来的内容创作将真正实现“所写即所得,所画即所听”。

发现相似论文

试试这些示例

  • 查找最近其他采用类似 MMDiT 架构并尝试解决视频与音频联合生成同步性问题的 SOTA 论文。
  • 哪篇论文最早提出了视频稀疏注意力 (Video Sparse Attention, VSA) 机制,SkyReels-V4 在此基础上做了哪些针对性改进?
  • 探讨将 SkyReels-V4 的 Channel-concatenation 统一修复框架应用到 3D 场景生成或实时虚拟直播任务中的相关研究。
目录
[arXiv 2026] SkyReels-V4:音视频联合生成、修复与编辑的大一统基石
1. TL;DR
2. 背景:从“默片时代”到“全能导演”
3. 核心架构:双流 MMDiT 的交响乐
4. 破解效率魔咒:联合关键帧生成
5. 统一修复逻辑:万物皆可 Inpainting
6. 实验战绩:竞技场上的领跑者
7. 总结与洞察