[arXiv 2026] SkyReels-V4:音视频联合生成、修复与编辑的大一统基石
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
SkyReels-V4 是一种统一的多模态视频基础模型,基于双流 MMDiT 架构,实现了视频与音频的联合生成、修复(Inpainting)与编辑。该模型支持 1080p、32 FPS 及 15 秒长的影院级画质,并在 Artificial Analysis Arena 排行榜中位列全球第二。
TL;DR
SkyReels-V4 不仅仅是一个视频生成器,它是一个全能型视频创作引擎。它在单一架构下完美融合了视频生成、音频对齐、局部修复(Inpainting)和视频编辑。它能理解文本、图片、视频剪辑等多种模态输入,生成长达 15 秒、分辨率高达 1080p 且自带同步音效的影院级内容。
背景:从“默片时代”到“全能导演”
早期的 AI 视频生成像是电影史上的“默片时代”,音轨和画轨是割裂的。即使是后来的音画联合模型,在面对“改一下主角衣服”或者“根据这张图生成特定人物的对话”这种精细活儿时也显得捉襟见肘。SkyReels-V4 的定位非常清晰:它是首个将多模态输入、音视频联合生成、以及生成/修复/编辑任务全部统一在一个框架下的基础模型。
核心架构:双流 MMDiT 的交响乐
SkyReels-V4 的心脏是由两个对称的 Multimodal Diffusion Transformer (MMDiT) 分支组成的。
- 视频流与音频流:两个分支并行工作,分别处理视觉和听觉。
- 双向同步(Bidirectional Cross-Attention):为了解决“口型对齐”和“声画同步”的顽疾,模型在每一层都让音频特征去“询问”视频特征,反之亦然。
- 共享 MLLM 编码器:使用强大的多模态大模型作为编码器,这意味着你可以输入类似“穿着 @image_1 衣服的人在 @video_1 的背景下说 <dialogue>你好</dialogue>”这种复杂的混合指令。
图 1:SkyReels-V4 双流架构与多模态指令输入流程
破解效率魔咒:联合关键帧生成
直接生成 1080p 的长视频在计算上是灾难性的。SkyReels-V4 采用了一套聪明的“套娃”策略:
- 基础模型:同时预测一个“低分辨率的全序列”和若干个“高分辨率的关键帧”。
- Refiner 模块:利用超分辨率和帧内插(Frame Interpolation)技术,将上述两者融合,补全细节和运动轨迹。
- VSA(Video Sparse Attention):引入稀疏注意力机制,将注意力开销降低了 3 倍,使 15 秒长视频的生成变得触手可及。
统一修复逻辑:万物皆可 Inpainting
SkyReels-V4 最令人惊叹的设计是其通道拼接(Channel Concatenation)。它将不同的任务描述为特定的“遮罩(Mask)”配置:
- I2V(图生视频):遮住第一帧以外的所有帧。
- 视频编辑:遮住需要修改的局部区域。
- 视频扩展:遮住已有的前几秒内容。 这种“大一统”设计极大地简化了训练逻辑。
实验战绩:竞技场上的领跑者
在权威的 Artificial Analysis Arena 排行榜上,SkyReels V4 预览版以 1090 的 Elo 得分紧随 Kling 3.0 Pro 之后,超越了 Google 的 Veo 3.1 和 OpenAI 的 Sora 2(12月版)。
表 1:Artificial Analysis 视频竞技场排名(截至 2026 年 2 月)
人类评估(GSB 对比)显示,SkyReels-V4 在指令遵循(Prompt Following)和运动质量(Motion Quality)上拥有压倒性优势,尤其在处理复杂的多镜头描述时表现稳健。
图 4:SkyReels V4 在五大维度的绝对评分对比
总结与洞察
SkyReels-V4 的成功不仅在于它“大而全”,更在于它对效率与可控性的平衡。通过将极其复杂的编辑任务简化为 Inpainting,它为专业影视制作提供了一个极低门槛的工具。
局限性:尽管模型表现强劲,但在空间音频的精细定位和极端动态下的结构保持上仍有提升空间。
随着 Skywork AI 团队持续迭代,我们可以预见,未来的内容创作将真正实现“所写即所得,所画即所听”。
