变化所在:补全不再关乎像素,而关乎意义
早期的视频模型将补全视为一种底层任务:填补缺失的像素、图像块或帧。而近期在这些论文中可见的转变是,补全如今已在语义层面运作——填补缺失的意义,而不仅仅是缺失的数据。Video-As-Prompt将视频生成重新定义为上下文补全:参考视频充当语义提示,模型通过检索并应用该参考中的上下文来完成输出[1]。MASCOT则更进一步,显式地掩蔽视频区域,然后通过将掩蔽内容与未掩蔽的视觉区域及对应文本对齐,来恢复语义信息[3]。这是一种根本性的变化:目标不再是重建原本存在的内容,而是根据上下文推断应该存在的内容。
实际结果是,以这种方式训练的模型在理解跨模态关系方面表现更佳。例如,MASCOT通过强制模型在补丁级别恢复与文本相关的细节,在四个文本-视频检索基准(MSR-VTT、LSMDC、ActivityNet、DiDeMo)上达到了最先进的性能[3]。这意味着模型不仅仅是在学习填补像素——它还在学习将视觉细节与语言联系起来,而这正是检索和生成任务所需要的。
一个模型能否处理所有语义条件?证据表明可以,但有个前提
一个重大的开放问题是,单个模型能否在无需针对每种语义条件重新训练的情况下,控制多种不同条件下的视频生成。Video-As-Prompt直接应对了这一挑战:它使用冻结的视频扩散Transformer(基础生成模型),并添加即插即用的专家模块,从而避免了因针对新条件进行微调而导致的灾难性遗忘[1]。在测试中,它达到了38.7%的用户偏好率,与针对特定条件的领先商业模型相当——这意味着尽管它是一个统一的单一模型,仍具备竞争力[1]。这表明统一控制是可行的,但关键在于它需要庞大的训练数据集:作者构建了VAP-Data,这是用于语义控制视频生成的最大数据集,包含超过10万个配对视频,覆盖100种语义条件[1]。因此,研究问题变成了:我们如何将这种方法扩展到更多条件,以及能否降低数据需求?
与旧方法相比,差异十分显著:以往的方法要么使用来自结构控制的逐像素先验(这会产生伪影),要么需要针对特定条件进行微调(这无法泛化)[1]。Video-As-Prompt通过将参考视频作为提示来规避这两者,这是一种更灵活、更通用的语义指定方式。接下来的自然问题是,这一范式能否扩展到其他模态——如音频或文本——以及即插即用的专家模块能否被替换或组合,以实现多条件控制。
如何在没有昂贵标注的情况下训练语义补全?
另一个自然的研究方向是减少标注负担。语义补全网络(SCN)针对视频时刻检索——即在视频中查找与文本查询匹配的片段——这一问题,仅使用视频级标签(例如“该视频包含一只狗”)进行训练,而无需帧级时间边界(例如“狗从0分12秒到0分35秒出现”)[2]。SCN利用提案生成模块创建候选时刻,随后通过语义补全模块衡量每个提案与查询的匹配程度,并提供反馈以优化评分[2]。这构成了一种语义补全形式:模型借助粗粒度标签和查询,补全缺失的时间对齐关系。该方法在两个基准数据集(ActivityCaptions和Charades-STA)上均有效,表明弱监督是可行的[2]。
悬而未决的问题是:这条路能走多远?我们能否也用弱标签来训练视频生成模型?Video-As-Prompt仍然需要成对的视频(一个参考视频和一个目标视频),收集成本高昂。如果我们能仅凭粗略的语义标签——比如“一个人在走路”——来训练,数据瓶颈将大幅缩小。SCN的成功表明,基于补全的学习能从弱监督中提取丰富的信号,但眼下还为时过早:该方法是在检索任务上验证的,而非生成任务,且基准数据集规模相对较小。下一步是将类似的弱监督思路应用到生成任务中,或许可以用文本或音频作为弱语义提示。
最大的开放性问题:语义补全能否统一生成与理解?
在这些论文中,一个清晰的共识逐渐浮现:语义补全对于生成和理解而言,都是一种强大的学习信号。Video-As-Prompt利用补全进行生成(产出新视频),而MASCOT和SCN则将其用于理解(检索和时刻搜索)。但它们本质上在做同一件事:利用上下文填补缺失的语义信息。这指向一个引人遐想的研究方向:能否训练一个单一模型同时胜任这两项任务?如果一个模型能通过补全语义来生成,它理应也能通过补全语义来进行检索——反之亦然。MASCOT通过恢复被掩蔽的内容实现检索的成功[3],与Video-As-Prompt借助参考视频实现生成的成功[1],恰似同一枚硬币的两面。
然而,这些论文并未直接验证这一统一性。Video-As-Prompt纯粹是生成式的,MASCOT纯粹是检索式的,而SCN则纯粹是时刻搜索。因此,相关证据只是提示性的,而非结论性的。下一个研究问题是,能否设计一个共享的语义补全目标,使这两类任务都能受益,以及Video-As-Prompt的即插即用架构能否加以改造,以同时处理理解类任务。这三篇论文都在基于补全的方法上取得了强劲成果——MASCOT在四个基准上达到最先进水平[3],SCN在两个基准上表现有效[2],VAP在用户偏好上具有竞争力[1]——这使得这一方向前景可观,但仍有待攻克。
关于这些来源
这个回答基于3项研究(1项经同行评审,2项为预印本),发表于2022年至2025年间,其中1项为2024年或之后发表。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的50篇文献。
本文引用的文献
视频即提示:视频生成的统一语义控制
视频即提示(Video-As-Prompt)提出了一种统一的语义控制范式,以参考视频作为提示进行视频生成,实现了38.7%的用户偏好率,可与针对特定条件的商业模型相媲美,并发布了VAP-Data——目前规模最大的语义控制视频生成数据集,涵盖100余种语义条件下的超过10万对视频。
基于语义补全网络的弱监督视频时刻检索
语义补全网络仅利用视频级标注即可实现弱监督视频时刻检索,其包含提案生成模块和语义补全模块,后者用于衡量查询与提案之间的相似度,并在ActivityCaptions和Charades-STA数据集上验证了有效性。
掩码重建:面向视频-文本检索的协同语义补全
MASCOT采用基于语义的掩码建模,结合基于注意力的视频掩码和语义感知补全,通过与未掩码的视觉区域及文本对齐来恢复被掩码的内容,在四个文本-视频检索基准(MSR-VTT、LSMDC、ActivityNet、DiDeMo)上取得了最先进的性能。
