[ICLR 2026] Self-Flow:告别外部编码器,自监督 Flow Matching 开启生成模型的新 Scaling 时代

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

总结
问题
方法
结果
要点
摘要

本文提出了 Self-Flow,一种自监督 Flow Matching 范式,通过 Dual-Timestep Scheduling 机制在生成模型内部集成表征学习。该方法在不依赖外部预训练模型的情况下,实现了在图像(ImageNet FID 5.70)、视频(FVD 47.81)及音频生成任务中的 SOTA 表现,并展现了极佳的多模态可扩展性。

TL;DR

传统的生成模型(如 Stable Diffusion, Flux)通常需要“外挂”一个 DINO 或 SigLIP 编码器来学习语义,但这就像给发动机加了一层限速器。本文提出的 Self-Flow 彻底摒弃了外部编码器,通过独特的 Dual-Timestep Scheduling 机制,让模型在学习“如何生成”的同时,自主学会“如何理解”。结果是惊人的:它在图像、视频、音频全模态上刷写了 SOTA,且模型规模越大,优势越明显。

背景定位:外部对齐的“天花板效应”

在目前的技术背景下,由于扩散模型(Diffusion)或流匹配模型(Flow Matching)的原始训练目标只是简单的“去噪”,模型往往倾向于关注局部像素而忽略全局语义。为了解决这个问题,学术界此前流行 Representation Alignment (REPA) —— 强迫生成模型的中间层去对齐外部预训练模型(如 DINOv2)的特征。

但是,作者发现了一个令人不安的现象: 使用更强的外部编码器(如 DINOv3-H)进行对齐,生成的图像质量(FID)反而会变差(见下图)。这种“不兼容”限制了模型的缩放潜力。

REPA Scaling 局限性

核心动机:为什么要通过信息不对称来学习?

作者的直觉(Insight)非常深刻:如果所有的 token 同时变模糊,模型只需要看周边的像素就能还原,不需要理解语义。 Self-Flow 的逻辑是: 如果我把一部分像素变得非常模糊(高噪声),而保留另一部分相对清晰(低噪声),那么模型为了还原那些极度模糊的部分,就必须利用那些清晰部分的“语义”进行推断。

方法论详解:Dual-Timestep Scheduling

这是本文最精妙的设计。它不像传统的 Masked Autoencoder (MAE) 直接把像素抹除,因为那样会造成 Train-Inference Gap(推理时没有 Mask,模型会无所适从)。

  1. 异构噪声:在同一次训练中,对一个 Batch 的 token 随机分配两个不同的时间步
  2. 信息不对称Student 看到的是混合噪声的版本,而 EMA Teacher 看到的是全量低噪声(较清晰)的版本。
  3. 自监督目标:Student 的优化目标不仅要预测噪声(常规 Flow Loss),还要预测 Teacher 在对应位置产生的特征表示(Alignment Loss)。

Self-Flow 架构图

实验与结果:全线碾压

1. 突破 ImageNet SOTA

在经典的 ImageNet 1K 任务上,Self-Flow 在没有外部标签或编码器的情况下,FID 达到了 5.70,首次在自监督设定下击败了显式使用外部 DINO 对齐的方法。

2. 多模态通用性

尤其在视频(Video)和音频(Audio)领域,外部编码器往往会起反作用。Self-Flow 在视频生成中展现了极强的时空一致性,FVD 达到了 47.81,大幅领先。

实验结果对比

3. 文字渲染能力的飞跃

值得一提的是,自监督学习带来的语义理解力直接体现在了极难的“文字渲染”上。如下图所示,Self-Flow 生成的排版准确度远高于传统的 Flow Matching。

文字渲染对比

深度洞察与总结

解析:为什么有效?

Self-Flow 成功的本质在于它解决了一个悖论:生成模型需要判别模型的特征,但判别模型的特征未必适合生成。 通过让模型“左手倒右手”(利用 EMA Teacher),模型自动筛选出了那些对生成任务最有帮助的语义表征,且这种表征会随着模型规模的扩大而自动增强。

局限性与未来

  • 计算开销:由于涉及两次 Forward(Student 和 Teacher),训练时间增加了约 30-50%,但考虑到收敛速度的加快,这个成本是可接受的。
  • 未来展望:这项技术为“世界模型”(World Models)提供了新的思路。在具身智能任务中,Self-Flow 展示了更强的复杂推理能力,未来可能成为视频-动作联合预测的标准范式。

资深主编评价:Self-Flow 是对“暴力对齐”路线的一次有力反思。它证明了 Generative 和 Discriminative 并不是对立的,而是可以通过精巧的噪声调度在同一个 Backbone 中完美融合。

发现相似论文

试试这些示例

  • 查找最近除了 REPA 之外,其他试图在 Transformer Generative Models 中集成自监督表征学习的论文。
  • 哪篇论文最早提出了在扩散模型中使用异构噪声(Heterogeneous Noise)的思想,本文的 Dual-Timestep 与其有何改进?
  • 有哪些研究探讨了将类似 Self-Flow 的自监督机制应用到具身智能(Embodied AI)中的世界模型(World Models)构建?
目录
[ICLR 2026] Self-Flow:告别外部编码器,自监督 Flow Matching 开启生成模型的新 Scaling 时代
1. TL;DR
2. 背景定位:外部对齐的“天花板效应”
3. 核心动机:为什么要通过信息不对称来学习?
4. 方法论详解:Dual-Timestep Scheduling
5. 实验与结果:全线碾压
5.1. 1. 突破 ImageNet SOTA
5.2. 2. 多模态通用性
5.3. 3. 文字渲染能力的飞跃
6. 深度洞察与总结
6.1. 解析:为什么有效?
6.2. 局限性与未来