[CVPR 2026] Wallaroo:大统一时代的极简主义,仅靠 Next-token Prediction 搞定理解、生成与编辑

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

总结
问题
方法
结果
要点
摘要

本文推出了 Wallaroo,一个基于纯 Next-token Prediction(次标记预测)的自回归基座模型。该模型通过解耦视觉编码路径并采用四阶段训练策略,成功在单一 Transformer 架构中统一了多模态理解、图像生成与图像编辑任务,并在多个 SOTA 评估中展现出极强的竞争力。

TL;DR

在多模态大模型(LMM)领域,如何优雅地统一“看”(理解)与“画”(生成)一直是华山论剑的焦点。Wallaroo 给出了一份极简且强力、颇具“暴力美学”色彩的答卷:无需复杂的 Diffusion 级联,直接基于 Qwen2.5 VL,通过纯粹的自回归次标记预测(Next-token Prediction),不仅实现了 SOTA 级别的理解与生成,还首次在该框架下深度集成了图像编辑功能。

1. 动机:为什么要“分家”又是为了更好的“合体”?

目前实现理解与生成统一的路径主要有三条:

  1. 理解模型做 Encoder:把 LMM 当作 Diffusion 的插件(如 OmniGen2),但这本质上是单向的。
  2. 混合结构:Transformer 里既搞 AR 又搞 Diffusion(如 Transfusion),结构复杂且噪声干扰严重。
  3. 纯自回归:万物皆 Token(如 Chameleon, Janus)。

Wallaroo 的洞察:作者认为纯自回归是最高效的,但难点在于视觉表征的冲突。理解需要丢弃细节保留语义,生成需要保留纹理细节。因此,Wallaroo 坚持“解耦视觉编码(Decoupling Visual Encoding)”的策略,为不同任务开辟专属通道。

2. 架构设计:极简原则下的精密重构

Wallaroo 基于 Qwen2.5 VL (7B) 打造,核心改进点在于“三路并举”:

  • 理解路径:复用原生的 NaViT 编码器,捕捉图像的高层语义。
  • 生成路径:引入 LlamaGen 的 VQ Tokenizer,将图像转化为离散 ID,通过专门的 MLP Adaptor 转化为 Token。
  • 编辑路径(创新点):这是 Wallaroo 的点睛之笔。它同时吸纳了来自 NaViT 的语义特征和来自 VQ 编码器的底层纹理特征,通过一个专门的 Edit Head 进行预测。

Wallaroo 架构图

3. 四阶段训练策略:能力的层级觉醒

模型能力的习得不是一蹴而就的,作者设计了严密的四个阶段:

  1. 初步生成对齐:只练生成 Adaptor,让模型知道什么是图像 Token。
  2. 联合预训练:理解与生成双管齐下,通过 12M 数据对齐空间。
  3. 多分辨率自适应:引入特有的 <hw_info> 参数和 <eol>(换行符)Token,让模型学会生成不同比例的画作。
  4. 统一微调:加入图像编辑数据,激活全能属性。

训练流程图

4. 实验战绩:不只是全能,更是高能

4.1 理解能力:不忘初心

在多模态理解基准测试中,Wallaroo 几乎完美保留了 Qwen2.5 VL 的感知力。在 MMBench (MMB) 上达到了 83.0,超越了 Janus-Pro 和 OmniGen2。

4.2 编辑与生成:不仅会画,还会改

在 GenEval 榜单上,Wallaroo 的生成质量处于自回归模型的第一梯队。更令人惊喜的是在 ImgEdit 榜单上,作为一个通用模型,它的编辑得分(2.92)竟然击败了许多专门为编辑任务设计的模型(如 UltraEdit)。

实验结果对比

5. 深度洞察:来自作者的“避坑指南”

作者在讨论环节分享了几个非常有价值的发现:

  • 位置编码(Positional Encoding)的魔力:在编辑任务中,1-D 位编有助于保持图像一致性,而 2-D 位编则更有利于理解。
  • Token 顺序极其敏感:在输入时,如果先放高层语义特征再放底层纹理特征,编辑效果会变差;反之则大幅提升。
  • 掩码(Mask)策略:在训练编辑时,随机遮盖 60% 的内容是防范模型“偷懒”直接复制粘贴的最优解。

6. 总结与反思

Wallaroo 证明了通过合理的路径解耦和分阶段训练,纯自回归模型完全可以成为多模态任务的终极解决方案

局限性:目前 Wallaroo 仍需手动切换不同的预测 Head(理解/生成/编辑),这在一定程度上限制了交互的自然度。未来的方向将是如何让模型根据上下文自动、动态地选择输出模式。

如果你追求架构的纯洁性,又希望拥有全能的多模态能力,基于 Qwen2.5 VL 的 Wallaroo 绝对是目前最值得跟进的 Baseline 之一。

发现相似论文

试试这些示例

  • 查找最近其他试图通过解耦视觉编码(Decoupling Visual Encoding)来解决自回归模型中理解与生成冲突的论文。
  • Janus 和 Janus-Pro 论文是如何定义理解与生成 Head 的,Wallaroo 在其基础上做了哪些具体的 Head 架构改进?
  • 有哪些研究探讨了在自回归多模态模型中,Token 序列顺序(如图像特征先于文本还是后于文本)对图像编辑任务性能的影响?
目录
[CVPR 2026] Wallaroo:大统一时代的极简主义,仅靠 Next-token Prediction 搞定理解、生成与编辑
1. TL;DR
2. 1. 动机:为什么要“分家”又是为了更好的“合体”?
3. 2. 架构设计:极简原则下的精密重构
4. 3. 四阶段训练策略:能力的层级觉醒
5. 4. 实验战绩:不只是全能,更是高能
5.1. 4.1 理解能力:不忘初心
5.2. 4.2 编辑与生成:不仅会画,还会改
6. 5. 深度洞察:来自作者的“避坑指南”
7. 6. 总结与反思