Tuna-2:直击原始像素,告别视觉编码器的统一多模态新范式

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

2026-01-01
Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong
总结
问题
方法
结果
要点
摘要

本文提出了 Tuna-2,一种原生统一多模态模型(UMM),实现了在像素空间直接进行视觉理解与生成。该作彻底舍弃了预训练视觉编码器(如 CLIP 或 VAE),仅依靠 Patch Embedding 将原始像素转化为 Token,刷新了 7B 参数规模 UMM 在多项基准测试中的 SOTA 记录。

TL;DR

多模态AI领域长期存在一个“潜规则”:图像必须通过 CLIP 加密后再由大模型理解,或者通过 VAE 压缩后再生成。Tuna-2 彻底打破了这一框架。 它通过一个单体 Transformer 模型,直接在像素空间(Pixel-space)完成理解与生成任务。实验证明,这种“大道至简”的无编码器架构在处理精细感知任务时远超传统模型。

背景定位:从“模块化堆砌”到“原生单体”

在早期设计中,理解(Understanding)和生成(Generation)是两个互不相通的模块(如 LLaVA + Stable Diffusion)。后来的原生统一模型(UMM)虽然尝试共享参数,但依然高度依赖预训练的感知编码器(Vision Encoder)。Tuna-2 的出现标志着 UMM 进化到了第三阶段:完全移除外部编码器,直接以原生像素块(Patch Embedding)作为多模态的共同语言。


痛点深挖:预训练编码器的“偏见”

作者指出,现有的视觉编码器带来了两大弊端:

  1. 归纳偏置限制 (Inductive Bias):预训练编码器(如 CLIP)通常固定了输入分辨率,且在预训练时丢失了大量低级视觉细节(Low-level Details)。
  2. 表征失配 (Misalignment):使用 VAE 的潜空间进行生成,使用 CLIP 的语义空间进行理解,两者在端到端优化时难以达到完美的物理统一。

核心方法:Tuna-2 的设计哲学

1. 简化的无编码器架构

Tuna-2 将图像划分为 16x16 的 Patch,通过线性层直接映射为视觉 Token。该架构移除了 VAE 和 Representation Encoder,使得模型能够直接触达原始像素。

模型演变架构图 图1:从 Tuna(包含 VAE/Encoder)到 Tuna-2(纯 Patch Embedding)的架构简化过程。

2. 掩码视觉特征学习 (Masked Feature Learning)

由于像素空间维度极高且冗余,直接学习极易陷入局部最优。作者引入了类似于 MAE 的掩码策略:

  • 对于理解任务:遮掩部分 Patch 强迫模型根据残缺信息进行多模态推理。
  • 对于生成任务:在噪声预测中加入掩码,让模型通过周围上下文预测丢失的像素区域。

3. 像素空间流匹配 (Pixel-space Flow Matching)

模型采用了 Rectified Flow 技术。不同于在压缩特征上做扩散,Tuna-2 直接在 512x512 的像素矩阵上进行去噪,通过 -prediction 和 -loss 范式,实现了高保真度的图像合成。


实验战绩:精细感知的胜利

视觉理解:像素级细节的降维打击

在需要观察极小物体或精细计数(如 CountBench, V* Bench)的任务中,Tuna-2 显著超越了基于潜空间的模型。这证明了移除 VAE 的压缩步骤,保留了更多的“细粒度真相”。

实验结果对比 表1:Tuna-2 在各大多模态理解基准上的表现,尤其在 Pixel-centric(像素中心)任务上优势巨大。

视觉生成:高质量与多样性兼得

尽管是在高维像素空间生成,Tuna-2 的效果依然令人惊艳。使用 GPT-5.4 作为评估者(LLM-judge),Tuna-2 在图像多样性上不仅击败了前作,甚至与专用的图像生成模型 FLUX.1 表现相当。

生成效果展示 图2:Tuna-2 生成的高分辨率图像示例,展现了极强的文本对齐和细节质感。


深度洞察:Tuna-R 与 Tuna-2 的“赛跑”

论文中有一个极具启发性的实验:对比了带编码器的中间体 Tuna-R 和无编码器的 Tuna-2

  • 早期阶段:Tuna-R 凭借预训练编码器的“先天知识”跑得更快。
  • 规模化后:随着数据量的增加,Tuna-2 逐渐反超。这说明无编码器架构具有更强的扩展天花板,它能从海量数据中自发学到更精准的跨模态对齐。

总结与局限

Tuna-2 用实验事实宣告:预训练视觉编码器并非理解世界的“必要中介”。

虽然该模型在理解上达到了 SOTA,但在极其复杂的图像编辑任务中,相比带有视觉先验的编码器模型仍存在微小差距。 这暗示了虽然端到端学习天花板更高,但完全摆脱“外部知识”可能需要更庞大的预训练规模或更精巧的初始化策略。

未来的统一多模态模型,或许真的将是一个从像素到文本、再回到像素的纯粹 Transformer。

发现相似论文

试试这些示例

  • 查找最近其他尝试在原始像素空间(Pixel-space)实现统一多模态理解与生成的论文。
  • 哪篇论文最早探讨了 Masked Autoencoder (MAE) 与生成模型的结合,本文的掩码策略与其有何异同?
  • 目前有哪些最新的 SOTA 视觉生成模型已经从 Latent Diffusion 转向了 Pixel-space Flow Matching 架构?
目录
Tuna-2:直击原始像素,告别视觉编码器的统一多模态新范式
1. TL;DR
2. 背景定位:从“模块化堆砌”到“原生单体”
3. 痛点深挖:预训练编码器的“偏见”
4. 核心方法:Tuna-2 的设计哲学
4.1. 1. 简化的无编码器架构
4.2. 2. 掩码视觉特征学习 (Masked Feature Learning)
4.3. 3. 像素空间流匹配 (Pixel-space Flow Matching)
5. 实验战绩:精细感知的胜利
5.1. 视觉理解:像素级细节的降维打击
5.2. 视觉生成:高质量与多样性兼得
6. 深度洞察:Tuna-R 与 Tuna-2 的“赛跑”
7. 总结与局限