[arXiv 2026] UniCom:通过压缩连续语义,打破视觉理解与生成的“表现壁垒”

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

总结
问题
方法
结果
要点
摘要

本文提出了 UniCom,这是一个通过压缩连续语义表示(Compressed Continuous Semantic Representations)实现视觉理解与生成统一的多模态大模型框架。该方法通过 Attention-based 语义压缩器将高维视觉特征在通道维度进行压缩,成功在不依赖 VAE 的情况下实现了 SOTA 级别的图像生成与高精度图像编辑性能。

TL;DR

长期以来,AI 领域在视觉任务上一直存在“理解”与“生成”的表现割裂。理解模型(如 SigLIP)擅长抓取高层语义,但其特征空间过于庞杂,让生成模型难以驾驭;生成模型则极度依赖 VAE 等重构空间。UniCom 提出了一种极为直觉的方案:通过 Attention-based 语义压缩器,在通道维度对高维视觉特征进行 18 倍压缩,构建了一个既能“读得懂”又能“写得精”的统一连续语义空间。

痛点深挖:离散太“粗”,连续太“乱”

目前的统一模型通常走两条路:

  1. 离散化路径:将图像变成像文字一样的离散 Token。这虽然方便了 Transformer 像做完形填空一样生成图像,但会导致严重的细节丢失(如文字模糊、纹理失真)。
  2. 纯连续路径:直接预测 CLIP/SigLIP 的高维 Embedding。然而,这种高维流形(Manifold)极度不平滑,训练时模型就像在复杂的迷宫中寻找出口,收敛极慢且 FID 指标惨不忍睹。

重建结果对比

核心方法论:从通道维度寻找“信息瓶颈”

UniCom 的核心 Insight 在于对 压缩策略 的重新思考。作者发现:空间维度的下采样(Sequence Reduction)会由于信息混叠导致无法恢复的模糊,而通道维度的压缩(Channel Compression)则是近乎无损的。

1. 语义压缩器 (Semantic Compressor)

UniCom 没有简单的使用 MLP,而是设计了一个轻量级的 多头注意力(MHA)映射器

  • 为什么要用 Attention? MLP 独立处理每个 Token,而 MHA 能够利用空间上下文(Context-aware),确保即使维度压缩了,Token 之间的结构化布局信息依然被锁定。

2. Transfusion 预测路径

模型放弃了复杂的 Query-based 设计,采用了 Transfusion 架构。将文本 Token 与连续图像 Latent 拼成一个超长序列,通过全局注意力掩码(Modality-aware mask)进行处理:

  • 文本看齐:因果掩码(Causal Mask)。
  • 图像生成:双向注意力(Bidirectional Attention),让每个像素点都能看到全局信息。

模型架构图

实验与结果:不仅能画画,编辑更专业

UniCom 在多个 Benchmark 上证明了其作为“全才”的能力:

  • 生成保真度:通过 的压缩,收敛速度比原始维度提升了 5倍,且重建效果可媲美专门的 FLUX VAE。
  • 图像编辑:这是 UniCom 的高光时刻。在不借助任何 VAE 原图特征的情况下,仅凭语义特征就实现了极强的文字修改、物体替换和风格重组能力。
  • 复杂推理:结合 Chain-of-Thought (CoT),UniCom 甚至能像人类一样思考:“我应该先把猫变大,再把光线调暗”,从而生成更符合逻辑的图像。

实验结果对比

深度洞察:为什么 UniCom 值得关注?

UniCom 的成功揭示了一个深刻的趋势:未来的视觉大模型可能不再需要独立的 Image Tokenizer。 通过在语义丰富的预训练特征(如 SigLIP2)之上构建一个低维、平滑的连续空间,我们可以直接打通 LLM 的理解能力与 Diffusion 的生成潜力。这不仅降低了跨模态对齐的难度,更为“实时多模态交互”和“高精度图像编辑”提供了最高效的架构支撑。

局限与未来

尽管 UniCom 表现亮眼,但极细微细节的端到端重构(如超长距离的文字排版)仍存在上升空间。未来,进一步优化压缩模块并将其扩展至视频生成领域,将是该技术路线极其值得期待的发展方向。


致敬所有在连续流形上探索图像生成可能性的研究者。

发现相似论文

试试这些示例

  • 查找最近其他探讨在 Transformer 中直接预测连续视觉表示(Continuous Visual Representations)而非离散 Token 的多模态论文。
  • Transfusion 架构(Unified Flow Matching)最早在哪篇论文中提出,与其后续改进方法如 UniCom 的联系是什么?
  • 探索在大规模多模态模型中应用注意力机制进行特征压缩(Attention-based Compression)以提升长上下文处理能力的相关研究。
目录
[arXiv 2026] UniCom:通过压缩连续语义,打破视觉理解与生成的“表现壁垒”
1. TL;DR
2. 痛点深挖:离散太“粗”,连续太“乱”
3. 核心方法论:从通道维度寻找“信息瓶颈”
3.1. 1. 语义压缩器 (Semantic Compressor)
3.2. 2. Transfusion 预测路径
4. 实验与结果:不仅能画画,编辑更专业
5. 深度洞察:为什么 UniCom 值得关注?
6. 局限与未来