[arXiv 2026] UniCom:通过压缩连续语义,打破视觉理解与生成的“表现壁垒”
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
本文提出了 UniCom,这是一个通过压缩连续语义表示(Compressed Continuous Semantic Representations)实现视觉理解与生成统一的多模态大模型框架。该方法通过 Attention-based 语义压缩器将高维视觉特征在通道维度进行压缩,成功在不依赖 VAE 的情况下实现了 SOTA 级别的图像生成与高精度图像编辑性能。
TL;DR
长期以来,AI 领域在视觉任务上一直存在“理解”与“生成”的表现割裂。理解模型(如 SigLIP)擅长抓取高层语义,但其特征空间过于庞杂,让生成模型难以驾驭;生成模型则极度依赖 VAE 等重构空间。UniCom 提出了一种极为直觉的方案:通过 Attention-based 语义压缩器,在通道维度对高维视觉特征进行 18 倍压缩,构建了一个既能“读得懂”又能“写得精”的统一连续语义空间。
痛点深挖:离散太“粗”,连续太“乱”
目前的统一模型通常走两条路:
- 离散化路径:将图像变成像文字一样的离散 Token。这虽然方便了 Transformer 像做完形填空一样生成图像,但会导致严重的细节丢失(如文字模糊、纹理失真)。
- 纯连续路径:直接预测 CLIP/SigLIP 的高维 Embedding。然而,这种高维流形(Manifold)极度不平滑,训练时模型就像在复杂的迷宫中寻找出口,收敛极慢且 FID 指标惨不忍睹。

核心方法论:从通道维度寻找“信息瓶颈”
UniCom 的核心 Insight 在于对 压缩策略 的重新思考。作者发现:空间维度的下采样(Sequence Reduction)会由于信息混叠导致无法恢复的模糊,而通道维度的压缩(Channel Compression)则是近乎无损的。
1. 语义压缩器 (Semantic Compressor)
UniCom 没有简单的使用 MLP,而是设计了一个轻量级的 多头注意力(MHA)映射器。
- 为什么要用 Attention? MLP 独立处理每个 Token,而 MHA 能够利用空间上下文(Context-aware),确保即使维度压缩了,Token 之间的结构化布局信息依然被锁定。
2. Transfusion 预测路径
模型放弃了复杂的 Query-based 设计,采用了 Transfusion 架构。将文本 Token 与连续图像 Latent 拼成一个超长序列,通过全局注意力掩码(Modality-aware mask)进行处理:
- 文本看齐:因果掩码(Causal Mask)。
- 图像生成:双向注意力(Bidirectional Attention),让每个像素点都能看到全局信息。

实验与结果:不仅能画画,编辑更专业
UniCom 在多个 Benchmark 上证明了其作为“全才”的能力:
- 生成保真度:通过 的压缩,收敛速度比原始维度提升了 5倍,且重建效果可媲美专门的 FLUX VAE。
- 图像编辑:这是 UniCom 的高光时刻。在不借助任何 VAE 原图特征的情况下,仅凭语义特征就实现了极强的文字修改、物体替换和风格重组能力。
- 复杂推理:结合 Chain-of-Thought (CoT),UniCom 甚至能像人类一样思考:“我应该先把猫变大,再把光线调暗”,从而生成更符合逻辑的图像。

深度洞察:为什么 UniCom 值得关注?
UniCom 的成功揭示了一个深刻的趋势:未来的视觉大模型可能不再需要独立的 Image Tokenizer。 通过在语义丰富的预训练特征(如 SigLIP2)之上构建一个低维、平滑的连续空间,我们可以直接打通 LLM 的理解能力与 Diffusion 的生成潜力。这不仅降低了跨模态对齐的难度,更为“实时多模态交互”和“高精度图像编辑”提供了最高效的架构支撑。
局限与未来
尽管 UniCom 表现亮眼,但极细微细节的端到端重构(如超长距离的文字排版)仍存在上升空间。未来,进一步优化压缩模块并将其扩展至视频生成领域,将是该技术路线极其值得期待的发展方向。
致敬所有在连续流形上探索图像生成可能性的研究者。
