Any2Any:开启遥感图像“全模态”翻译的新纪元

Any2Any: Unified Arbitrary Modality Translation for Remote Sensing

总结
问题
方法
结果
要点
摘要

本文提出了 Any2Any,一个用于遥感图像多模态转换的统一生成框架。利用共享的潜空间(Latent Space)和扩散 Transformer(DiT),该模型首次实现了任意模态间(如 SAR, RGB, NIR, PAN, MS)的 O(1) 复杂度转换,并在 14 项任务中达到 SOTA。

TL;DR

遥感领域模态众多(RGB、雷达 SAR、红外 NIR 等),以往为了让 SAR 变 RGB,我们需要训练一个专用模型;让 NIR 变 RGB,又要再练一个。以此类推,N 种模态就要练 个。Any2Any 推翻了这种低效范式,通过一个统一的潜空间扩散框架,仅用一个模型就实现了任意模态间的转换,效率提升的同时还具备了惊人的“零样本(Zero-shot)”转换能力。

1. 痛点:被割裂的“多模态”

在现代地球观测中,我们有光学相机的 RGB,也有能穿透云层的雷达 SAR。但在实际中,数据往往是残缺的。现有的转换方法(如 Pix2Pix, BBDM)面临两大软肋:

  • 组合爆炸:支持 种模态转换需要 的工程量,随着传感器增加,维护成本无法承受。
  • 数据孤岛:不同模态的分辨率(GSD)、采样几何完全不同,导致学到的特征无法跨任务复用,泛化性极差。

2. RST-1M:遥感领域的“百科全书”

要让模型学会“见多识广”,首先需要海量数据。作者构建了 RST-1M,这是首个百万量级的多模态遥感对齐数据集:

  • 五大模态:RGB, SAR, NIR, MS (多光谱), PAN (全色)。
  • 120 万对图像:覆盖了全球各种地形,通过 RGB 模态作为中介(Pivot),建立了一个可以互相推导的语义闭环。

数据集统计与示例

3. Any2Any 架构:解耦物理与语义

Any2Any 的核心理念是:不同的传感器只是同一地理场景的不同观测表现。 其架构包含三个关键组件:

3.1 模态专用 VAE 与潜空间对齐

为了处理异构的物理输入(如 512x512 的全色图和 128x128 的多光谱图),Any2Any 为每种模态训练了独立的 VAE 编码器。这些编码器将原始像素映射到一个统一维度 (4, 64, 64) 的潜空间 。这相当于给不同语言配备了专职翻译,先调频到同一个“频道”。

3.2 共享 DiT 与直接回归

在对齐后的潜空间中,作者使用 Diffusion Transformer (DiT) 作为共享主干网。与传统预测噪声的扩散模型不同,Any2Any 采用 -prediction 策略:直接学习从带噪状态恢复到目标模态潜空间锚点的映射。

  • 动机:跨模态变换通常伴随巨大的结构跳变(如 SAR 图像的高噪点到 RGB 的平滑纹理),直接回归锚点有助于保持地理结构的稳定性。

Any2Any 框架总览

3.3 残差适配器(Residual Adapter)

由于每个 VAE 是独立训练的,潜流形之间可能存在微小的系统性偏移。作者在后端引入了极轻量级(参数量 <0.01M)的适配器。它像是一个“校准镜”,在不增加推理成本的前提下,修正不同模态间的流形偏差。

4. 实验成果:从 SOTA 到 Zero-shot

在中 14 项转换任务(如 SAR RGB, NIR MS 等)中,Any2Any 表现出了压倒性的优势:

  • 性能制霸:在 PSNR 指标上全面超越了 ControlNet 和 BBDM 等主流模型。
  • 更低复杂度:以往需要 14 个模型才能跑完的测试,Any2Any 一个模型拎包即用。

14项翻译任务性能对比

零样本(Zero-shot)的惊喜

最令人惊叹的是,模型展现出了强大的“涌现”能力。比如在训练集中从未见过 SAR PAN 的配对数据,但得益于统一潜空间的语义传递,Any2Any 依然能生成结果,且效果远超前人。

5. 局限与未来

尽管 Any2Any 效果拔群,但它对大量对齐数据的依赖依然存在(尤其是在建立锚点阶段)。未来,如果能引入大规模非对齐数据的自监督学习,模型的能力上限可能会进一步被推高。

总结:Any2Any 不仅仅是一个模型,它为遥感领域提供了一个“通用翻译官”的范式,是将基础模型(Foundation Models)引入遥感大数据处理的关键一步。

发现相似论文

试试这些示例

  • 查找最近一年内其他试图实现遥感多模态大一统(Unified Multi-modal RS)或全能模型(Generalist Model)的论文。
  • 哪篇论文最早在扩散模型中提出 x0-prediction(直接回归原始潜空间)策略,Any2Any 对此有何改进?
  • 除了残差适配器(Residual Adapter),还有哪些最新的轻量级微调技术(如 LoRA 或 Prompt Tuning)被应用旨在解决生成模型中的流形偏移问题?
目录
Any2Any:开启遥感图像“全模态”翻译的新纪元
1. TL;DR
2. 1. 痛点:被割裂的“多模态”
3. 2. RST-1M:遥感领域的“百科全书”
4. 3. Any2Any 架构:解耦物理与语义
4.1. 3.1 模态专用 VAE 与潜空间对齐
4.2. 3.2 共享 DiT 与直接回归
4.3. 3.3 残差适配器(Residual Adapter)
5. 4. 实验成果:从 SOTA 到 Zero-shot
5.1. 零样本(Zero-shot)的惊喜
6. 5. 局限与未来