[CVPR 2025/2026] Tell2Adapt:利用视觉基础模型打破医疗图像 SFUDA 的通用化壁垒

Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model

总结
问题
方法
结果
要点
摘要

本文提出了 Tell2Adapt,这是一个统一的无源非监督领域自适应 (SFUDA) 框架,旨在解决医疗图像分割中多模态和多目标的跨领域迁移问题。该方法通过引入视觉基础模型 (VFM) 提供语义指导,在 10 个自适应方向和 22 个解剖目标上实现了 SOTA 性能。

TL;DR

在医疗 AI 部署中,无源非监督领域自适应 (Source Free Unsupervised Domain Adaptation, SFUDA) 是一项既重要又极具挑战的任务——它要求模型在不触碰原始训练数据(隐私保护)的情况下,自动适配全新的设备或模态。本文提出的 Tell2Adapt 框架,通过引入 BiomedParse 等视觉基础模型(VFM),并配合 LLM 驱动的提示词正则化(CAPR)和解剖先验细化(VPR),在 22 个临床目标上刷写了 SOTA 记录,彻底解决了过去 SFUDA 方案“一个模型只能管一个病种、一个模态”的局限性。

1. 痛点:被空间提示词“带偏”的自适应

传统的跨模态自适应(如从 CT 到 MRI)往往因为巨大的灰度值差异和解剖形变导致模型失效。最近的研究尝试引入视觉基础模型(如 SAM)来当“老师”带学生。

然而,作者敏锐地发现了一个 “失败级联” (Failure Cascade) 问题:现有的 VFM-SFUDA 方法通常用源模型(Source Model)的预测作为输入(即空间提示,Spatial Prompts)给 VFM。如果源模型在目标域表现稀碎,给出的提示词也是错的,VFM 生成的伪标签就会错得更离谱。

架构原理图对比 图 1:Tell2Adapt 架构概览。通过文本提示词解开 VFM 与源模型性能的耦合。

2. 核心机理:从“告诉他坐标”到“告诉他特征”

为了打破上述循环,Tell2Adapt 将重心转向了更稳定的 文本提示 (Text Prompts)

2.1 上下文感知提示正则化 (CAPR)

临床医生的输入往往是不规范的(例如“Liverr”、“Spleen CT”)。作者引入了 Qwen3-VL 等大语言模型作为语义净化器,将混乱的输入统一格式化为:[Target] in [Anatomical Site] [Modality]。 这种标准化操作确保了 VFM 的文本编码器能产生稳定的 Embedding,从而生成极其精准的伪标签。

2.2 视觉合理性细化 (VPR)

分割模型偶尔会在不可能长肿瘤的地方预测出脏点。VPR 引入了统计先验:它从 VFM 中提取了每个解剖结构的 Beta 分布模型(涵盖像素概率和 RGB 颜色分布)。 通过计算预测区域与先验分布的“解剖合理性分数” (),模型能物理性地剔除假阳性伪影。

3. 实验战绩:全线霸榜

Tell2Adapt 在包括腹部 (AMOS)、脑部 (BraTS)、心脏 (ACDC/CAMUS) 和息肉分割在内的 10 个自适应方向上进行了严苛测试。

3.1 跨模态奇迹

在最具挑战性的 心脏 MR 超声 (US) 转换中,这种跨越物理成像机制的偏移让所有竞争方法几乎全军覆没(Dice 接近 0%)。而 Tell2Adapt 凭借 VFM 的泛化知识,跑出了 94.6% (LV) 的惊人成绩。

实验结果对比 图 2:在多个器官上的可视化分割效果,展现了极高的边界吻合度。

3.2 瘦身成功的“专家”

虽然 VFM 很大(BiomedParse 约 372M 参数),但 Tell2Adapt 最终交付给医生的是经过蒸馏的轻量化 U-Net (31M 参数)。这意味着复杂的自适应知识被压缩到了一张普通的 RTX 4090 甚至更低端的显卡上即可流畅运行。

4. 深度洞察与总结

Takeaway: Tell2Adapt 证明了在医疗领域,VFM 的角色不应仅仅是“分割工具”,更应该是“知识库”。

  • 优点: 极强的通用性,不再依赖源模型的初步预测质量,大幅降低推理算力需求。
  • 局限性: 伪标签生成阶段的时间开销仍然存在(每例腹部数据约 3.47秒),虽然不影响推理,但在快速在线自适应场景下仍有优化空间。

总而言之,该框架为未来医疗 AI 的大规模、隐私合规化部署提供了一个可复制的标准范式。

发现相似论文

试试这些示例

  • 查找最近其他利用 Vision Foundation Models (如 SAM, BiomedParse) 解决医疗图像无源自适应 (SFUDA) 挑战的论文。
  • 哪篇论文最早提出了 BiomedParse 模型,本文在伪标签生成上是如何利用其文本编码器特性优于以往空间提示方法的?
  • 有哪些研究将自适应后的轻量化分割模型应用于实时临床手术导航或资源受限的边缘医疗设备中?
目录
[CVPR 2025/2026] Tell2Adapt:利用视觉基础模型打破医疗图像 SFUDA 的通用化壁垒
1. TL;DR
2. 1. 痛点:被空间提示词“带偏”的自适应
3. 2. 核心机理:从“告诉他坐标”到“告诉他特征”
3.1. 2.1 上下文感知提示正则化 (CAPR)
3.2. 2.2 视觉合理性细化 (VPR)
4. 3. 实验战绩:全线霸榜
4.1. 3.1 跨模态奇迹
4.2. 3.2 瘦身成功的“专家”
5. 4. 深度洞察与总结