[CVPR 2025/2026] Tell2Adapt:利用视觉基础模型打破医疗图像 SFUDA 的通用化壁垒
Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model
本文提出了 Tell2Adapt,这是一个统一的无源非监督领域自适应 (SFUDA) 框架,旨在解决医疗图像分割中多模态和多目标的跨领域迁移问题。该方法通过引入视觉基础模型 (VFM) 提供语义指导,在 10 个自适应方向和 22 个解剖目标上实现了 SOTA 性能。
TL;DR
在医疗 AI 部署中,无源非监督领域自适应 (Source Free Unsupervised Domain Adaptation, SFUDA) 是一项既重要又极具挑战的任务——它要求模型在不触碰原始训练数据(隐私保护)的情况下,自动适配全新的设备或模态。本文提出的 Tell2Adapt 框架,通过引入 BiomedParse 等视觉基础模型(VFM),并配合 LLM 驱动的提示词正则化(CAPR)和解剖先验细化(VPR),在 22 个临床目标上刷写了 SOTA 记录,彻底解决了过去 SFUDA 方案“一个模型只能管一个病种、一个模态”的局限性。
1. 痛点:被空间提示词“带偏”的自适应
传统的跨模态自适应(如从 CT 到 MRI)往往因为巨大的灰度值差异和解剖形变导致模型失效。最近的研究尝试引入视觉基础模型(如 SAM)来当“老师”带学生。
然而,作者敏锐地发现了一个 “失败级联” (Failure Cascade) 问题:现有的 VFM-SFUDA 方法通常用源模型(Source Model)的预测作为输入(即空间提示,Spatial Prompts)给 VFM。如果源模型在目标域表现稀碎,给出的提示词也是错的,VFM 生成的伪标签就会错得更离谱。
图 1:Tell2Adapt 架构概览。通过文本提示词解开 VFM 与源模型性能的耦合。
2. 核心机理:从“告诉他坐标”到“告诉他特征”
为了打破上述循环,Tell2Adapt 将重心转向了更稳定的 文本提示 (Text Prompts)。
2.1 上下文感知提示正则化 (CAPR)
临床医生的输入往往是不规范的(例如“Liverr”、“Spleen CT”)。作者引入了 Qwen3-VL 等大语言模型作为语义净化器,将混乱的输入统一格式化为:[Target] in [Anatomical Site] [Modality]。
这种标准化操作确保了 VFM 的文本编码器能产生稳定的 Embedding,从而生成极其精准的伪标签。
2.2 视觉合理性细化 (VPR)
分割模型偶尔会在不可能长肿瘤的地方预测出脏点。VPR 引入了统计先验:它从 VFM 中提取了每个解剖结构的 Beta 分布模型(涵盖像素概率和 RGB 颜色分布)。 通过计算预测区域与先验分布的“解剖合理性分数” (),模型能物理性地剔除假阳性伪影。
3. 实验战绩:全线霸榜
Tell2Adapt 在包括腹部 (AMOS)、脑部 (BraTS)、心脏 (ACDC/CAMUS) 和息肉分割在内的 10 个自适应方向上进行了严苛测试。
3.1 跨模态奇迹
在最具挑战性的 心脏 MR 超声 (US) 转换中,这种跨越物理成像机制的偏移让所有竞争方法几乎全军覆没(Dice 接近 0%)。而 Tell2Adapt 凭借 VFM 的泛化知识,跑出了 94.6% (LV) 的惊人成绩。
图 2:在多个器官上的可视化分割效果,展现了极高的边界吻合度。
3.2 瘦身成功的“专家”
虽然 VFM 很大(BiomedParse 约 372M 参数),但 Tell2Adapt 最终交付给医生的是经过蒸馏的轻量化 U-Net (31M 参数)。这意味着复杂的自适应知识被压缩到了一张普通的 RTX 4090 甚至更低端的显卡上即可流畅运行。
4. 深度洞察与总结
Takeaway: Tell2Adapt 证明了在医疗领域,VFM 的角色不应仅仅是“分割工具”,更应该是“知识库”。
- 优点: 极强的通用性,不再依赖源模型的初步预测质量,大幅降低推理算力需求。
- 局限性: 伪标签生成阶段的时间开销仍然存在(每例腹部数据约 3.47秒),虽然不影响推理,但在快速在线自适应场景下仍有优化空间。
总而言之,该框架为未来医疗 AI 的大规模、隐私合规化部署提供了一个可复制的标准范式。
