[Nature Communications 2025候选] CheXficient:告别暴力缩放,20% 数据打败全量训练的胸部 X 光基础模型
A data- and compute-efficient chest X-ray foundation model beyond aggressive scaling
本文推出了 CheXficient,一个通过主动、原则性数据筛选(Data Curation)构建的胸部 X 光(CXR)基础模型。该模型仅使用 22.7% 的预训练数据(约 280K 对图像-报告)和不到 27.3% 的计算预算,就在 20 个基准测试中达到了与全量数据训练相当甚至更好的 SOTA 性能。
TL;DR
在 AI 领域,"Scale is All You Need" 似乎已成信条,但在医学领域,获取高质量标注数据和昂贵的算力是难以逾越的鸿沟。斯坦福大学团队提出的 CheXficient 给了我们一个惊喜:通过一种原型驱动的动态筛选机制,仅用 22.7% 的数据和 27.3% 的算力,就能在 20 个核心临床任务(分类、检索、分割、报告生成)上硬刚甚至超越全量训练的模型。
背景定位:从“暴力扩张”到“精耕细作”
目前的医学基础模型(如 RadFM, MedGemma)动辄使用数千万对图像-文本对进行训练。然而,医学影像数据集(如 CXR)具有极强的长尾效应:
- 高度冗余:大部分影像表现为“无发现”或常见病,模型在这些重复信息上浪费了大量算力。
- 类别失衡:罕见但临床价值极高的病例被淹没在海量“正常”样本中,导致模型判诊能力出现偏差。
CheXficient 的核心直觉是:既然样本贡献度不同,为什么要“雨露均沾”?
核心机制:原型驱动的多模态筛选 (Methodology)
CheXficient 在预训练过程中嵌入了一个“在线筛选器”。其工作流程极具工业直觉:
- 多模态嵌入 (Unified Manifold):将 DINOv2 提取的图像特征与 BioClinicalBERT 提取的文本特征拼接,形成跨模态的统一表征。
- 动态原型 (Evolving Prototypes):在特征空间中维护 K 个中心点(Prototypes),这些点代表了数据集的高维语义分布。
- 硬样本优先 (Informativeness Prioritization):
- 计算样本到最近原型的距离。
- 距离远:意味着这是数据流形边缘的罕见、复杂样本(如罕见病),全量保留。
- 距离近:意味着它是高度冗余的普通样本,通过“最远点采样 (FPS)”进行剧烈降采样,只保留多样性。

实验战绩 (Results)
作者在 20 个 Benchmarks 上进行了全方位评估,结果令人震撼:
1. 效率:降本增效的极致
在达到相同性能的情况下,CheXficient 相比全量训练(CheXfull)节省了约 160 个 H100 GPU 小时。这种效率提升对于资源受限的学术研究机构具有极大的普适价值。
2. 长尾疾病的“神来之笔”
实验显示,CheXficient 筛选出的子集系统性地增加了罕见病的比例。在 VinDr-CXR 数据集的 28 种发现中,CheXficient 在 16 种疾病上的 Zero-shot AUROC 超过了全量训练模型。

3. 下游任务的迁移效率
在标注受限(Label-efficient)的场景下,CheXficient 表现尤为突出。无论是疾病分类还是像素级的语义分割,它仅需 10% 的下游标注数据,就能达到其他模型 100% 标注的效果。
深度洞察:为什么它有效?
从物理直觉上看,CheXficient 实际上是在压缩数据流形的密度,同时保留其拓扑结构。
- 它将那些聚集在流形中心的、能够通过少数样本就学会的“共性知识”进行了压缩。
- 它将算力集中在了流形边缘的、需要更多样本才能定义的“个性知识”。
这也解释了为什么它在应对罕见病(如肋骨骨折、肺钙化)时表现更好——因为在筛选后的子集中,这些疾病不再是“噪声”,而是特征鲜明的“关键点”。
总结与未来展望
CheXficient 的成功标志着基础模型的研究正从“模型中心”向“数据驱动的精细化筛选”转型。
局限性:
- 目前仍主要针对 2D 影像,对于 3D 容积数据(CT/MRI)的流形分布可能更为复杂。
- 极端罕见病(比例 <0.1%)仅靠筛选仍难以根治,可能需要结合主动数据采集(Targeted Acquisition)。
启示: 对于开发者而言,如果你正苦于算力不足,不要急着去租更多的显卡,先看看你的数据集里,是不是 80% 的样本都在教模型认识“正常肺部”。
本文基于 arXiv 论文构建,作者团队来自斯坦福医学影像 AI 中心 (AIMI)。
