[CVPR 2026] OralGPT-Plus:模拟牙医思维,通过强化学习学会使用诊断工具
OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis
本文推出了 OralGPT-Plus,这是一个专为全景牙科 X 光片分析设计的智能体视觉语言模型(Agentic VLM)。通过引入交互式诊断推理循环和对称性感知工具,该模型在 MMOral-X 等多个牙科诊断基准测试中达到了 SOTA 水平。
TL;DR
在牙科影像诊断中,医生往往需要“放大细看”或者“对比对侧”来确认病灶。传统的 AI 模型大多只能“看一眼给结论”。OralGPT-Plus 通过引入 Agentic Reasoning(智能体推理) 范式,让模型学会了使用 Zoom-In 和独特的 Mirror-In 对称对比工具,结合重检驱动的强化学习,在全景 X 光片分析中展现了超越现有商业模型(如 GPT-5)的临床诊断能力。
1. 痛点:静态模型的“临床局限性”
在处理全景牙科 X 光片(Panoramic Radiographs)时,医生面临的是极高分辨率的图像。临床上,为了识别极细微的龋齿或根尖周炎,牙医的操作习惯通常包括:
- 局部放大:观察可疑区域。
- 双侧对比:利用牙齿的天然对称性,对比对侧健康的对应部位来排除伪影干扰。
现有的视觉语言模型(VLM)通常采用 Single-pass(单次预测)模式。这种“一锤子买卖”的方式无法处理长程推理,在遇到视觉模糊的区域时极易产生幻觉(Hallucination)。
图 1:从传统检测器到单次 VLM,再到 OralGPT-Plus 的智能体范式飞跃
2. 核心贡献:Dental-Aware Tool Design
OralGPT-Plus 不再只是一个输出文本的分类器,而是一个可以在图像空间“行进”的智能体。
核心工具:Mirror-In
作者发现,单纯的 Zoom-In(放大)只能提供更多的局部细节,但在牙科诊断中,对称性是极其重要的先验。Mirror-In 工具允许模型在选定一个区域后,自动获取其中轴线镜像的对应区域,形成双向对比视图。这种设计将隐式的解剖学先验变成了显式的模型动作,极大增强了模型识别低对比度病灶的鲁棒性。
专家轨迹:DentalProbe 数据集
为了让模型学会这些复杂的工具操作,作者构建了 DentalProbe 数据库。它包含 5,000 张全景片及由三名代理协作(生成、验证、重写)产生的专家级诊断轨迹。这些轨迹涵盖了“全局观察 -> 局部发现 -> 对称验证 -> 最终结论”的完整链路。
图 2:DentalProbe 专家诊断轨迹的自动构建流程
3. 重检驱动的强化学习 (RL)
如何确保模型不滥用工具,且在诊断不确定时主动发起重检?作者引入了 Reinspection-Driven RL。
- Rubrics-based Reward:摒弃传统的 0/1 奖励,采用梯度平滑的 Rubric 打分,对部分正确的诊断(如 5 个病灶找对 3 个)给子梯度级的反馈。
- 置信度感知的探索奖励 (Conditioned Reward):模型只有在初始诊断具有一定置信度但可能不完整时,才会因为使用工具而获得奖励。这防止了模型盲目使用工具(Reward Hacking)。
4. 实验战绩与洞察
在全新的多维度基准测试 MMOral-X 上,OralGPT-Plus 展现了恐怖的统治力。
表 1:OralGPT-Plus 在 MMOral-X 挑战赛中对比各种商业及开源模型的结果
深度洞察 (Takeaways):
- 能力决定 RL 上限:实验发现 7B 模型经过 RL 后的提升远超 3B 模型。这说明只有具备足够参数容量的模型,才能真正理解复杂的“工具使用-观察反馈”闭环。
- 对称对比是刚需:消融实验显示,如果去掉
Mirror-In工具,模型在处理复杂案例时的性能会直线下跌 10% 以上。 - 防止奖励黑客:如果没有“置信度感知的奖励机制”,模型会学会通过频繁调用无效工具来骗取步数奖励,这说明对 Agentic VLM 的奖励建模必须与临床意图深度对齐。
5. 总结与展望
OralGPT-Plus 的成功不仅仅在于刷榜,它代表了一种全新的医学影像 AI 设计哲学:将静态理解转化为动态交互。 这种模拟人类医生“观察-思考-复诊”的模式,有望成为未来所有长程医学影像诊断(如 CT, MRI 序列分析)的标准范式。
代码与数据集已开源:https://github.com/isbrycee/OralGPT
