[Arxiv 2025] ThinkOmni:无需微调,让多模态模型共享 DeepSeek-R1 的“思考”大脑
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
本文提出了 ThinkOmni,一个无需训练(training-free)的推理框架,旨在将文本大推理模型(LRM,如 DeepSeek-R1)的逻辑能力迁移至全模态(Omni-modal)场景。通过 LRM-as-a-Guide 策略和逐步对比缩放机制,在 MathVista 和 MMAU 等六大基准测试中显著提升了现有全模态模型(OLLM)的性能。
TL;DR
ThinkOmni 是一个革命性的**无需训练(Training-free)**推理框架,它通过在解码阶段引入现成的文本大推理模型(LRM,如 DeepSeek-R1、Qwen3-Think),极大地提升了全模态模型(OLLM)在图像、音频、视频场景下的逻辑推理能力。实验显示,它在 MathVista 和 MathVision 等硬核推理榜单上大幅刷新了 SOTA 记录,甚至超越了经过昂贵强化学习(RFT)训练的同类模型。
背景定位:该工作站在“推理模型文本化”与“全模态感知强推理弱”的交汇点,通过**解码引导(Guidance Decoding)**实现了感知与推理的解耦。
1. 痛点深挖:多模态推理的“数据饥渴”与“智力鸿沟”
当前 AI 领域存在一个明显的“不对称”:
- 文本推理模型 (LRM):如 o1、DeepSeek-R1,拥有极强的思维链(CoT)能力,但它们是“瞎子/聋子”,看不见图片也听不见声音。
- 全模态模型 (OLLM):能看能听,但在处理复杂的数学、逻辑问题时极易产生幻觉,缺乏深思熟虑的推理步。
为什么不直接训练一个全模态推理模型?
- 数据稀缺:高质量的“模态输入+深度推理步骤”标注数据极其罕见。
- 计算昂贵:对 32B 甚至更大的模型进行强化学习(RFT)需要惊人的算力(如 16xH800)。
- 适配滞后:文本 LLM 的进步速度远超多模态模型。
2. Methodology:ThinkOmni 的“引导与平衡”术
ThinkOmni 的核心直觉是:让 OLLM 负责“看”和“听”,让 LRM 负责“想”,最后在每一步输出 Token 时进行博弈和融合。
2.1 LRM-as-a-Guide (引导机制)
在每一个 Token 的生成时刻,系统并行运行两个模型:
- 主模型 (OLLM):接收图文/音视频输入,产出感知 Logits。
- 引导模型 (LRM):仅接收已生成的文本序列,产出纯逻辑推理 Logits。

2.2 Stepwise Contrastive Scaling (逐步对比缩放)
如果给 LRM 分配固定的权重(),会面临两难:权重太高,模型不看图开始瞎编;权重太低,又回到了弱智形态。
ThinkOmni 引入了 Jensen–Shannon (JS) 散度来实时评估:
- 感知增益:如果去掉多模态输入,模型输出变化有多大?
- 推理需求:LRM 给出的建议相对于基准模型有多强烈的冲突?
通过动态调整权重 ,模型在需要识别物体时信任 OLLM,在需要数学运算、逻辑推导时向 LRM 借力。

3. 实验与结果:训练不如“引导”?
研究团队在 Qwen2.5-Omni 基础上,使用 DeepSeek-R1 和 Qwen3 进行了测试,结果令人振奋:
- 碾压性超越:在 MathVista (70.2%) 和 MMAU (75.5%) 上,性能显著优于原生模型。
- 与 RFT 模型的肌肉对抗:对比专门用了 RL 训练的 Omni-R1 7B,ThinkOmni 作为一个“零训练”方法,在多项指标上实现反超。
- 模态通用性:不仅限于视觉,在纯音频推理任务中同样表现出色,证明了该方法的通用性。

4. 深度洞察:为什么这种“零训练”方法有效?
这种有效性反映了深度学习模型的一个隐式特性:知识与感知是解耦的。
- 推理偏见注入:通过 Logit 级的对比,LRM 成功地将“推理偏好”植入到了 OLLM 的解码序列中。
- 逻辑锚点:如图 9 所示,当模型输出“Therefore”、“but”等转折词时,LRM 的权重显著升高,这说明 LRM 在关键的思维节点上发挥了航标作用。

5. 总结与局限
Takeaway:ThinkOmni 为全模态推理提供了一条极其丝滑的路径——无需漫长的微调,直接利用最强的文本推理模型作为“智囊团”。
局限性:
- 推理延迟:由于需要同时运行两个模型甚至多个前向过程,推理速度比单模型慢约 2.8x。
- 词表限制:要求 OLLM 和 LRM 必须使用相同的 Vocabulary,这限制了不同厂商模型之间的跨架构组合。
展望:随着小参数量高表现模型(比如 1.5B/3B 的 R1 Distill 模型)的普及,这种 Guidance Decoding 的成本将进一步降低,未来甚至可能成为全模态 AI 的标准配置。
