[ICLR 2025] 像变色龙一样思考:ToCoRL 如何赋予大模型行为塑性
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
本文揭示了大语言模型(LLM)具有类似变色龙的“行为塑性”,通过**令牌条件生成(Token-Conditional Generation)**可在推理阶段无缝切换行为模式。基于此,作者提出了 ToCoRL (Token-Conditioned Reinforcement Learning) 框架,利用强化学习将这种瞬态的行为适配内化为模型持久且自动调用的能力。
TL;DR
本文揭示了 LLM 隐藏的“行为塑性”:通过在开头强制填充几个特定的 Token(如直接给出答案开头的词),推理模型可以瞬间从“废话连篇”转变为“干脆利落”。作者进一步提出 ToCoRL 框架,通过强化学习将这种临时的适配能力内化到模型参数中。结果令人惊喜:Qwen3 推理模型在保持顶尖数学能力的同时,常识问答性能提升了 50%。
1. 动机:推理模型的“诅咒”
当前的 Large Reasoning Models (LRMs) 陷入了一个尴尬的境地:虽然它们在 AIME 等竞赛题上表现神勇,但在回答“墨尔本某美术馆哪年更名”这种事实性问题时,却总喜欢开启漫长的 <think> 模式。
这种**过度推理(Over-thinking)**不仅浪费 Token,更致命的是,漫长的思考链经常会引入不必要的联想和幻觉,导致“想得越多,错得越多”。
- 现状:Instruct 模型直接回答表现好,但没逻辑;Thinking 模型逻辑强,但简单题易翻车。
- 洞察:模型内部其实具备直接回答的能力,只是被固化的推理模式掩盖了。我们能否给模型装一个“切换开关”?
2. 行为塑性:令牌条件生成的魔力
作者发现,只需将 Instruct 模型生成的直接答案的前 3 个 Token 强行喂给 Thinking 模型作为开头,Thinking 模型就会立刻心领神会,跳过冗长的推导流程。

这种现象被称为 Behavioral Plasticity(行为塑性)。即便模型已经被高度专业化(Specialized),它依然保留了适配环境诱导信号的潜能。
3. ToCoRL:将瞬态适配转化为持久能力
虽然 Token-forcing 很有效,但在实际推理阶段我们不可能预知正确答案的开头。因此,作者提出了 ToCoRL。
核心公式解析
ToCoRL 在传统的 RL 目标函数上增加了一个特殊的 KL 约束项:
这里的 是一个组合策略:
- 它包含了模型当前的策略。
- 它注入了由 Token 引导生成的“期望行为”。
- 正确性感知:只有当 Token 引导生成的答案是正确(High Advantage)时,这种行为才会被正向激励。
实验流程图

4. 实验战绩:双项全能的实现
研究者在 Qwen3-30B-Thinking 模型上进行了验证,选择了事实问答(SimpleQA)和数学竞赛(AIME) 两个极端的任务场景。
| 模型配置 | SimpleQA (事实) | AIME'25 (数学) |
|---|---|---|
| 原始 Thinking 模型 | 18.9% | 80.5 |
| ToCoRL 训练后 | 28.3% | 81.5 |
| 常规 GRPO 训练 | 23.6% | 81.4 |
深度观察:涌现的“校准推理”
训练后的模型展现出一种全新的行为模式——校准式推理(Recalibrative Reasoning):
- 针对简单题:模型直接给出答案,
<think>块极短。 - 针对难题:模型先给出一个预测答案,然后在思考块内不断自我校准,直到确信后再输出。
图注:随着训练进行,模型在保证正确率(实线)上升的同时,响应长度(虚线)经历了先降后升的自适应过程。
5. 结论与启示
ToCoRL 的成功带给我们三个重要启示:
- 行为 > 知识:很多时候模型表现差不是因为它笨,而是它选择的“解题姿势”不对。
- 可迁移性:ToCoRL 诱导出的这种行为模式可以通过 SFT 蒸馏给基座模型,具有极强的工程价值。
- 通用 LLM 的未来:未来的通用模型不应该通过增加参数量来解决所有问题,而应该学会像人类一样,根据场景切换“快思考”与“慢思考”。
主编点评:本研究最精妙之处在于,它没有试图改变模型的知识储备,而是通过一个物理直觉极强的“令牌引导”机制,成功调动了 LLM 内部沉睡的参数,是后训练(Post-training)领域一篇扎实的 Methodology 佳作。
