[Columbia University] 推理模型不只会算术:RLVR 释放 LLM 参数知识检索潜力
Improving Parametric Knowledge Access in Reasoning Language Models
本文提出通过强化学习训练推理语言模型(Reasoning LLMs)来优化其内部参数知识(Parametric Knowledge)的检索能力。核心方法是利用可验证奖励的强化学习(RLVR),在不提供外部检索文档的情况下,通过 TriviaQA 等任务训练模型生成有助于回忆事实的推理路径(Reasoning Traces)。
TL;DR
长期以来,我们认为思维链(CoT)和强化学习(RL)是解决数学、代码等逻辑难题的专利。然而,哥伦比亚大学的最新研究发现:推理模型在访问其参数中的百科知识时也存在“欠优化”现象。 通过对知识问答任务进行可验证奖励强化学习(RLVR),模型不仅能在 TriviaQA 上显著提升性能,还能产生一种“激活扩散”效应,辅助找回深层记忆。
背景定位:逻辑强,知识却“断片”?
当前的推理模型(如 DeepSeek-R1 或 OpenAI o1)在数学和代码领域表现惊人,这归功于 RLVR 赋予它们的严密逻辑。但如果你问它一个生僻的地理问题,即使它在预训练阶段见过,也可能因为缺乏“思考路径”而无法直接从参数中提取。本文探讨的核心问题是:推理标记(Reasoning Tokens)能否成为打开模型参数记忆库的钥匙?
痛点与动机:为什么“一步步思考”对知识检索失效了?
作者发现了一个有趣的悖论:
- 在数学任务中,模型已经过度优化,手动添加
Think step-by-step提示词反而会干扰其原有的推理节奏,导致性能下降。 - 在知识检索任务中,默认情况下模型并不倾向于深度思考,但一旦强制其思考,性能反而会有所提升。
这说明现有的推理模型在“如何通过思考来回忆知识”上远未达到 SOTA。作者受到心理学“激活扩散(Spreading Activation)”理论的启发——通过联想相关概念(如从“澳大利亚主要城市”联想到“堪培拉”)来定位目标事实。
方法论详解:将知识检索转化为“可验证”的强化学习
作者并没有使用传统的 SFT(监督微调),由于高质量的“知识检索推理路径”很难人工标注,他们选择了 RLVR 路径:
- 可验证奖励(Verifiable Reward):利用闭卷问答的答案作为唯一的硬性指标,只要模型猜对了答案,就奖励其整段推理路径。
- GRPO 算法:采用类似于 DeepSeek 的组相对策略优化,不使用鉴别器(Critic),直接在生成的多个采样中对比优劣。
- 公式背后的逻辑:目标函数 实际上是在告诉模型:“不管你脑子里想了什么,只要最后帮你想起了那个正确的地名,这段思考就是有价值的。”

实验与结果:全线飘红的性能提升
研究人员在 GPT-OSS-20B 等多个模型上进行了测试,结果令人印象深刻:
- 跨领域泛化:即便只在 TriviaQA 数据集上训练,模型在多跳问答(HotpotQA,EM 提升 9.5%)和复杂推理问答(StrategyQA)上也表现出显著的迁移能力。
- 不仅仅是长度增加:虽然 RL 训练后的推理路径变长了(从平均 94 token 增加到 107 token),但更有趣的是,模型学会了“纠偏”。在示例中,Base 模型可能会断定“加拿大没女总理”,而 RL 后的模型会通过联想“1993 年”和“Kim Campbell”最终锁定正确答案。

深度洞察:推理的“黑盒”本质
文章提出了一个非常硬核的观点:对于知识检索,所谓的“正确推理”不一定要符合人类逻辑。 作者坦言,RL 训练后的推理路径有时看起来并非严格的演绎推理,更像是一种内部信息的“乱炖”。但既然目的是回传存储在参数中的向量,那么这种“看起来不太聪明”的联想路径,实际上可能是模型访问特定隐空间的最佳捷径。
局限性
- 可解释性低:部分生成的推理路径依然碎片化,难以让用户理解模型是如何“想起”答案的。
- 幻觉风险:虽然准确率提升,但拉长推理链条是否会增加虚假信息的生成,仍需长期观察。
总结
这项研究扩展了 RLVR 的应用边界。它告诉我们,模型不仅需要学习数学逻辑,也需要学习“如何记忆”。未来的推理模型或许会自动识别问题类型:如果是逻辑题,开启演绎模式;如果是常识题,开启激活扩散模式。这为打造更全能、知识调动能力更强的 AI Agent 指明了方向。
