[Columbia University] 推理模型不只会算术:RLVR 释放 LLM 参数知识检索潜力

Improving Parametric Knowledge Access in Reasoning Language Models

总结
问题
方法
结果
要点
摘要

本文提出通过强化学习训练推理语言模型(Reasoning LLMs)来优化其内部参数知识(Parametric Knowledge)的检索能力。核心方法是利用可验证奖励的强化学习(RLVR),在不提供外部检索文档的情况下,通过 TriviaQA 等任务训练模型生成有助于回忆事实的推理路径(Reasoning Traces)。

TL;DR

长期以来,我们认为思维链(CoT)和强化学习(RL)是解决数学、代码等逻辑难题的专利。然而,哥伦比亚大学的最新研究发现:推理模型在访问其参数中的百科知识时也存在“欠优化”现象。 通过对知识问答任务进行可验证奖励强化学习(RLVR),模型不仅能在 TriviaQA 上显著提升性能,还能产生一种“激活扩散”效应,辅助找回深层记忆。

背景定位:逻辑强,知识却“断片”?

当前的推理模型(如 DeepSeek-R1 或 OpenAI o1)在数学和代码领域表现惊人,这归功于 RLVR 赋予它们的严密逻辑。但如果你问它一个生僻的地理问题,即使它在预训练阶段见过,也可能因为缺乏“思考路径”而无法直接从参数中提取。本文探讨的核心问题是:推理标记(Reasoning Tokens)能否成为打开模型参数记忆库的钥匙?

痛点与动机:为什么“一步步思考”对知识检索失效了?

作者发现了一个有趣的悖论:

  • 数学任务中,模型已经过度优化,手动添加 Think step-by-step 提示词反而会干扰其原有的推理节奏,导致性能下降。
  • 知识检索任务中,默认情况下模型并不倾向于深度思考,但一旦强制其思考,性能反而会有所提升。

这说明现有的推理模型在“如何通过思考来回忆知识”上远未达到 SOTA。作者受到心理学“激活扩散(Spreading Activation)”理论的启发——通过联想相关概念(如从“澳大利亚主要城市”联想到“堪培拉”)来定位目标事实。

方法论详解:将知识检索转化为“可验证”的强化学习

作者并没有使用传统的 SFT(监督微调),由于高质量的“知识检索推理路径”很难人工标注,他们选择了 RLVR 路径:

  1. 可验证奖励(Verifiable Reward):利用闭卷问答的答案作为唯一的硬性指标,只要模型猜对了答案,就奖励其整段推理路径。
  2. GRPO 算法:采用类似于 DeepSeek 的组相对策略优化,不使用鉴别器(Critic),直接在生成的多个采样中对比优劣。
  3. 公式背后的逻辑:目标函数 实际上是在告诉模型:“不管你脑子里想了什么,只要最后帮你想起了那个正确的地名,这段思考就是有价值的。”

模型架构与推理示例

实验与结果:全线飘红的性能提升

研究人员在 GPT-OSS-20B 等多个模型上进行了测试,结果令人印象深刻:

  • 跨领域泛化:即便只在 TriviaQA 数据集上训练,模型在多跳问答(HotpotQA,EM 提升 9.5%)和复杂推理问答(StrategyQA)上也表现出显著的迁移能力。
  • 不仅仅是长度增加:虽然 RL 训练后的推理路径变长了(从平均 94 token 增加到 107 token),但更有趣的是,模型学会了“纠偏”。在示例中,Base 模型可能会断定“加拿大没女总理”,而 RL 后的模型会通过联想“1993 年”和“Kim Campbell”最终锁定正确答案。

实验结果对比

深度洞察:推理的“黑盒”本质

文章提出了一个非常硬核的观点:对于知识检索,所谓的“正确推理”不一定要符合人类逻辑。 作者坦言,RL 训练后的推理路径有时看起来并非严格的演绎推理,更像是一种内部信息的“乱炖”。但既然目的是回传存储在参数中的向量,那么这种“看起来不太聪明”的联想路径,实际上可能是模型访问特定隐空间的最佳捷径。

局限性

  • 可解释性低:部分生成的推理路径依然碎片化,难以让用户理解模型是如何“想起”答案的。
  • 幻觉风险:虽然准确率提升,但拉长推理链条是否会增加虚假信息的生成,仍需长期观察。

总结

这项研究扩展了 RLVR 的应用边界。它告诉我们,模型不仅需要学习数学逻辑,也需要学习“如何记忆”。未来的推理模型或许会自动识别问题类型:如果是逻辑题,开启演绎模式;如果是常识题,开启激活扩散模式。这为打造更全能、知识调动能力更强的 AI Agent 指明了方向。

发现相似论文

试试这些示例

  • 查找其他通过强化学习(RL)提升大语言模型闭卷问答(Closed-book QA)性能的最新论文。
  • 激活扩散理论(Spreading Activation Theory)最早由谁提出,目前在 LLM 内部机制研究中如何被应用?
  • 有哪些研究探讨了推理模型在处理非逻辑性任务(如情感分析或纯事实检索)时思维链(CoT)产生的副作用?
目录
[Columbia University] 推理模型不只会算术:RLVR 释放 LLM 参数知识检索潜力
1. TL;DR
2. 背景定位:逻辑强,知识却“断片”?
3. 痛点与动机:为什么“一步步思考”对知识检索失效了?
4. 方法论详解:将知识检索转化为“可验证”的强化学习
5. 实验与结果:全线飘红的性能提升
6. 深度洞察:推理的“黑盒”本质
6.1. 局限性
7. 总结