[ArXiv 2026] Reasoning Core:通过程序化合成数据构建 LLM 的“推理核心”
Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training
本文推出了 Reasoning Core,一个用于程序化生成可验证符号推理数据的开源套件。该工具涵盖了规划(PDDL)、一阶逻辑、形式语法、因果推理及代数方程等核心领域,旨在通过大规模合成具有高度分布泛化性的数据,提升语言模型在预训练和微调阶段的底层推理能力。
TL;DR
本文提出了 Reasoning Core (RC),一个旨在解决 LLM 推理瓶颈的程序化数据生成套件。与以往局限于特定解谜任务(如汉诺塔、数独)的工具相比,RC 专注于 PDDL 规划、形式逻辑、因果推理等基础形式化领域,并利用外部物理求解器(Solver)提供绝对准确的验证信号。实验表明,仅在预训练中加入适比例的 RC 数据,就能在不损失语言能力的前提下,显著增强模型的下游推理表现。
1. 为什么 Web 文本已不足以支撑推理?
在 Scaling Law 的下半场,单纯依靠抓取互联网文本已进入边际收益递减期。Web 文本虽包含人类知识,但其逻辑链条往往是不严谨、低密度的。
现有方法(Prior Work)的短板:
- 模板僵化:很多合成数据集(如 BlocksWorld)极其容易过拟合。模型可能学会了怎么搬方块,但并未理解背后的“规划策略”。
- 可验证性缺失:基于 LLM 自我生成的合成数据往往包含幻觉,缺乏像数学证明那样的“判定性”(Decidability)。
- 缺乏难度渐进:难以精细控制任务难度,无法进行有效的课程学习(Curriculum Learning)。
2. 核心贡献:Reasoning Core 的系统性重构
Reasoning Core 不同于简单的任务库,它是一个具有 High Generality(高分布泛化) 的生成引擎。
2.1 五大核心形式化领域
- PDDL 规划:随机生成 STRIPS 动作空间、初始状态和目标,而非固定的场景。
- 一阶逻辑 (FOL):基于复杂语法生成带有量词、否定和谓词的逻辑命题,并使用顶级定理证明器
Vampire验证。 - Gramforge 语法生成:支持上下文敏感语法,允许生成复杂的 Python 代码执行任务或正则归纳。
- 因果推理:在随机贝叶斯网络上进行干预(do-calculus)推理。
- 符号代数:线性/非线性方程组的求解与归一化。
2.2 难度控制与外部求解器
研究者为每个生成器配备了“持续难度旋钮”(Continuous Difficulty Knob)。通过调整一个 float 参数,可以同步改变证明深度、变量数量、路径长度等指标。
最关键的是,RC 拒绝“黑盒验证”。它集成了物理世界的专业求解器:
- 规划引擎:
FastDownward - 定理证明器:
Vampire/E - 符号代数系统:
Sympy
图注:Reasoning Core 统一了预训练(SFT)和强化学习(RLVR)的接口,提供 Prompt、Answer 以及可验证的 Reward 函数。
3. 实验发现:推理能力可以“预装”
研究者将 RC 数据混入 FineWeb 等大规模预训练语料中,在不足 100M 参数的小模型上进行了一次“推理原语”的注入实验。
3.1 实验结果分析
实验结果(图 3)显示:
- 推理提升:在 PlatinumBench 推理基准测试中,混入 RC 数据后的模型其 NLL(负对数似然)显著下降,证明模型更易理解复杂的逻辑结构。
- 语言建模反哺:令人惊讶的是,加入符号推理数据后,模型在自然语言验证集上的损失也略有下降。这印证了一个重要直觉:理解逻辑有助于更好地建模自然语言中的结构关系。
- 最优配比:实验发现加入约 33% (r=0.5) 的符号推理代币是目前的 Sweet Spot。
图注:随着 Reasoning Core 数据占比(r)的增加,PlatinumBench 上的预测损失(NLL)呈现明显的下降趋势。
3.2 挑战最强模型:GPT-5 的“试金石”
即便对于尚在研发阶段或最前沿的模型(如实验中的 GPT-5 Family),Reasoning Core 的高难度任务(Hard Level)依然构成了巨大挑战。这说明 RC 数据集不仅能用于预训练,更是评估未来 AGI 推理能力的有效 Benchmark。
图注:GPT-5 家族在 RC 任务上的表现。随着难度旋钮从 Easy 切换到 Hard,其 Reward 迅速下降,反映了任务背后深刻的形式化难度。
4. 深度洞察:预训练时期的“Inductive Bias”
本项工作的核心价值在于其对 Neurosymbolic AI(神经符号 AI) 路径的探索。作者认为,与其在模型训练好后再强行用 RL(强化学习)去纠正其推理,不如在预训练阶段就通过“程序化、可验证、多样化”的符号数据,让模型内化逻辑运算的归纳偏置(Inductive Bias)。
局限性讨论: 目前 Reasoning Core 仍局限于形式化符号域。这种“纯理性”的推理能力是否能完美迁移到法律、道德或非结构化的创意写作中,仍需更广泛的下游验证。
5. 总结
Reasoning Core 为社区提供了一个几乎无限的推理温床。它不仅免除了 web 语料的版权风险,还通过外部求解器解决了合成数据的质量评估难题。对于正在寻找“下一代推理预训练数据”的研究者来说,这无疑是一座金矿。
代码与数据: 遵循 MIT 协议开源。 关键词: #SymbolicAI #LLM #Pretraining #ReasoningCore #PDDL
