[ArXiv 2026] Reasoning Core:通过程序化合成数据构建 LLM 的“推理核心”

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

总结
问题
方法
结果
要点
摘要

本文推出了 Reasoning Core,一个用于程序化生成可验证符号推理数据的开源套件。该工具涵盖了规划(PDDL)、一阶逻辑、形式语法、因果推理及代数方程等核心领域,旨在通过大规模合成具有高度分布泛化性的数据,提升语言模型在预训练和微调阶段的底层推理能力。

TL;DR

本文提出了 Reasoning Core (RC),一个旨在解决 LLM 推理瓶颈的程序化数据生成套件。与以往局限于特定解谜任务(如汉诺塔、数独)的工具相比,RC 专注于 PDDL 规划、形式逻辑、因果推理等基础形式化领域,并利用外部物理求解器(Solver)提供绝对准确的验证信号。实验表明,仅在预训练中加入适比例的 RC 数据,就能在不损失语言能力的前提下,显著增强模型的下游推理表现。

1. 为什么 Web 文本已不足以支撑推理?

在 Scaling Law 的下半场,单纯依靠抓取互联网文本已进入边际收益递减期。Web 文本虽包含人类知识,但其逻辑链条往往是不严谨、低密度的。

现有方法(Prior Work)的短板:

  • 模板僵化:很多合成数据集(如 BlocksWorld)极其容易过拟合。模型可能学会了怎么搬方块,但并未理解背后的“规划策略”。
  • 可验证性缺失:基于 LLM 自我生成的合成数据往往包含幻觉,缺乏像数学证明那样的“判定性”(Decidability)。
  • 缺乏难度渐进:难以精细控制任务难度,无法进行有效的课程学习(Curriculum Learning)。

2. 核心贡献:Reasoning Core 的系统性重构

Reasoning Core 不同于简单的任务库,它是一个具有 High Generality(高分布泛化) 的生成引擎。

2.1 五大核心形式化领域

  1. PDDL 规划:随机生成 STRIPS 动作空间、初始状态和目标,而非固定的场景。
  2. 一阶逻辑 (FOL):基于复杂语法生成带有量词、否定和谓词的逻辑命题,并使用顶级定理证明器 Vampire 验证。
  3. Gramforge 语法生成:支持上下文敏感语法,允许生成复杂的 Python 代码执行任务或正则归纳。
  4. 因果推理:在随机贝叶斯网络上进行干预(do-calculus)推理。
  5. 符号代数:线性/非线性方程组的求解与归一化。

2.2 难度控制与外部求解器

研究者为每个生成器配备了“持续难度旋钮”(Continuous Difficulty Knob)。通过调整一个 float 参数,可以同步改变证明深度、变量数量、路径长度等指标。

最关键的是,RC 拒绝“黑盒验证”。它集成了物理世界的专业求解器:

  • 规划引擎:FastDownward
  • 定理证明器:Vampire / E
  • 符号代数系统:Sympy

系统架构总览 图注:Reasoning Core 统一了预训练(SFT)和强化学习(RLVR)的接口,提供 Prompt、Answer 以及可验证的 Reward 函数。

3. 实验发现:推理能力可以“预装”

研究者将 RC 数据混入 FineWeb 等大规模预训练语料中,在不足 100M 参数的小模型上进行了一次“推理原语”的注入实验。

3.1 实验结果分析

实验结果(图 3)显示:

  1. 推理提升:在 PlatinumBench 推理基准测试中,混入 RC 数据后的模型其 NLL(负对数似然)显著下降,证明模型更易理解复杂的逻辑结构。
  2. 语言建模反哺:令人惊讶的是,加入符号推理数据后,模型在自然语言验证集上的损失也略有下降。这印证了一个重要直觉:理解逻辑有助于更好地建模自然语言中的结构关系。
  3. 最优配比:实验发现加入约 33% (r=0.5) 的符号推理代币是目前的 Sweet Spot。

实验性能对比 图注:随着 Reasoning Core 数据占比(r)的增加,PlatinumBench 上的预测损失(NLL)呈现明显的下降趋势。

3.2 挑战最强模型:GPT-5 的“试金石”

即便对于尚在研发阶段或最前沿的模型(如实验中的 GPT-5 Family),Reasoning Core 的高难度任务(Hard Level)依然构成了巨大挑战。这说明 RC 数据集不仅能用于预训练,更是评估未来 AGI 推理能力的有效 Benchmark。

GPT-5 零样本评测 图注:GPT-5 家族在 RC 任务上的表现。随着难度旋钮从 Easy 切换到 Hard,其 Reward 迅速下降,反映了任务背后深刻的形式化难度。

4. 深度洞察:预训练时期的“Inductive Bias”

本项工作的核心价值在于其对 Neurosymbolic AI(神经符号 AI) 路径的探索。作者认为,与其在模型训练好后再强行用 RL(强化学习)去纠正其推理,不如在预训练阶段就通过“程序化、可验证、多样化”的符号数据,让模型内化逻辑运算的归纳偏置(Inductive Bias)。

局限性讨论: 目前 Reasoning Core 仍局限于形式化符号域。这种“纯理性”的推理能力是否能完美迁移到法律、道德或非结构化的创意写作中,仍需更广泛的下游验证。

5. 总结

Reasoning Core 为社区提供了一个几乎无限的推理温床。它不仅免除了 web 语料的版权风险,还通过外部求解器解决了合成数据的质量评估难题。对于正在寻找“下一代推理预训练数据”的研究者来说,这无疑是一座金矿。


代码与数据: 遵循 MIT 协议开源。 关键词: #SymbolicAI #LLM #Pretraining #ReasoningCore #PDDL

发现相似论文

试试这些示例

  • 查找最近一年内探讨在语言模型预训练阶段(Pre-training)使用合成形式化语言数据提升逻辑推理能力的论文。
  • 哪篇论文首次提出了将外部符号求解器(External Solvers)与大语言模型训练循环结合的概念,本文在验证机制上有何改进?
  • 调研当前除了 PDDL 和一阶逻辑外,还有哪些复杂的程序化生成领域(如自动化定理证明或硬件描述语言)被用于增强 LLM 的推理鲁棒性?
目录
[ArXiv 2026] Reasoning Core:通过程序化合成数据构建 LLM 的“推理核心”
1. TL;DR
2. 1. 为什么 Web 文本已不足以支撑推理?
3. 2. 核心贡献:Reasoning Core 的系统性重构
3.1. 2.1 五大核心形式化领域
3.2. 2.2 难度控制与外部求解器
4. 3. 实验发现:推理能力可以“预装”
4.1. 3.1 实验结果分析
4.2. 3.2 挑战最强模型:GPT-5 的“试金石”
5. 4. 深度洞察:预训练时期的“Inductive Bias”
6. 5. 总结