[arXiv 2026] 算法核心的收敛:Transformer 内部竟隐藏着通用的“数学核心”?

Learning Physical Principles from Interaction: Self-Evolving Planning via Test-Time Memory

总结
问题
方法
结果
要点

本文提出了“算法核心”(Algorithmic Cores)框架,通过 ACE 技术提取模型内部必要且充分的低维子空间。研究证明,尽管不同 Transformer 的权重不同,但它们在执行马尔可夫链、模加法及主谓一致任务时,会收敛到相同且具备旋转动力学特征的算法核心。

TL;DR

长期以来,AI 研究者一直被一个问题困扰:独立训练的两个模型即使表现完全一致,它们的内部实现(权重)也天差地别。本文通过 ACE (算法核心提取) 技术证明,在杂乱无章的权重之下,Transformer 实际上会收敛到一种极其精简、低维且跨模型通用的“算法核心”。无论是在处理简单的马尔可夫链,还是在 GPT-2 中控制复杂的语法一致性,这些“核心”不仅是模型运行的关键,甚至可以直接被我们用来控制模型的行为。

痛点深挖:权重的“偶然性”与机制的“必然性”

在 Mechanistic Interpretability(机械可解释性)领域,科学家们习惯于分析“电路”(Circuits)——即特定的神经元连接。但这种方法存在致命伤:训练过程只选择了行为,没有选择电路。这意味着模型的内部结构往往充满了随机性。

作者提出,我们不应该关注“模型是如何接线的”,而应该关注“哪些功能结构在不同模型中是保持不变的”。这就像研究不同的交通工具(飞机、赛车),虽然零件千差万别,但其背后的空气动力学原理(算法核心)是互通的。

核心机制:ACE 提取法

为了找到这个不变量,作者借鉴了控制理论。一个系统内部有很多状态,但只有那些**既能被输入驱动(Active),又对输出产生影响(Relevant)**的方向才构成了“算法核心”。

算法核心提取与马尔可夫链实验结果

通过对隐藏状态和雅可比矩阵(Jacobian)进行奇异值分解(SVD),ACE 能够精准锁定这些关键维度。实验显示,在马尔可夫任务中,提取出的 3D 核心不仅足以支撑全部性能,其内部的特征值光谱竟然与真实的转换矩阵 完全吻合。

深度洞察:Grokking 的真相与“过度教育”

在模加法(Modular Addition)实验中,作者观察到了惊人的现象:

  1. 核心在此时结晶:当模型发生 Grokking(顿悟)时,其算法核心会迅速坍缩到一个低维空间,并形成完美的循环算子(Cyclic Operators)。
  2. 核心膨胀悖论:在顿悟之后,如果继续增加 Weight Decay 训练,核心维度反而会增加。作者解释说,这并非模型变复杂了,而是模型为了减小权重范数,将计算“平摊”到了所有可用的等效模式上。这被戏称为模型的“过度教育”(Over-education)。

模加法中的旋转机制与核心演化

跨规模的通用性:GPT-2 中的“引力轴”

真正令人振奋的是该方法在 LLM 上的应用。在对 GPT-2(Small 到 Large)的研究中,作者发现**主谓一致(Subject-Verb Agreement)**竟然完全由一个 1D 核心轴控制。

  • 跨规模对齐:尽管 GPT-2 Large 的参数量是 Small 的 6.6 倍,但它们的“语法核心轴”在统计上几乎是完全一致的。
  • 上帝之手:只要通过该轴“镜像对称”地翻转激活值,模型就会立刻从“单数偏好”变为“复数偏好”。例如,让模型原本想说 "The key is" 瞬间变成 "The key are",且这种干预能泛化到从未见过的词汇上。

GPT-2 中的 1D 协议核心

总结与未来展望

这项工作不仅为 Mechanistic Interpretability 提供了新的工具,更揭示了深度学习的一个深刻本质:Transformer 的计算是高度组织化的,其背后存在着紧凑、共享的代数结构。

  • 局限性:目前主要验证了具备清晰数学/语法逻辑的任务。对于模糊的多步推理,核心是否依然保持低维还有待验证。
  • 启示:未来的模型对齐(Alignment)或模型合并(Merging)也许不应该再对整个权重矩阵动刀,而应该精准地瞄准这些“算法核心”。

资深主编点评:本文标志着可解释性研究从“盲人摸象”式的特征分析,进化到了对“物理定律”式的抽象建模。它告诉我们,AI 模型并没有发明什么奇技淫巧,而是在训练中一步步通过数学上的旋转与对称,逼近了真理的核心。

发现相似论文

试试这些示例

  • 查找最近利用控制理论(如平衡截断或 Kalman 分解)来简化或解释深度神经网络内部表示的相关论文。
  • 哪篇论文最早探讨了 Grokking 现象中权重衰减(Weight Decay)与泛化之间的数学关系,本文提出的“核心膨胀”理论对其有何补充?
  • 有哪些研究尝试将类似“算法核心”的低维干预技术应用到大模型的安全对齐(Safety Alignment)或偏好调优中?
目录
[arXiv 2026] 算法核心的收敛:Transformer 内部竟隐藏着通用的“数学核心”?
1. TL;DR
2. 痛点深挖:权重的“偶然性”与机制的“必然性”
3. 核心机制:ACE 提取法
4. 深度洞察:Grokking 的真相与“过度教育”
5. 跨规模的通用性:GPT-2 中的“引力轴”
6. 总结与未来展望