趋同演化:为什么不同的语言模型会学到相似的数字表征?
Convergent Evolution: How Different Language Models Learn Similar Number Representations
本文揭示了不同语言模型在处理数字时展现出的“趋同演化”现象,即无论架构(Transformer, RNN, LSTM)或训练方式如何,数字嵌入均会在 Fourier 域显现周期性(T=2,5,10)特征。研究提出了一种两层级特征体系,区分了仅具频谱特征的“频谱收敛”与具备线性可分性的“几何收敛”。
TL;DR
一项来自南加州大学与加州大学圣迭戈分校的最新研究深入探讨了 Llama-3、Llama-4 等大模型如何表征数字。研究发现,虽然几乎所有模型(从简单的 GloVe 到最先进的 DeepSeek-V3)在数字嵌入上都表现出类似的 Fourier 周期性(主要集中在 T=2, 5, 10),但这种“视觉上的规律”并不代表模型具备了真正的数学推理能力。作者提出了频谱收敛 (Spectral Convergence) 与 几何收敛 (Geometric Convergence) 的分层模型,指出只有后者才真正赋予了模型处理模运算的功能性结构。
核心直觉:可见的特征不等于可用的功能
在生物学中,海豚和鲨鱼为了适应海洋环境演化出了相似的流线型身体,这被称为“趋同演化”。AI 领域亦然。论文指出,由于自然语言中数字出现的频率分布具有周期性(如逢十进一的习惯),任何在海量文本上训练的模型都会在 Fourier 领域留下明显的“印记”。
然而,作者抛出了一个尖锐的问题:如果一个模型在 Fourier 谱上有尖峰,它就真的懂数学吗? 答案是否定的。
频谱 vs 几何:Theorem 1 的降维打击
作者通过 Theorem 1 在数学上证明了:Fourier 尖峰(频谱收敛)只是线性可分性(几何收敛)的必要非充分条件。
上图展示了残酷的现实:尽管 LSTM 的 Fourier 尖峰比 Transformer 还要粗壮,但在模 10 的线性探测(Linear Probing)中,LSTM 的表现几乎等同于随机猜测。
这种现象背后的物理含义是:虽然类别的中心在空间中是分散的,但由于 LSTM 内部分布的高各向异性(Anisotropy),类内噪声完全淹没了类间信号。这就像是在喧闹的集市中,虽然有人在大喊你的名字,但噪声功率太大,你依然无法提取出有效信息。
谁在驱动几何收敛?
为了找出是什么让 Transformer 具有了这种“功能性”的几何结构,作者进行了细极致的消融实验:
-
数据信号 (Data Signals):
- 文本-数字共现:如果破坏数字与上下文的关联(Swap Numbers),几何收敛会剧烈下降。
- 上下文长度:随着 Context Length 从 2 增加到 64,探测精度稳步提升,说明模型在长距离依赖中通过统计学习强化了数字感。
- 跨数字交互:在一个 Sequence 内部多个数字的共现对学习模运算至关重要。
-
架构偏置 (Inductive Bias):
- Transformer & Linear RNNs:天然适合捕捉这种结构,即使是仅训练 10B token。
- LSTM:彻底失败。这暗示了循环神经网络在处理这种特定类型的统计依赖时存在瓶颈。

算术任务下的分词之争
当模型被直接训练做加法()时,分词器(Tokenizer)扮演了决定性角色:
- 多 Token 模式:由于每一位数字的预测本质上是一个模 1000 的分类问题,模型面临巨大的“进化压力”去学习周期表征。
- 单 Token 模式:模型更倾向于死记硬背。在这种情况下,是否能学到周期特征完全取决于优化器和随机种子,不再具有稳定性。
深度洞察
这项研究不仅是对数字表征的个案研究,它实际上为 机械可解释性 (Mechanistic Interpretability) 敲响了警钟。过去我们习惯于通过可视化向量空间的聚类或频谱来宣称模型“学到了什么”,但本文证明了这种方法可能只是捕捉到了统计遗迹(Artifacts)。
真正稳健的分析应该聚焦于几何可分离性。这种从频谱到几何的范式转移,对于理解模型如何处理时间、逻辑以及其他具有周期性或结构化特征的属性具有重要的指导意义。
总结
即使是完全不同的 AI 架构,在类似的训练环境下也会展现出相似的表征模式。但作为研究者,我们需要辨别哪些是“环境留下的印记”(频谱收敛),哪些是真正的“感知器官”(几何收敛)。
