[arXiv 2025] 抛弃语言学语义:通过神经元细胞自动机预训练更强的 LLM
Training Language Models via Neural Cellular Automata
本文提出了利用神经元细胞自动机 (NCA) 生成的非语言合成数据对大语言模型进行 Pre-pre-training 的新框架。实验证明,仅需 1.64 亿个 NCA token 的预训练,即可使 1.6B 参数模型在下游任务中提升高达 6% 的性能,并实现 1.6 倍的收敛加速,效果甚至优于使用 16 亿个自然语言 token 的同类预训练。
TL;DR
如果我告诉你,让模型学习如何玩“生命游戏(Game of Life)”的升级版,比让它多读 10 亿行网页文本更能提升其数学和编程能力,你相信吗?MIT 与 Improbable AI 实验室的这项最新研究表明,通过 神经元细胞自动机 (NCA) 生成的非语言合成数据进行 Pre-pre-training,能以极小的 token 预算(仅 164M)显著提升 1.6B 模型在自然语言任务中的收敛速度(1.6x)和最终精度(+6%)。
核心洞察:语义是负担,结构才是灵魂?
大语言模型(LLM)的成功通常归功于海量的自然语言数据。然而,作者提出了一个极具挑衅性的问题:自然语言是通往智能的唯一路径吗?
自然语言数据存在三大缺陷:
- 有限性:高质量文本预计在 2028 年枯竭。
- 偏差性:继承了人类的有毒偏见。
- 耦合性:知识(Knowledge)与推理(Reasoning)混杂,难以单独训练。
作者认为,模型之所以产生推理能力,是因为它在预测下一个 token 时被迫学习了数据背后的 潜在计算过程。如果合成数据具备类似的分层结构和复杂度,模型同样能学会逻辑推理。
方法论:用 NCA 打造“数据模拟器”
研究者选择了 神经元细胞自动机 (NCA) 作为生成器。相比于固定的规则(如 Conway 的生命游戏),NCA 使用小型神经网络作为局部更新规则。
- 规则多样性:每一条数据序列都由随机刷新的神经网络权重 生成。这意味着模型无法通过死记硬背来完成任务,它必须在 Context 中“推断”出当前序列遵循的物理规则,并将其应用。
- 复杂度可控:这是本文最神来之笔的地方。作者利用 gzip 压缩率 作为 Kolmogorov 复杂度的上限指标,筛选出不同复杂度区间的 NCA 轨迹。
图 1: NCA 预训练流程。通过预训练 NCA 的动态过程,模型在进入自然语言训练阶段前就已经掌握了强大的“规则推导”能力。
关键发现 1:Attention 层是通用推理的载体
通过消融实验(Ablation Study),作者发现了一个惊人的事实:在 NCA 预训练结束后,如果将 Attention 层的权重重置,之前的性能衰减最为严重;而重置 MLP 或 LayerNorm 甚至可能在某些任务中提升性能。
这暗示了模型内部的功能分工:
- Attention 层:学习的是通用的、跨领域的计算原语(如长程依赖追踪、Induction Heads)。
- MLP 层:更倾向于存储领域相关的统计规律(甚至是 NCA 生成的“噪音”)。
图 2: 选择性重置组件后的性能下降。显然,Attention 权重载托了最核心的转移信号。
关键发现 2:复杂度匹配原则
并非所有的 NCA 数据都同样有效。研究发现:
- 代码(Code) 任务从 中低复杂度 的 NCA 数据(gzip 30-40%)中获益最多,这可能对应了代码逻辑的严谨性和高重复性。
- 网页(Web)和数学(Math) 则需要 高复杂度 的数据(gzip 50%+)。
这为未来的“领域特定预训练(Domain-specific Training)”提供了全新的操纵杠杆:我们不需要采集更多数据,只需要调整合成数据的复杂度。
图 3: 不同下游领域的收敛曲线。NCA 预训练模型(红色)始终位于最下方。
深度洞见与局限
为什么 1.6 亿 NCA token 强过 16 亿 C4 token? 在训练初期,自然语言充斥着大量的浅层语法噪音,模型需要花费大量计算量通过统计学习来剥离这些噪音。而 NCA 每条序列都是单纯的、严密的规则驱动,它为模型提供了更纯净的“Bayesian Inference”训练信号,强制 Induction Heads 提早形成。
局限性: 虽然在 Pre-pre-training 表现优异,但随着训练 token 数增加(进入数万亿级别),NCA 的边际效应开始递减。如何设计一个能够无限扩展复杂度且不丧失可转移性的合成生成器,是通向“完全合成预训练”的最后一公里。
总结
这项工作打破了“大模型必须依赖大语言”的迷思。通过 NCA,我们不仅获得了一种廉价、无限且纯净的数据源,更深刻理解了 Transformer 如何通过 Attention 结构捕获计算本质。对于开发者而言,这预示着未来我们或许能通过几小时的合成数据“热身”,就让模型具备处理复杂代码或数学逻辑的直觉。
