[ICML 2025] 语义管预测 (STP):用几何直觉击碎 LLM 的数据缩放定律
A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring
本文提出了语义管预测 (Semantic Tube Prediction, STP),这是一种受 JEPA 启发的正则化项,旨在提高大语言模型 (LLM) 的数据效率。通过引入“测地线假设”,STP 将隐藏状态轨迹限制在语义流形的管状邻域内,并在 NL-RX-SYNTH 等数据集上实现了以 1/16 的数据量达到基准模型全数据训练的性能。
TL;DR
如果我们可以通过数学证明语言在深层空间中是“走直线”的,那么 LLM 是否还需要那么多训练数据?Yann LeCun 与其团队在最新论文中给出了肯定的回答。他们提出的 Semantic Tube Prediction (STP) 机制,通过将 LLM 的隐藏状态约束在一条“语义管”内,成功在 1/16 的数据量下达到了 SOTA 性能,直接挑战了著名的 Chinchilla Scaling Laws。
痛点深挖:为什么 Next-token Prediction 还不够?
目前的 LLM 训练主要依赖 Next-token Prediction (NTP),即预测下一个词元。作者指出,NTP 本质上是一个局部目标,它无法区分语义信号(Signal)和统计噪声(Noise)。
在推理过程中,这种局部的误差会不断累积。正如论文中的直观比喻:如果模型在“维诺图 (Voronoi Cell)”中稍有偏差,轨迹就会跳到错误的测地线上,导致模式崩塌 (Mode Collapse)。例如,在生成关于诺贝尔奖得主的信息时,微小的隐藏状态偏移可能让模型把奖项误植给另一个人。
核心直觉:测地线假设 (The Geodesic Hypothesis)
作者引入了物理学中的“最小作用量原理”:在平滑的语义流形上,词元序列的轨迹应该是测地线 (Geodesics)。
- 局部线性:这意味着在足够短的语义跨度内,词元序列的演化接近直线。
- 语义管:如果我们将理想轨迹视为核心轴,那么所有正确的表达应该都落在这个轴周围的一个“管道”内。
(a) 语义管示意图:隐藏状态 偏离起始点 到终点 连线的垂直距离被视为噪声。
算法实现:STP 损失函数
STP 的实现极其优雅且高效。它不需要像之前的 LLM-JEPA 那样构建复杂的双视图或预测器网络,其核心 Loss 定义如下:
这里的 是序列中随机选择的三个位置。该公式本质上是在要求从 到 的语义演化方向必须与从 到 的演化方向保持一致。这种约束提升了信噪比 (SNR),滤除了那些偏离主干语义的噪声扰动。
实验与战绩:数据效率的降维打击
实验涵盖了 Llama-3、Gemma-2 等多个主流模型家族。
- 突破 Scaling Laws:在 NL-RX-SYNTH 数据集上,STP 仅需原数据集的 6.25% 即可达到基线的准确率。
- 保留多样性:在正则表达生成等任务中,STP 能够同时学会两种功能等价但表达不同的后缀模式(如
.*和.*.*),而基线模型通常会偏向其中一种(Mode Collapse)。
可以看到,STP(红色)在极小数据量下的准确率远超基线(蓝色)。
深度洞察:回归物理直觉的 AI
这篇文章最令人着迷的地方在于其对 Linear Representation Hypothesis 的统一解释。为什么 LLM 中会出现“巴黎 - 法国 + 意大利 = 罗马”这样的向量算术?在 STP 的框架下,这只是“轨迹线性”的一种自然结果。
局限性分析: 虽然 STP 表现优异,但其超参数 的调节仍需谨慎。作者发现 通常需要设得很小(约 0.01-0.08),因为真实的地理轨迹毕竟不是绝对的直线,过强的约束可能会损害模型的表达能力。
总结
Semantic Tube Prediction 证明了:大模型的研究不应该只是参数与数据的“堆料”,深刻的数学与物理直觉(如流形几何)能够提供更高效的优化路径。对于致力于在有限资源下训练高性能模型的开发者来说,STP 提供了一个几乎“免费”的性能助推器。
