内存即矩阵:通过马尔可夫状态扩展实现 LLM 的“零遗忘”进化
Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping
本文提出了一个基于马尔可夫矩阵(Markov Matrix)的 LLM 知识扩展框架,将自回归生成建模为 token 间的状态转移。核心方法是通过 Token-to-Dictionary Mapping 进行 Embedding Tuning,实现了在不改变模型原有参数的情况下,以极高的样本效率注入新知识,并达成 SOTA 级的零遗忘(Zero Forgetting)表现。
TL;DR
如何在不破坏模型“原有记忆”的前提下,教大模型学会一个新单词或新技能?本文提出了一种极具物理直觉的方法:将 LLM 生成看作马尔可夫链的转移过程,通过Token-to-Dictionary Mapping,只需微调新 token 的 Embedding,就能以极低成本(~500样本)实现新知识注入,且在数学上彻底杜绝了灾难性遗忘。
1. 痛点:权重更新的“牵一发而动全身”
在动态变化的世界中,LLM 需要不断吸收新词(如“COVID-19”、“DOGE”)。然而,目前的微调(Full Fine-tuning)或 LoRA 就像是在老建筑上动大手术,稍有不慎就会导致地基塌陷——这就是灾难性遗忘。
作者观察到一个深刻的矛盾:现代 LLM 表达能力极强,学习一点点新知识,真的需要动用数以亿计的参数权重吗?答案是否定的。
2. 核心直觉:生成即马尔可夫过程
作者将 LLM 的推理抽象为一个一阶马尔可夫过程:
- 状态 (States):词表中的每个 Token。
- 转移概率 (Transitions):模型预测下一个 Token 的概率分布。
- 记忆 (Memory):由 规模的转移矩阵表示。
在此框架下,注入新知识变成了状态空间的扩充。只要我们不改变原有 token 之间的转移关系(即不改动模型 backbone 参数),原有的记忆就会被完美保留。
3. 方法论:Token-to-Dictionary Mapping
新 Token 的语义不需要重新发明,它可以被看作是词表中已有 Token 的某种组合。
具体步骤:
- 词表扩充:在 Embedding 层增加新 Token 的行。
- 嵌入微调 (Embedding Tuning, ET):只训练新 Token 的嵌入向量,将其优化为现有 Token 字典的稀疏线性组合。
- 架构恒定:模型的所有线性层、Attention 层全部冻结。
(上图为 ET 方法在算子学习中的表现,展示了极佳的样本效率)
理论保证
作者证明了一个关键的样本复杂度界限:学习一个新 token 的样本需求 与其映射到的有效已有 token 数量 (稀疏度)成正比,即 。这意味着学习成本取决于知识的复杂程度,而非模型参数量。
4. 实验验证:惊人的“零遗忘”
案例 A:让特殊 Token 学会乘法
在 Llama-3.2-3B 上,作者教模型一个新符号 <spec> 代表乘法(a <spec> b = a * b)。
- 全参数微调 (FFT):虽然学会了乘法,但在做加法任务时,准确率从 100% 直降至 0%!模型把所有加法也当成了乘法。
- Embedding Tuning (ET):加法准确率稳居 100%,同时乘法准确率甚至超过了基线模型。
(表 1:FFT 导致严重的灾难性遗忘,而 ET 实现了完美的知识保留)
案例 B:跨语言词汇扩展
在西班牙语、德语和阿拉伯语的扩展测试中,ET 同样展现出极强的韧性。尤其在处理与英语差异巨大的阿拉伯语时,相比 FFT 可能导致的 10% 以上的英语能力下降,ET 的遗忘率几乎为零。
(图 2:随着测试样本增加,ET 维持了零遗忘,而 LoRA 和 FFT 的性能随着学习深入不断衰减)
5. 深度洞察
为什么 ET 甚至能比原始词汇表现更好? 作者发现,新 Token 的 Embedding 并不是简单地 1:1 映射,而是学习到了一个语义字典的稀疏组合。例如,学习乘法算子时,新 token 融合了“*”、“x”、“times”等多个相关 token 的语义信息,形成了一个更强的组合表示。
6. 总结与展望
本文的价值在于将经验性的 Embedding Tuning 提升到了理论层面。
- Takeaway:对于垂域知识注入、新实体更新,不要动权重,动 Embedding。
- 局限性:当前研究基于一阶马尔可夫简化,虽拓展到了高阶讨论,但在处理极其复杂的、需要改写模型内部逻辑推理链的任务时(如逻辑纠偏),单纯靠 Embedding 映射可能仍有上限。
这种“以静制动”的更新策略,或许是未来 LLM 实现在线、实时、无损进化的关键技术路径。
