[ICLR 2026] SE-RRM:符号等变性突破,让 2M 参数模型在神经推理中超越大模型
Symbol-Equivariant Recurrent Reasoning Models
本文提出了符号等变循环推理模型(SE-RRMs),一种旨在解决复杂组合逻辑问题的神经网络架构。通过在架构层面引入符号置换等变性(Symbol-Equivariance),SE-RRM 在仅有 200 万参数的情况下,在 Sudoku、ARC-AGI 和迷宫任务中显著超越了现有的 HRM 和 TRM 等循环推理模型,并展现了极强的泛化能力。
TL;DR
传统的神经网络在处理数独(Sudoku)或 ARC-AGI 等逻辑推理任务时,往往由于缺乏对“符号对称性”的感知,需要海量数据增强且外推能力极差。本文提出的 SE-RRM (Symbol-Equivariant Recurrent Reasoning Models) 通过在架构中强制实现符号等变性,仅用 200 万参数就在 9x9 数独上取得了极高的完解率,并成功外推至 4x4 到 25x25 等未见规模,效率与泛化性能远超 SOTA。
核心痛点:为什么神经网络“不识”数独?
在数独中,数字 1 到 9 只是占位符,如果把所有 1 替换成 9,其逻辑结构完全不变。然而,现有的循环推理模型(RRMs)将每个符号映射为独立的 Embedding,必须通过成千上万次的数据增强(Data Augmentation)来让模型“意识到”这种置换不变性。这不仅浪费算力,更限制了模型的泛化:一旦遇到第 10 个新符号,模型就会彻底失效。
技术直觉:引入符号维度的等变架构
作者的核心 Insight 是:不要让模型去“学习”置换对称性,而要在架构上“强制”对称。
1. 从 2D 到 3D 的升维
传统的 RRM 处理的是 (Position, Feature) 的二维矩阵。SE-RRM 引入了第三个维度 (Symbol),将输入表示为 (Dimension, Position, Symbol) 的三维张量。对于所有普通符号,使用相同的向量进行 Embedding,仅对 Mask 等特殊符号保留独立 Embedding。
2. 轴向注意力 (Axial-Attention)
SE-RRM block 不再是简单的 Transformer 层,而是交替执行两个方向的注意力:
- T(D, I):沿位置维度(I)进行自注意力,捕捉空间约束。
- T(D, K):沿符号维度(K)进行自注意力,处理符号间的逻辑关系。
左图为传统 TRM,右图为具备符号等变性的 SE-RRM,注意其增加了符号维度的链接。
实验战绩:以小博大的外推奇迹
1. 数独外推性实验
SE-RRM 在 9x9 数独上训练后,直接在其他尺寸上进行 Zero-shot 测试:
- 4x4 规模:SE-RRM 完解率 (FSR) 达到 95.46%,而 HRM 和 TRM 均为 0%。
- 16x16 规模:虽然 FSR 挑战极大,但 SE-RRM 的网格准确率 (GPA) 仍有 51.95%,展现了极强的规则理解力。
表 1 显示了 SE-RRM 在跨规模任务上的统治级表现。
2. 极简的数据增强
在复杂的 ARC-AGI 任务中,传统的 TRM 需要 1000 倍的数据增强来覆盖颜色变化。而 SE-RRM 凭借架构自带的等变性,仅需 8 次 基本变换(如旋转、镜像)即可达到甚至超越 baseline 的效果。
深度洞察
SE-RRM 的成功标志着“结构胜于规模”的回归。在 LLM 狂热的背景下,这项工作提醒我们:对于具有严密逻辑和对称性结构的科学问题(如物理公式推导、化学分子匹配),针对性地设计具备 Inductive Bias(归纳偏置) 的紧凑模型,比暴力堆砌参数更加优雅且高效。
局限性与展望
虽然 SE-RRM 在符号类任务表现惊人,但在处理具有明确语义差异的符号(如迷宫中的“墙”与“路径”不可等变)时,仍需手动“打破”对称性。未来的研究方向在于如何让模型自动识别哪些维度需要等变,哪些维度需要特异化。
总结
SE-RRM 以 2M 的极小体量,证明了显式编码对称性是通往鲁棒、可扩展神经推理的关键路径。这不仅是对数独的降维打击,更是对未来 AI 解决硬核组合优化问题的有力启示。
