[arXiv 2026] PhysMem:让机器人像科学家一样通过“交互”自发进化物理直觉
Transformers converge to invariant algorithmic cores
本文提出了 PhysMem,一个使视觉语言模型(VLM)机器人规划器能够通过交互在测试时学习物理原理的记忆框架。该方法无需更新模型参数,通过“科学记忆循环”实现从经验记录到假设验证,最终提炼出指导决策的物理准则,在多项操纵任务中显著提升了成功率。
TL;DR
机器人能否在不重新训练大模型的情况下,仅通过 30 分钟的“摸索”就学会某种物体的物理特性?斯坦福与 UCSD 联合团队提出的 PhysMem 记忆框架给出了肯定答案。它让 VLM 规划器通过一套 “记录(Record)- 假设(Hypothesize)- 验证(Verify)- 推广(Promote)” 的科学循环,将交互后的挫败转化为深刻的物理准则,实现了测试时的自我演进。
1. 痛点:VLM 懂得“物理概念”,却不懂“物理现实”
Vision-Language Models (VLMs) 能够背诵摩擦力、重心和动量的定义,但在面对具体的物理任务时,它们往往表现得像个“书呆子”:
- 无法预测:它知道摩擦力,但不知道这个足球在特定草皮上能滚多远。
- 经验教条:传统的检索增强(RAG)方法只会盲目复现之前的动作,一旦环境微变(如零件形状稍有不同),就会导致连环失败。
- 缺乏反馈闭环:现有的 VLA 模型很难从单次失败中抽象出通用的“教训”。

2. 核心机制:科学记忆循环 (Scientific Memory Loop)
PhysMem 的核心直觉是:人不会记住每一次接触,但会形成紧凑的物理准则。 它构建了一个三层记忆架构:
- 情节记忆 (Episodic Memory):记录原始交互(观测、动作、结果)。
- 工作记忆 (Working Memory):对失败或“惊喜”进行聚类,生成候选假设(如:“如果零件是 L 型,避开中心位置”)。
- 长期记忆 (Long-term Memory):只有经过多次交互验证、置信度达标的假设,才会被提升为“物理准则 (Principles)”。
动作级归因 (Action-Level Attribution)
为了排除执行噪声,PhysMem 不仅看任务是否成功,更关注特定动作的结果。通过公式计算假设的置信度: 这种机制确保了只有真正反映物理规律的规律会被保留。
3. 架构解析:从“惊喜”中学习
PhysMem 引入了 共振检查 (Resonance Checking) 机制。当机器人的交互结果与当前持有的物理准则不一致时,会产生一个低共振分值。这被定义为一次“惊喜”,触发系统进行知识更新。
(图:验证过的准则和待测假设被以结构化形式注入 VLM 的 Prompt 中,引导其进行推理)
4. 实验战绩:显著的演进曲线
研究团队在 零件组织(零件堆叠)、球类导航(推球过障)和平衡堆叠(石头叠石块) 三个高难度任务上进行了验证。
- 学习曲线:在球类导航任务中,系统的“共振分值”从早期的 0.2(充满意外)快速攀升至 10 个回合后的 0.9(尽在掌握)。
- 准则抽象的效果:在砖块插入实验中,PhysMem 依靠提炼的物理准则达到了 76% 的成功率,而直接检索 raw 经验的方法仅有 23%。
- 零样本迁移与自适应:当更换了不同摩擦力的球体时,拥有前期准则的系统能迅速通过测试时自适应(Test-time Adaptation)修正错误的经验,将成功率从 10% 挽救回 40%。
(图:各任务中“共振分值”随交互次数的单调上升,表明系统确实获取了物理直觉)
5. 深度洞察:为什么“抽象”胜过“检索”?
本文揭示了一个深刻的道理:现实情况永远不会精确重复。
单纯的记忆匹配在复杂的具身任务中非常脆弱。PhysMem 的成功在于它实现了 从“记住发生了什么”到“理解为什么发生”的跨越。通过“记忆折叠 (Memory Folding)”技术,它将冗长的经验压缩成几条人类可读的准则(如:AVOID Pushing at high speed near Obstacle 1),这不仅节省了 Token 开销,还解决了长序列决策中的噪声累积问题。
6. 总结与展望
PhysMem 为解决 VLM 的“物理接地(Physical Grounding)”问题提供了一个极具启发性的框架。尽管目前它主要聚焦于高层规划而非闭环控制,且依赖视觉反馈,但其“科学循环”的思想完全可以扩展到触觉、力觉等传感器频率更高的任务中。
正如亚里士多德所言:“对于我们必须学习才能做的事情,我们通过做这些事情来学习。” PhysMem 正是赋予了机器人这种“在做中学”的能力。
致谢:本文基于 Stanford 与 UCSD 的研究工作《Learning Physical Principles from Interaction》重构。
