[Physical Intelligence] MEM:让机器人拥有“长记性”,突破 15 分钟长时程作业极限
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
本文提出了 Multi-Scale Embodied Memory (MEM),一种为视觉-语言-动作模型 (VLA) 设计的多尺度具身记忆系统。该系统结合了高效的视频编码器处理短期观察记忆,以及基于语言的语义总结处理长期任务记忆,使机器人在复杂的多阶段任务中表现出卓越的 SOTA 性能。
TL;DR
在机器人领域,让机器人在完成“做一份烤奶酪三明治”或“打扫整个厨房”这类涉及多个步骤、耗时数周的任务时始终保持“清醒”,是一个巨大的挑战。Physical Intelligence 团队提出的 MEM (Multi-Scale Embodied Memory) 方案,通过将**高效视频编码(短期视觉记忆)与自然语言总结(长期语义记忆)**相结合,首次让主流 VLA 模型在保持实时推理速度的同时,具备了跨越 15 分钟的任务持续能力和基于上下文的纠错能力。
痛点深挖:为什么“记性”这么难练?
要在物理世界中执行复杂任务,机器人需要两种完全不同的记忆:
- 微观视角的短期记忆:当你伸手去拿杯子,手挡住了杯子时,机器人需要记住杯子的精确位置(解决 Self-occlusion);或者抓取失败后,需要根据刚才的感觉调整角度(In-context Adaptation)。
- 宏观视角的长期记忆:在一个长达 10 分钟的菜谱中,机器人需要知道“我已经加过盐了”或者“刚才我已经打开了第二个抽屉”。
传统方法要么死记硬背所有历史图像(计算量 O(N^2) 爆炸),要么过度压缩(丢失空间细节)。MEM 的核心洞察就在于:短时记忆要用视频流保持精度,长时记忆要用语言流保持语义。
方法论详解:多尺度具身记忆
1. 混合模态架构
MEM 将动作预测分解为高低两层策略:
- HL (High-level) 策略:负责更新
Language Memory (mt)。它将之前的语义总结和当前观察结合,生出新的任务进度描述(例如:“我已经把盘子放进碗柜了,现在去拿杯子”)。 - LL (Low-level) 策略:接收 HL 传来的子任务指令,并结合通过 Video Encoder 处理的短期视频流,输出最终的控制动作。

2. 高效视频编码器:时空分离的魔力
为了在不大幅增加延迟的情况下处理多帧图像,MEM 改装了标准的 ViT(Vision Transformer)。它在每 4 层中插入一个时间维度注意力。
- 空间注意力:负责理解单帧内的物体位置。
- 时间注意力:负责捕捉帧与帧之间的动态变化。
这种
O(K*n^2 + n*K^2)的复杂度远低于全注意力机制,使得机器人能在 4 路摄像头输入下依然保持实时响应。
实验与结果:从“健忘”到“专业”
长时程任务的突破
在“Recipe Setup”(准备菜谱原料)和“Clean up Kitchen”(清理厨房)这两个任务中,任务链条极长。实验证明,没有记忆的模型几乎无法完成(成功率接近 0),而 MEM 能够准确记住任务进度,在 15 分钟的跨度内稳步推进。

In-Context Adaptation:失败是成功之母
MEM 的另一个亮点是即时纠错。在抓取筷子等精细任务中,如果第一次尝试由于桌子高度变化失败了,MEM 能通过短期视频记忆意识到“刚才抓浅了”,从而在第二次尝试中自动调整高度。
- 无记忆模型:会原地踏步,不断尝试同样的错误动作。
- MEM 模型:表现出类似人类的“尝试-调整”策略。
深度洞察:预训练的价值
论文中一个关键的 Ablation Study 表明:在多样化的机器人和互联网视频数据上进行记忆功能的预训练至关重要。 仅仅在下游任务中微调记忆模块的效果大打折扣。这暗示了“记忆”不仅是一项架构创新,更是一种需要从海量视觉动态中习得的通用能力。
局限性与展望
尽管 MEM 实现了 15 分钟级的记忆,但距离人类级别的“终身学习”(跨越天、周、年的记忆)仍有距离。未来的探索方向包括:
- 如何构建动态更新的长期知识库?
- 如何在部署期间持续从失败中学习而不发生灾难性遗忘?
总结:MEM 为 VLA 模型插上了记忆的翅膀,证明了通过优雅的模态分离和结构压缩,可以兼顾机器人的“大局观”与“操作微操”。
