[CVPR 2026 预测] AoE 系统:让数十亿手机变身具身智能“矿机”,采集效率提升百倍
AoE: Always-on Egocentric Human Video Collection for Embodied AI
本文提出了 Always-on Egocentric (AoE) 系统,一个利用普及的智能手机和人体工程学挂脖支架,实现大规模、低成本、全场景第一视角(Egocentric)交互数据采集的框架。通过端云协同架构,该系统大幅降低了具身智能(Embodied AI)的数据获取门槛,并在真实世界机器人任务中取得了显著的 SOTA 性能提升。
TL;DR
具身智能领域正面临严重的“数据饥渴”。传统的机器人采集方式要么太贵,要么太慢。Ant Group 等团队提出的 AoE (Always-on Egocentric) 系统打破了这一僵局:只需一个 20 美元的挂脖支架和一部智能手机,就能将普通人的日常生活转化为高质量的机器人训练数据。实验结果显示,这些来自人类的“第一视角”数据能显著提升人形机器人在复杂任务中的成功率。
背景定位:具身智能的 Scaling Law 缺燃料了吗?
大模型(LLMs)的成功依赖于互联网规模的文本数据,但机器人(Embodied AI)在物理世界的交互数据却极其稀缺。
- 昂贵的 Teleoperation:一套方案动辄数万美元,无法大规模扩展。
- 笨重的 Wearables:戴着 VR 头显生活极不自然,采集的数据存在偏差。
- AoE 的定位:它是首个真正实现“Anyone, Anytime, Anywhere”采集的工业级分布式系统,将数据成本从数千美元压缩至 20 美元以内。
痛点深挖:为什么以前的视频不能直接用?
现有的第一视角视频(如 Ego4D)之所以难以直接训练机器人,主要因为:
- 标签缺失:视频只有像素,没有 6-DoF 的手部动作和相机轨迹。
- 噪声巨大:大量的无效片段(晃动、遮挡)导致处理成本极高。
- 具身差异:人类的手和机器人的夹持器完全不同,直接模仿效果差。
方法论详解:端云协同的“数据炼金术”
AoE 系统不仅是硬件,更是一套严密的自动化处理流水线。
1. 硬件与边缘侧触发
作者设计了一款人体工程学的磁吸挂脖支架,利用手机的超广角镜头模拟人类视场。APP 端运行轻量化模型,只有检测到“手-物交互”时才会触发录制,实现了“24小时待命”且隐私保护。
2. 云端自动化标注流水线(The Core)
这是将 raw video 转化为训练资产的关键,包含六个阶段:
- 原子动作分割:利用 Qwen2.5-VL-235B 等多模态大模型将长视频切分为有语义意义的小段。
- 3D 重建与轨迹恢复:通过 MegaSAM 和 HaWoR 等算法,在 3D 空间内还原手部关节点和相机的 6-DoF 轨迹。
- 数据增强(Generative Augmentation):采用类似 Masquerade 的方法,用生成式模型将人类的手“擦除”并“修复”成机器人的夹爪,甚至替换背景以增加场景多样性。
图1:AoE 系统概览:从挂脖手机采集到端云协同自动标注
实验与结果:人类数据真的是机器人的“补药”吗?
团队在 Unitree G1 人形机器人上进行了严格测试。
1. 精度验证
AoE 恢复出的手部动作和相机轨迹误差极小。在 ATE(绝对轨迹误差)指标上,即便只有单目 RGB 输入,也能保持厘米级的精度。
2. 真实任务表现
在“关闭笔记本电脑”这一精细操作任务中:
- 仅用机器人数据:成功率 45%。
- 机器人 + AoE 人类数据:成功率升至 95%! 而在“倒豆子”这种涉及流体和长时程技能的任务中,如果没有 AoE 提供的先验知识,机器人几乎无法入门(0% -> 20%)。
表1:加入 AoE 数据后的任务成功率(SR)显著提升
3. Scaling Behavior(规模效应)
实验观察到,哪怕机器人本身的演示数据很少(只有 10 组),只要喂入 200 组 AoE 人类数据,模型就能展现出极强的迁移能力。这证明了人类视频中蕴含的“物理规律”是可以跨载体学习的。
深度洞察:具身智能的“Uber 模式”
AoE 的核心贡献不仅在于算法,更在于提供了一套分布式数据生产系统。
- 低延迟:通过边缘节点,上传延迟从 500ms 降至 100ms。
- 弹性扩展:基于 K8s 的架构可以同时承载数千个采集终端。 这种“人人参与”的模式,预示着未来具身智能数据采集可能会像外卖配送一样,通过众包模式在全球范围快速铺开。
局限性与展望
尽管 AoE 表现惊艳,但在处理柔性物体(如叠围巾)时仍受限于硬件控制频率和延迟。未来,研究团队计划开源大规模 Egocentric 视频数据集,并进一步探索如何从这些海量的人类演示中挖掘出更复杂的“通用操作技能”。
总结 (Takeaway):AoE 告诉我们,通往 AGI(通用人工智能)的物理路径不一定非得堆昂贵的平衡车或机械臂,利用好每个人口袋里的智能手机,可能才是通往 Scaling Law 的捷径。
