[CVPR 2026 预测] AoE 系统:让数十亿手机变身具身智能“矿机”,采集效率提升百倍

AoE: Always-on Egocentric Human Video Collection for Embodied AI

总结
问题
方法
要点
摘要

本文提出了 Always-on Egocentric (AoE) 系统,一个利用普及的智能手机和人体工程学挂脖支架,实现大规模、低成本、全场景第一视角(Egocentric)交互数据采集的框架。通过端云协同架构,该系统大幅降低了具身智能(Embodied AI)的数据获取门槛,并在真实世界机器人任务中取得了显著的 SOTA 性能提升。

TL;DR

具身智能领域正面临严重的“数据饥渴”。传统的机器人采集方式要么太贵,要么太慢。Ant Group 等团队提出的 AoE (Always-on Egocentric) 系统打破了这一僵局:只需一个 20 美元的挂脖支架和一部智能手机,就能将普通人的日常生活转化为高质量的机器人训练数据。实验结果显示,这些来自人类的“第一视角”数据能显著提升人形机器人在复杂任务中的成功率。

背景定位:具身智能的 Scaling Law 缺燃料了吗?

大模型(LLMs)的成功依赖于互联网规模的文本数据,但机器人(Embodied AI)在物理世界的交互数据却极其稀缺。

  • 昂贵的 Teleoperation:一套方案动辄数万美元,无法大规模扩展。
  • 笨重的 Wearables:戴着 VR 头显生活极不自然,采集的数据存在偏差。
  • AoE 的定位:它是首个真正实现“Anyone, Anytime, Anywhere”采集的工业级分布式系统,将数据成本从数千美元压缩至 20 美元以内。

痛点深挖:为什么以前的视频不能直接用?

现有的第一视角视频(如 Ego4D)之所以难以直接训练机器人,主要因为:

  1. 标签缺失:视频只有像素,没有 6-DoF 的手部动作和相机轨迹。
  2. 噪声巨大:大量的无效片段(晃动、遮挡)导致处理成本极高。
  3. 具身差异:人类的手和机器人的夹持器完全不同,直接模仿效果差。

方法论详解:端云协同的“数据炼金术”

AoE 系统不仅是硬件,更是一套严密的自动化处理流水线。

1. 硬件与边缘侧触发

作者设计了一款人体工程学的磁吸挂脖支架,利用手机的超广角镜头模拟人类视场。APP 端运行轻量化模型,只有检测到“手-物交互”时才会触发录制,实现了“24小时待命”且隐私保护。

2. 云端自动化标注流水线(The Core)

这是将 raw video 转化为训练资产的关键,包含六个阶段:

  • 原子动作分割:利用 Qwen2.5-VL-235B 等多模态大模型将长视频切分为有语义意义的小段。
  • 3D 重建与轨迹恢复:通过 MegaSAMHaWoR 等算法,在 3D 空间内还原手部关节点和相机的 6-DoF 轨迹。
  • 数据增强(Generative Augmentation):采用类似 Masquerade 的方法,用生成式模型将人类的手“擦除”并“修复”成机器人的夹爪,甚至替换背景以增加场景多样性。

模型架构图 图1:AoE 系统概览:从挂脖手机采集到端云协同自动标注

实验与结果:人类数据真的是机器人的“补药”吗?

团队在 Unitree G1 人形机器人上进行了严格测试。

1. 精度验证

AoE 恢复出的手部动作和相机轨迹误差极小。在 ATE(绝对轨迹误差)指标上,即便只有单目 RGB 输入,也能保持厘米级的精度。

2. 真实任务表现

在“关闭笔记本电脑”这一精细操作任务中:

  • 仅用机器人数据:成功率 45%。
  • 机器人 + AoE 人类数据:成功率升至 95%! 而在“倒豆子”这种涉及流体和长时程技能的任务中,如果没有 AoE 提供的先验知识,机器人几乎无法入门(0% -> 20%)。

实验结果对比 表1:加入 AoE 数据后的任务成功率(SR)显著提升

3. Scaling Behavior(规模效应)

实验观察到,哪怕机器人本身的演示数据很少(只有 10 组),只要喂入 200 组 AoE 人类数据,模型就能展现出极强的迁移能力。这证明了人类视频中蕴含的“物理规律”是可以跨载体学习的。

深度洞察:具身智能的“Uber 模式”

AoE 的核心贡献不仅在于算法,更在于提供了一套分布式数据生产系统

  • 低延迟:通过边缘节点,上传延迟从 500ms 降至 100ms。
  • 弹性扩展:基于 K8s 的架构可以同时承载数千个采集终端。 这种“人人参与”的模式,预示着未来具身智能数据采集可能会像外卖配送一样,通过众包模式在全球范围快速铺开。

局限性与展望

尽管 AoE 表现惊艳,但在处理柔性物体(如叠围巾)时仍受限于硬件控制频率和延迟。未来,研究团队计划开源大规模 Egocentric 视频数据集,并进一步探索如何从这些海量的人类演示中挖掘出更复杂的“通用操作技能”。


总结 (Takeaway):AoE 告诉我们,通往 AGI(通用人工智能)的物理路径不一定非得堆昂贵的平衡车或机械臂,利用好每个人口袋里的智能手机,可能才是通往 Scaling Law 的捷径。

发现相似论文

试试这些示例

  • 查找最近一年内利用人类第一视角视频进行大规模具身智能预训练(Pre-training)的 SOTA 论文。
  • 哪篇论文首次提出了将人类手部交互动作重定向(Retargeting)到异构机器人末端执行器的核心理论,本文采用了哪种演进方法?
  • 调研目前有哪些在具身智能领域应用生成式 AI(如扩散模型)进行数据增强或背景修复(Inpainting)的最新研究?
目录
[CVPR 2026 预测] AoE 系统:让数十亿手机变身具身智能“矿机”,采集效率提升百倍
1. TL;DR
2. 背景定位:具身智能的 Scaling Law 缺燃料了吗?
3. 痛点深挖:为什么以前的视频不能直接用?
4. 方法论详解:端云协同的“数据炼金术”
4.1. 1. 硬件与边缘侧触发
4.2. 2. 云端自动化标注流水线(The Core)
5. 实验与结果:人类数据真的是机器人的“补药”吗?
5.1. 1. 精度验证
5.2. 2. 真实任务表现
5.3. 3. Scaling Behavior(规模效应)
6. 深度洞察:具身智能的“Uber 模式”
7. 局限性与展望