Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
研究者把人类第一视角操作物体的视频转换成18,561小时的机器人训练数据,覆盖15种机器人形态,并验证它是否真能提升机器人策略的泛化能力
训练机器人熟练操作物体需要大量多样的示范数据,但直接用机器人采集示范既贵又慢。Ego2Robot是一套流水线,通过动作对齐、视觉对齐和质量筛选,把人类第一视角操作视频转换成机器人训练数据,最终生成覆盖15种机器人形态、总计18,561小时的数据。将这些合成数据与真实机器人数据混合预训练后,在未见过的视觉、场景布局、机器人形态和语言表达等条件下成功率持续提升,并在真实机器人上也得到验证。
METAL MEDIA 解读图
Ego2Robot流水线:从人类视频到机器人训练数据
证据状态已报告实测结果
- 输入:第一视角操作视频来自ANT、EgoDex、ViTRA、EgoVerse四个来源、总计约1,940小时的人类第一视角手部操作视频
- 动作对齐将每帧21个手部关键点转换为平滑的机器人末端执行器轨迹,并调整速度以匹配机器人遥操作节奏
- 视觉对齐用SAM 3分割并通过图像修复抹除人类手臂,再用逆运动学求解机器人基座位置,把15种机器人手臂之一渲染合成到画面中
- 质量筛选通过三级筛选剔除逆运动学失败、自碰撞、统计异常轨迹,以及由视觉语言模型标记的语义不一致片段
- 输出:18,561小时训练数据针对15种机器人形态并行生成的数据,与真实机器人数据混合后用于预训练视觉-语言-动作模型
他们做了什么
- 团队收集了约1,940小时来自ANT、EgoDex、ViTRA、EgoVerse四个来源的人类第一视角手部操作视频,构建了包含三个阶段的流水线:动作对齐(将21个手部关键点转换为机器人末端执行器轨迹)、视觉对齐(用SAM 3分割并抹除人手臂,再通过逆运动学求解机器人基座位置并渲染合成机器人手臂)、以及多级质量筛选,剔除失败帧和轨迹。
- 该流水线被分别应用于Panda、UR5e、xArm7等15种不同的机器人手臂形态,让每段原始视频并行生成15条训练数据流,最终产出总计18,561小时的合成机器人训练数据,是迄今为止规模最大的人类到机器人转换数据集。
- 为了精确衡量泛化能力,作者对RoboTwin2.0基准进行扩展,使视觉外观(背景、光照、机器人颜色)、场景布局(桌面高度、干扰物、相机偏移)、机器人形态(替换成不同机械臂)、任务语义(未见物体、改写后的指令)这四个维度可以被单独、解耦地测试,而不是像以往那样多种扰动混在一起评估。
- 相比仅用真实机器人数据(约6,565小时,来自DROID、AgibotWorld、InternData)预训练的基线,将合成数据与真实数据按1:1混合预训练后,在RoboTwin随机化设置下成功率达到53.5%(比纯机器人基线高2.6个百分点),并在背景(+4)、光照(+8)、机器人颜色(+6)、相机偏移(+6)、未见物体(3:1比例下+11)、改写指令(1:1比例下达到69%)等多项指标上均有提升。
- 在真实的ARX ACone机器人上进行的五项任务测试(把水果放进篮子、把积木放进抽屉、叠毛巾、扫垃圾、插螺丝)中,同时使用遥操作示范和合成数据训练的模型在全部五项任务上都优于仅用机器人数据训练的模型,其中放积木任务提升14分、插螺丝任务提升13分,提升幅度最大。

| Pretraining | RoboTwin | Per-Dimension (RoboTwin) | EBench | ||||
|---|---|---|---|---|---|---|---|
| Clean | Rand | Visual | Scene | Embody | Task | Avg | |
| Robot-only | 62.2 | 50.9 | 61.4 | 52.9 | 23.8 | 46.2 | 39.6 |
| Ego2R+Robot (1:3) | 61.4 –0.8 | 51.0 +0.1 | 61.2 –0.2 | 52.5 –0.4 | 21.9 –1.9 | 49.5 +3.3 | 47.4 +7.8 |
| Ego2R+Robot (3:1) | 64.1 +1.9 | 49.2 –1.7 | 62.7 +1.3 | 54.3 +1.4 | 28.2 +4.4 | 51.6 +5.4 | 51.7 +12.1 |
| Ego2R+Robot (1:1) | 68.1 +5.9 | 53.5 +2.6 | 67.3 +5.9 | 56.9 +4.0 | 27.2 +3.4 | 54.1 +7.9 | 49.8 +10.2 |

| Pretraining | Visual | Scene | Embodiment | Task | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| BG | Light | Color | Height | Clutter | Camera | ARX | UR5 | Franka | Obj | Lang | |
| Robot-only | 66.6 | 58.2 | 59.4 | 60.1 | 48.3 | 50.4 | 44.1 | 20.2 | 7.0 | 29.3 | 63.1 |
| Ego2R+Robot (1:3) | 65.0 –1.6 | 58.3 +0.1 | 60.3 +0.9 | 58.6 –1.5 | 49.3 +1.0 | 49.6 –0.8 | 43.7 –0.4 | 17.6 –2.6 | 4.5 –2.5 | 36.8 +7.5 | 62.2 –0.9 |
| Ego2R+Robot (3:1) | 65.5 –1.1 | 60.9 +2.7 | 61.8 +2.4 | 62.0 +1.9 | 49.2 +0.9 | 51.6 +1.2 | 47.6 +3.5 | 31.4 +11.2 | 5.6 –1.4 | 40.0 +10.7 | 63.1 +0.0 |
| Ego2R+Robot (1:1) | 70.3 +3.7 | 65.8 +7.6 | 65.8 +6.4 | 62.4 +2.3 | 52.0 +3.7 | 56.3 +5.9 | 51.2 +7.1 | 25.0 +4.8 | 5.3 –1.7 | 39.6 +10.3 | 68.5 +5.4 |
| Robot | DOF | Gripper (mm) | Reach (m) |
|---|---|---|---|
| Panda | 7 | 0–80 | 1.272 |
| Kinova Gen3 | 7 | 0–85 | 1.337 |
| IIWA | 7 | 0–85 | 1.411 |
| Sawyer | 7 | 14–79 | 1.420 |
| FR3 | 7 | 0–80 | 1.272 |
| xArm7 | 7 | 0–85 | 1.290 |
| UR5e | 6 | 0–85 | 1.236 |
| UR10e | 6 | 0–85 | 1.627 |
| Jaco | 6 | 0–125 | 1.200 |
| ViperX | 6 | 15–87 | 0.911 |
| WidowX | 6 | 11–55 | 0.787 |
| ARX-L5 | 6 | 0–88 | 0.855 |
| Piper | 6 | 0–70 | 0.883 |
| YAM | 6 | 4–75 | 0.866 |
| Aloha-Agilex | 6 | 7–102 | 0.853 |
| Task | Step 1 | Step 2 | Step 3 | Step 4 |
|---|---|---|---|---|
| Put Fruits | 33.3 | 33.3 | 33.3 | — |
| Put Blocks | 25 | 25 | 25 | 25 |
| Fold Towel | 50 | 50 | — | — |
| Sweep Trash | 25 | 25 | 25 | 25 |
| Insert Screw | 25 | 25 | 25 | 25 |

| Task | Pi0.5 | Robot-only | Ego2R (1:3) | Ego2R (3:1) | Ego2R (1:1) | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| Clean | Rand | Clean | Rand | Clean | Rand | Clean | Rand | Clean | Rand | |
| adjust_bottle | 62.0 | 18.0 | 94.0 | 77.0 | 92.0 | 79.0 | 100.0 | 72.0 | 89.0 | 91.0 |
| beat_block_hammer | 48.0 | 16.0 | 63.0 | 27.0 | 64.0 | 56.0 | 57.0 | 18.0 | 65.0 | 71.0 |
| blocks_ranking_rgb | 74.0 | 16.0 | 56.0 | 60.0 | 64.0 | 63.0 | 49.0 | 43.0 | 78.0 | 60.0 |
| blocks_ranking_size | 32.0 | 0.0 | 30.0 | 22.0 | 46.0 | 21.0 | 43.0 | 7.0 | 52.0 | 16.0 |
| click_alarmclock | 44.0 | 56.0 | 96.0 | 93.0 | 100.0 | 87.0 | 100.0 | 85.0 | 100.0 | 100.0 |
| click_bell | 32.0 | 40.0 | 100.0 | 95.0 | 100.0 | 94.0 | 100.0 | 93.0 | 100.0 | 100.0 |
| dump_bin_bigbin | 72.0 | 70.0 | 54.0 | 73.0 | 72.0 | 69.0 | 81.0 | 76.0 | 86.0 | 72.0 |
| grab_roller | 94.0 | 46.0 | 98.0 | 71.0 | 68.0 | 48.0 | 91.0 | 64.0 | 89.0 | 63.0 |
| handover_block | 16.0 | 0.0 | 5.0 | 2.0 | 18.0 | 4.0 | 39.0 | 9.0 | 36.0 | 9.0 |
| handover_mic | 26.0 | 4.0 | 69.0 | 13.0 | 86.0 | 34.0 | 83.0 | 17.0 | 97.0 | 23.0 |
| hanging_mug | 10.0 | 4.0 | 14.0 | 16.0 | 14.0 | 9.0 | 12.0 | 9.0 | 10.0 | 10.0 |
| lift_pot | 8.0 | 2.0 | 93.0 | 28.0 | 84.0 | 14.0 | 95.0 | 44.0 | 93.0 | 44.0 |
| move_can_pot | 28.0 | 0.0 | 47.0 | 50.0 | 30.0 | 40.0 | 42.0 | 85.0 | 47.0 | 65.0 |
| move_pillbottle_pad | 60.0 | 44.0 | 63.0 | 60.0 | 68.0 | 69.0 | 41.0 | 67.0 | 74.0 | 82.0 |
| move_playingcard_away | 90.0 | 52.0 | 74.0 | 58.0 | 88.0 | 92.0 | 88.0 | 42.0 | 92.0 | 63.0 |
| move_stapler_pad | 22.0 | 6.0 | 23.0 | 19.0 | 34.0 | 21.0 | 30.0 | 13.0 | 43.0 | 31.0 |
| open_laptop | 68.0 | 20.0 | 77.0 | 61.0 | 74.0 | 56.0 | 64.0 | 46.0 | 75.0 | 58.0 |
| open_microwave | 26.0 | 8.0 | 77.0 | 59.0 | 42.0 | 29.0 | 37.0 | 32.0 | 50.0 | 25.0 |
| pick_diverse_bottles | 56.0 | 18.0 | 60.0 | 37.0 | 58.0 | 53.0 | 71.0 | 50.0 | 70.0 | 50.0 |
| pick_dual_bottles | 82.0 | 14.0 | 91.0 | 59.0 | 80.0 | 77.0 | 83.0 | 55.0 | 97.0 | 54.0 |
| place_a2b_left | 60.0 | 10.0 | 40.0 | 55.0 | 58.0 | 42.0 | 54.0 | 48.0 | 73.0 | 44.0 |
| place_a2b_right | 58.0 | 14.0 | 42.0 | 49.0 | 52.0 | 41.0 | 53.0 | 51.0 | 64.0 | 53.0 |
| place_bread_basket | 68.0 | 44.0 | 75.0 | 55.0 | 72.0 | 64.0 | 76.0 | 59.0 | 79.0 | 62.0 |
| place_bread_skillet | 86.0 | 46.0 | 76.0 | 41.0 | 76.0 | 50.0 | 80.0 | 61.0 | 87.0 | 53.0 |
| place_burger_fries | 90.0 | 78.0 | 96.0 | 83.0 | 98.0 | 81.0 | 97.0 | 88.0 | 96.0 | 88.0 |
| place_can_basket | 40.0 | 0.0 | 49.0 | 25.0 | 38.0 | 9.0 | 34.0 | 15.0 | 34.0 | 16.0 |
| place_cans_plasticbox | 94.0 | 74.0 | 90.0 | 68.0 | 54.0 | 68.0 | 97.0 | 59.0 | 70.0 | 59.0 |
| place_container_plate | 96.0 | 58.0 | 86.0 | 76.0 | 92.0 | 79.0 | 93.0 | 73.0 | 93.0 | 81.0 |
| place_dual_shoes | 54.0 | 12.0 | 50.0 | 30.0 | 34.0 | 27.0 | 35.0 | 17.0 | 35.0 | 19.0 |

研究结果
- 在RoboTwin随机化设置下,将Ego2R合成数据与真实机器人数据按1:1混合预训练的模型达到53.5%成功率,比纯机器人预训练高2.6个百分点,同时在标准清洁设置下仍保持68.1%的成功率。
- 在1:1混合比例下,视觉相关的各项指标分别提升:背景+4、光照+8、机器人颜色+6、相机偏移+6。
- 未见物体的泛化能力从29%提升到40%(3:1比例下提升11个百分点),改写后的指令在1:1比例下成功率达到69%。
- 在替换不同机器人形态的跨形态测试中,ARX从44%提升到51%,UR5在3:1比例下达到峰值31%,而Franka Panda的成功率始终低于7%。
- 在真实的ARX ACone机器人五项任务测试中,同时使用遥操作示范和流水线转换数据训练的模型在全部任务上都优于仅用机器人数据训练的模型,其中放积木和插螺丝任务提升幅度最大。
可应用场景
- 缺乏大量真实示范数据的新机器人手臂或新任务,可以参考这种方法,利用已有的人类操作视频来补充预训练数据。
- 背景、光照、物体和指令表达经常变化的服务型机器人场景,可以考虑把多样化的人类视频作为辅助训练数据来源以提升稳健性。
- 需要同时支持多种机器人型号的项目,可以参考这种将同一段人类视频并行渲染成多种机器人形态的方法。

局限与待验证事项
- 手部动作只被转换成简单的平行夹爪运动,因此该方法不能直接推广到需要精细手指操作的灵巧多指机械手。
- 视觉合成依赖图像修复和基于深度的合成技术,在严重遮挡或复杂光照条件下可能产生视觉瑕疵。
- 评估范围局限于RoboTwin2.0所涵盖的任务,尚未验证在更广泛任务和机器人配置下是否同样有效。
- 对于与训练所用机器人形态运动学差异较大的机器人(如Franka Panda),跨形态迁移成功率低于7%,说明该方法带来的收益在不同机器人类型间并不均匀。
为什么重要
机器人学习最大的瓶颈之一是真实机器人示范数据的采集成本高、速度慢,如果能把网络上大量已存在的人类第一视角操作视频自动转换成可用的机器人训练数据,就有可能大幅降低数据获取成本。尤其是这种方法专门提升了模型在陌生背景、陌生机器人形态、陌生物体和不同措辞指令下的稳健性,这对把机器人真正部署到不可预测的真实环境中具有直接意义。
本文术语
- 第一视角(egocentric)视频 · 由佩戴在头部或身体上的摄像头拍摄的、以拍摄者自身视角记录手部操作物体过程的视频
- VLA模型(视觉-语言-动作模型) · 接收摄像头画面和语言指令作为输入,直接输出机器人应执行动作的人工智能模型
- 逆运动学(IK) · 计算机械臂各关节角度,使其末端执行器到达指定位置和姿态的方法
- 分布外泛化(OOD generalization) · 模型在训练时未见过的背景、物体、机器人形态或表达方式下仍能保持良好表现的能力
- 末端执行器(EEF) · 机械臂末端实际与物体接触的部分,例如夹爪
论文原文摘要(英文)
Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present Ego2Robot, a scalable pipeline that con
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Ye Wang et al., arXiv:2608.02580, arxiv-nonexclusive