Ego2Robot:从第一人称人类视频合成可扩展机器人数据将第一人称人类操作视频通过动作重定向、机械臂视觉合成、多级质量筛选转化为机器人训练数据,产出 18,561 小时跨 15 种机器人形态的数据,提升 VLA 模型 OOD 泛化,并在真机验证。Ye Wang, Pei Lin, Xiong-Hui Chen·2026年8月3日视觉语言动作模型RoboTwinEgo2Robot2026年8月3日