PAPER DEEP DIVE
RT-2: 视觉-语言-动作模型将网络知识迁移到机器人
RT-2 将预训练视觉-语言模型转化为机器人策略,使机器人能根据自然语言指令执行未见过的操作,展现强大的零样本泛化能力。
RT-2 将预训练视觉-语言模型转化为机器人策略,使机器人能根据自然语言指令执行未见过的操作,展现强大的零样本泛化能力。
PAPER DEEP DIVE
RT-2 将预训练视觉-语言模型转化为机器人策略,使机器人能根据自然语言指令执行未见过的操作,展现强大的零样本泛化能力。
RT-2 将预训练视觉-语言模型转化为机器人策略,使机器人能根据自然语言指令执行未见过的操作,展现强大的零样本泛化能力。

HIL-UMI 用手持 UMI 夹爪做人机在环 VLA 后训练:人在演示时,同一观测流上并行跑当前策略但不执行其预测,用 Energy Score 比较人类动作块与策略动作分布,超阈值即判为分布外(OOD)并触发定点采集;另一条回路上,在线优势预测偏低的片段被收来重训基于任务进度的优势估计器,再由它给数据打二元优势标签做优势条件行为克隆(ACBC)。四个真机任务上持续优于 SFT,Stack Cube 三轮后 TPS 84→100;对比真机 HG-DAgger,Clean Up Table 每帧采集时间 73.40ms 对 412.99ms,快 5.63 倍且末轮 TPS 高约 5 分。

VLA 策略的推理瓶颈不在视觉语言主干,而在动作头:扩散/流匹配头要跑 10 步 Euler 积分才出一个动作块,机器人只能在等待里停-走-停。IMLE-VLA 把 π0.5 的迭代动作头换成单步条件生成器,用条件隐式最大似然估计(cIMLE)训练——每步采 m 个噪声候选,把专家动作只匹配给最近的那一个候选(最近邻分配不回传梯度),其余候选因此可以自由地去覆盖别的模式,天然避免朴素回归头的模式坍缩。改动只限于动作头,3B VLM 主干完全冻结并原样保留,因此推理频率从 15 Hz 提到 55 Hz(3.67×),配合更长执行时域 H 动作吞吐最高 11.0×。LIBERO 40 任务平均成功率 98.0%,是所有对比方法里最高且同时最快;LIBERO-plus 五个等级的测试时扰动下保持 π0.5 的鲁棒性,而 OpenVLA-OFT 等基线急剧退化。真机 Franka Panda 四个任务全部超过 π0.5(19/15、18/15、15/12、16/12,每任务 20 回合),本体感受 jerk 低 2.2×–3.0×,每回合 VLA 前向耗时降 3.9×–6.6×。局限:加大 H 是拿反应性换吞吐;m=1 时退化为条件均值回归;评测集中在 LIBERO 与单臂桌面任务。

LEGS 用网格前景与三维高斯泼溅背景合成人形全身操作数据,并以运动基元自动生成演示。实验显示其训练策略在 Unitree G1 上匹敌或超过人工遥操作数据,跨场景泛化成本更低。

人类视频里什么信息能真正迁移到机器人控制?A4A 的答案不是静态可供性掩码,而是「面向动作的 4D 可供性」:语言条件下、与交互相关的 3D 点在未来一段时间的运动轨迹。几何依据是短程对应——短时域内交互点运动与末端执行器位移都可由 SE(3) 刚体/准刚体变换近似,是同一次操作转移的两种描述。作者用 HOI4D、EPIC-KITCHENS 与自采 RGB-D 构建超 8 万段语料,经 GroundingDINO + SAM 2 + CoTracker3 + LingBot-Depth 重建保身份 3D 点轨迹。训练分两阶段:先用基座 VLA 的原生目标族预测点运动残差,再把点接口换回机器人本体感受与动作接口,共享隐模块完整保留、不加额外时序网络,因此能同时套到自回归、回归、扩散与两种流匹配五种范式。LIBERO-Object 上五个策略全部提升(Octo 28.2→57.2、OpenVLA 66.4→76.4、π0 77.8→87.8);RLBench 平均 39.0→61.0,纯 RGB 执行即超过用 3D/4D 观测的 ManiGaussian(51.0);同架构只换预训练数据的对照实验 41.0→60.0,证明增益来自以交互为中心的监督;真实 Piper 六技能四策略 56.7%→72.5%。局限:大幅非刚性形变、严重滑移与反复接触切换、多圈拧盖类双臂协调。