PAPER2026年9月25日
生成、跟踪、改进:用 RL 微调运动生成器实现感知的多技能人形机器人运动
通用人形机器人需要的运动控制器必须同时具备多技能、感知、动态与足够的鲁棒性,才能去到人能去的地方。本文提出一个两层运动架构:(1)一个感知的流匹配运动生成器,从原始深度图规划全身轨迹;(2)一个用控制引导强化学习(CLF-RL)训练的感知跟踪策略,负责实时跟上这些动作。两张策略都训练在一个由动力学优化后的人体数据构建的、与地形一致的运动片段库上,因此既有准确的速度跟踪,又有与地形一致的参考。核心贡献是一个简单而有效的离线(off-policy)RL 微调环,用来改进运动生成器:配合生成器使用一种结构化搜索方法采数据,再做优势加权回归。这个离线环比在线的残差微调样本效率高得多,并且在没见过的几何与技能组合上提升了地形一致性——成功通过地形的比例最高提升 25 个百分点,技能选择最高提升 80 个百分点。因为直接用原始深度图感知环境,不需要里程计与高度图,室外部署很轻松;两个相机让策略能更早看到地形,无论指令速度是多少都能自主调速以通过地形。同一对策略让一台 Unitree G1 人形机器人在室外环境中行走、奔跑、站立、跳上跳下箱子并上下楼梯。项目主页:https://zolkin1.github.io/generate-track-improve/
Zachary Olkin, William D. Compton, Aaron D. Ames
Humanoid LocomotionPerceptive Locomotion强化学习流匹配