论文提出HyperDCM,把RGB观测转为场景图并映射到Poincaré双曲空间,再用结构敏感动态聚类维护回放样本,缓解扩散导航策略跨场景训练的灾难性遗忘。
SDPG 用同一名义轨迹周围的随机动作扰动估计平滑策略梯度,只批量渲染少量名义环境,并用大量无渲染物理环境计算回报差。论文在视觉 MuJoCo 与多类机器人任务上实现单张 RTX 4080 的端到端训练,并在 Unitree Go2 上验证零样本 sim-to-real 迁移。
UMR 框架通过学习稠密点云对应关系实现人形运动重定向,无需手动映射,提升可扩展性与细节还原能力。
提出端到端感知跑酷框架,将原始深度图与本体感受直接映射为关节动作,结合地形边缘检测、足部体积点防边缘滑落机制与平坦区域采样抑制奖励作弊,全尺寸人形机器人实测最高 2.5 m/s 穿越复杂非结构化地形。
CReF 提出单阶段、直接以深度图+本体感知映射到关节目标的视觉人形运动框架:本体感知查询的跨模态注意力、门控残差融合与 GRU 高速公路门控循环融合从原始前向深度提取运动相关特征,并引入基于足端点云可支撑候选的地形感知落脚奖励。仿真中在楼梯/间隙/平台三类地形全部难度档取得领先,零样本部署到 AGIBOT X2 Ultra,在带扶手楼梯、镂空托盘、强反光与杂乱户外场景中稳定行走。
RoboGesture 让人形机器人听懂语音并实时做手势:300 余类手势数据集,分层语义-声学对齐提取韵律与语义线索,流式扩散生成器驱动 Unitree G1,MPC 安全滤波保真机无碰撞执行。
苏黎世联邦理工提出 ADAPT:文本条件扩散技能先验加约束残差强化学习,在 Unitree G1 上实现实时指令切换的端到端全身控制,并可通过噪声引导复用冻结先验完成风格保持的目标到达。
Physical Intelligence 提出可操控的机器人基础模型 π0.7:通过语言指令、子目标图像与任务元数据等多模态上下文条件化,在未见环境多阶段任务、零样本跨本体泛化中开箱即用,性能比肩 RL 微调专用策略,并展现涌现能力。
论文提出面向触觉具身操作的一体化范式 N₀-Foundation,覆盖硬件、数据、表示与评测四层:自研相机式触觉传感器与无机器人采集设备 N₀-TacUMI,构建超 3 万小时、6 种本体、450+ 任务的视触同步数据集 NeoData 并开源 5000 小时子集 OpenNeoData;提出以三轴稠密力场为统一监督的视触表示模型 NeoForce,实现跨传感器可迁移触觉表示;并给出真机 NeoReal(10 任务)与仿真 NeoSim(12 任务)双基准。实验表明策略收益来自物理接触状态而非触觉信号的设备外观,NeoForce 条件化使 π₀.₅ 在 NeoReal 的平均渐进分从 38.1% 提升至 47.5%。
论文将抓取算法生成的 25 个候选点转化为可退出的探索目标,用任务、探索和正则三个价值头解耦强化学习信号,并在 5000 到 10000 步之间调度优势权重。完整方法在椅子运输仿真中达到 94.1% 成功率和 4.4% 倾翻率,真机零样本完成 40/58 次未见 IKEA 物体运输。
PAMoR 把情感变成可测量的控制参数:在人形机器人自身运动学上以闭式解计算效价-唤醒度(V-A)坐标,由姿态扩展度与运动能量直接得出,无需人类标注。动作先验与两个情感先验在共享潜空间中逐去噪步复合——动作先验决定做什么,情感先验调节怎么做。全身动作在 29 自由度 Unitree G1 上自回归实时展开,动作与情感均可在线编辑;感知实验中评分者对目标情绪的识别率达 0.38,超过基线并接近真人表演动作的 0.44。
ZEST 用单阶段强化学习,把动作捕捉、单目视频和关键帧动画三类异构参考动作统一训练成模拟策略,零样本部署到 Atlas、Unitree G1 和 Spot,实现全尺寸人形机器人上首个动态多接触技能,无需接触标签、状态估计器或逐技能调参。