提出具身操作的数据金字塔框架,分析多数据源(耦合观测、物理状态与动作)对具身agent的差异化贡献,指导具身智能数据构建。
通用机器人需要推理自身行为,融合感知、世界知识、规划、成功检测、恢复和底层控制。现有方法试图通过大规模预训练将所有能力融入学习策略。我们提出将这些能力分解为语言条件控制代理和高层编排器。Pigey编排器在推理时闭环运行:前沿VLM规划子目标、选择冻结后端执行、验证结果、失败时恢复。在LIBERO-PRO上提升4倍(12.8%→53.3%),在真实机器人上将冻结策略从近零提升到90%以上,无需额外数据采集或训练。
面向高等教育的知识驱动生成式社交机器人Teachy Mini的开发与初步评估。
针对未知动力学的机会约束运动规划,提出一致性约束收紧方法。
机器人通过投影视觉抽象学习交流的研究。
面向任意取向顺应轴的在线变阻抗控制模块化框架,即插即用。
复杂场景的实用机器人抓取需要3D感知与语言引导,本方法支持多种机器人本体。
多模态大模型在视觉理解上进展显著但存在空间推理幻觉,Geo3R 通过几何关系缓解该问题。
现有视觉语言模型大多缺乏3D感知,本文融合隐式与显式几何构建3D感知VLM。
大型视觉语言模型视觉推理强但鲁棒性不足,本工作用一致性约束增强其鲁棒性。
大规模语言模型能力强,本文研究从零开始的原生多模态预训练的规模化方法。
多模态大模型正成为航空任务的核心,本工作提出零样本任务级评估框架。