提出FutureRTC,基于预期条件动作分块实现实时机器人执行,降低VLA推理延迟,提升实时控制性能。
提出DeVA,通过物理引导实现解耦的视频-动作模型,服务于机器人策略学习与VLA,提升物理一致性。
提出τ方法,从未来视觉监督学习触觉增强的VLA模型,将触觉信号融入视觉-语言-动作框架。
研究agent系统中世界模型的安全性问题,分析世界模型可能成为假先知的风险,提出安全评估与防护方法。
提出双脑最小充分表示方法,用于视觉-语言导航,在效率与性能间取得平衡,提升具身导航的泛化。
提出实时以人为中心的世界建模方法,针对上半身人物-物体交互,服务于人形机器人交互与世界模型。
研究在世界模型中,物理空间相邻集合的动作策略优于最佳预测,为世界模型动作生成提供新视角。
提出WorldDiT,统一扩散架构同时建模世界与动作,在世界模型与动作生成上取得平衡,服务于具身智能。
提出FeelWorld视触觉世界模型,实现分层接触预测与规划,服务于contact-rich操作的视触觉感知。
研究多回合长时程规划的物理,从预训练到后训练全流程,服务于世界模型与agent的长时程规划。
提出能力感知的可通行性导航方法,在非结构化环境中根据机器人能力评估可通行性,提升导航鲁棒性。
提出通过搜索分配与零空间体现多手操作策略的方法,提升多手/多指机器人操作的协调与泛化。