CosFly-VLA:空间感知的无人机跟踪视觉-语言-动作模型面向复杂城市环境无人机动态目标跟踪,提出空间感知VLA模型,在目标被建筑遮挡时仍能维持跟踪,超越现有方法。Ruilong Ren, Songsheng Cheng, Yunpeng Zhou·2026年7月16日UAV视觉语言动作模型跟踪2026年7月16日
AeroAct:语言条件四旋翼飞行的世界-动作模型面向语言条件四旋翼飞行,提出以动作为中心的世界-动作模型,融合语义目标、预测自我运动视觉后果、输出平滑可执行的连续控制参考。Xinhong Zhang, Qiyuan Zhu, Yubo Huang·2026年7月16日UAV四旋翼世界模型2026年7月16日