X-NavDP:基于群组Q值分数加权匹配的导航扩散策略泛化框架提出GQRM强化学习后训练框架,通过自举探索与群组Q值归一化机制对导航扩散策略进行跨本体微调,仿真成功率从61%提升至84%,真实世界从10%提升至65%。Tianyu Yang, Yiming Zeng, Wenzhe Cai·2026年7月30日NavDP视觉语言动作模型导航2026年7月30日