Skip to content
Harness VLA:用记忆引导的智能体把冻结 VLA 驾驭成可靠的操作原语

Harness VLA:用记忆引导的智能体把冻结 VLA 驾驭成可靠的操作原语

语言条件操作既需要精确的富接触控制,也需要对语言、场景和长时程的稳健推理。端到端视觉-语言-动作(VLA)模型提供强大的局部视觉运动技能,但它们是在分布内任务轨迹上训练的,在语义重定向、目标重绑定、空间布局偏移和局部接触不稳定等部署扰动下常常失效。LLM 编码智能体提供互补的语义与组合推理,但纯解析原语在不规则抓取、受限放置和铰接物体交互上表现很差。本文提出 Harness VLA,一个记忆增强的智能体框架:它把一个冻结的 VLA 暴露为可重试的富接触原语,并与一个小型固定的解析原语库组合,用于接地、暂存、搬运、导航和释放。框架不去扩大技能库,而是从任务特异的执行轨迹、全局成功规则和失败模型中学习这些固定原语的工作范围。通过把语义重接地、非接触执行和 VLA 重暂存上提到规划器,同时把冻结 VLA 留给局部富接触阶段,Harness VLA 在不微调的前提下把预训练 VLA 扩展到其原始轨迹分布之外。在被扰动的桌面操作、家庭厨房操作和 clean-to-randomized 双臂操作上,Harness VLA 在 LIBERO-Pro 和 RoboCasa365 上分别比最强相关基线高出 38.6 和 27.1 个百分点,并在 RoboTwin C2R 上达到 58.4%。代码开源于 https://github.com/RLinf/RPent 。

视觉语言动作模型机器人操控LLM智能体Yixian Zhang, Huanming Zhang, Feng Gao·2026年7月9日
VLA-Corrector:面向自适应动作视界的轻量级检测与纠正推理

VLA-Corrector:面向自适应动作视界的轻量级检测与纠正推理

视觉-语言-动作(VLA)基础模型在具身智能上进展显著。为降低策略调用频率并保持时间连贯性,多数生成式策略采用动作块机制,在固定动作视界下以开环方式执行多步未来动作。然而这种先预测后盲目执行的范式牺牲了闭环反应性:在接触丰富的物理交互中,即使微小的局部扰动也会在开环盲区内迅速放大,导致误差复合并最终任务失败。为此本文提出 VLA-Corrector,一个面向动作块 VLA 策略的轻量纠正推理框架。在不修改主干策略权重的前提下,VLA-Corrector 引入轻量潜空间视觉监控器(LVM),持续比较预测与实际的视觉特征演化,实现在线检测视觉动力学偏差;一旦检测到持续偏差,系统触发截断事件、丢弃剩余陈旧动作,并通过在线梯度引导(OGG)发起纠正重规划。该检测-纠正机制自然诱导出事件触发的自适应动作视界:当前动作块可靠时保留长视界执行,执行开始漂移时调用短视界纠正重规划,从而缓解静态视界在执行鲁棒性与策略调用频率之间的权衡。VLA-Corrector 可在不重训 VLA 主干的情况下集成到不同 VLA 模型中,在保留动作块效率收益的同时中断复合误差,显著提升长视界、接触丰富机器人操作任务的鲁棒性。

视觉语言动作模型Robotic Manipulation动作分块Yi Pan, Miao Pan, Qi Lu·2026年7月2日