VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
arXiv · HuggingFace · ▲9
摘要(原文)
Vision-Language-Action (VLA) foundation models have recently achieved strong progress in embodied intelligence. To reduce policy-call frequency while preserving temporal coherence, most generative policies adopt an action chunk mechanism, executing multiple future actions in an open-loop开环:先计划一段动作,再按计划执行;执行期间不依赖新的反馈来修正剩余动作。 manner under a fixed action horizon动作视界:一次策略调用规划并执行的连续动作步数。h 大代表一次执行更长动作块,省推理调用但更容易开环跑偏;h 小代表动作块更短,更常重新观察和规划。. However, this "predict-then-blindly-execute" paradigm sacrifices closed-loop闭环:执行过程中持续看反馈,并根据偏差调整下一步动作。 reactivity: in contact-rich physical interactions, even small local perturbations can rapidly amplify within the open-loop开环:先计划一段动作,再按计划执行;执行期间不依赖新的反馈来修正剩余动作。 blind spot, leading to compounding errors and ultimately task failure. To address this limitation, we propose VLA-Corrector, a lightweight corrective inference framework for action-chunked VLA policies. Without modifying the backbone policy weights, VLA-Corrector introduces a lightweight Latent-space Vision Monitor (LVM) that continuously compares predicted and actual visual feature evolution, enabling online detection of visual dynamics deviations. Once persistent deviation is detected, the system triggers a truncation event, discards the remaining stale actions, and invokes corrective replanning via Online Gradient Guidance在线梯度引导,简称 OGG:在动作重新规划时利用预测-观测偏差计算纠正方向,引导生成的新动作回到可恢复轨迹。 (OGGOnline Gradient Guidance。可以把它理解成“带纠偏信号的重新规划”:系统发现当前动作块已经跑偏后,不是盲目重新采样动作,而是用视觉偏差提供梯度方向,引导下一段动作朝修正错误的方向生成。). The detect-and-correct mechanism of VLA-Corrector naturally induces an event-triggered adaptive action horizon动作视界:一次策略调用规划并执行的连续动作步数。h 大代表一次执行更长动作块,省推理调用但更容易开环跑偏;h 小代表动作块更短,更常重新观察和规划。: it preserves long-horizon execution when the current chunk remains reliable, and invokes short-horizon corrective replanning when execution begins to drift. In doing so, VLA-Corrector mitigates the trade-off imposed by static horizons between execution robustness and policy-call frequency. It can be integrated into different VLA models without further retraining the VLA backbone, interrupting compounding errors while preserving much of the efficiency benefit of action chunking and substantially improving robustness in long-horizon, contact-rich robotic manipulation tasks.
摘要(中译)
视觉-语言-动作(Vision-Language-Action, VLA)基础模型在具身智能(embodied intelligence)领域近期取得了显著进展。为了降低策略调用频率同时保持时间一致性(temporal coherence),大多数生成式策略采用动作块(action chunk)机制,在固定的动作范围(action horizon动作视界:一次策略调用规划并执行的连续动作步数。h 大代表一次执行更长动作块,省推理调用但更容易开环跑偏;h 小代表动作块更短,更常重新观察和规划。)下以开环系统先根据当前观测或计划生成一串动作,然后按这串动作继续执行;执行过程中不根据新的反馈实时修正。优点是调用少、效率高,缺点是环境一变也可能继续执行旧动作,误差容易累积。(open-loop开环:先计划一段动作,再按计划执行;执行期间不依赖新的反馈来修正剩余动作。)方式执行多个未来动作。然而,这种"预测后盲目执行"的范式牺牲了闭环系统在执行过程中持续读取新的观测或反馈,把实际结果和目标或预测进行对比,并据此修正后续动作。它通常更稳健,但需要更频繁地感知、判断或重新规划。反应能力(closed-loop闭环:执行过程中持续看反馈,并根据偏差调整下一步动作。 reactivity):在富含接触的物理交互中,即使微小的局部扰动也会在开环系统先根据当前观测或计划生成一串动作,然后按这串动作继续执行;执行过程中不根据新的反馈实时修正。优点是调用少、效率高,缺点是环境一变也可能继续执行旧动作,误差容易累积。盲区(open-loop开环:先计划一段动作,再按计划执行;执行期间不依赖新的反馈来修正剩余动作。 blind spot)内迅速放大,导致误差累积并最终任务失败。为解决这一局限性,我们提出了VLA-Corrector,这是一个用于动作块化VLA策略的轻量级校正推理框架。VLA-Corrector无需修改主干策略权重,引入了一个轻量级的潜在空间视觉监视器(Latent-space Vision Monitor, LVM),持续比较预测和实际视觉特征的演变,实现视觉动态偏差的在线检测。一旦检测到持续偏差,系统会触发截断事件(truncation event),丢弃剩余的陈旧动作,并通过在线梯度引导Online Gradient Guidance,简称 OGG。这里不是重新训练模型,而是在重新规划动作时,把“预测的视觉变化”和“实际观察到的视觉变化”之间的偏差变成一个纠正方向,像给生成过程加一股外力,把新动作往更可能恢复任务的轨迹上推。(Online Gradient Guidance在线梯度引导,简称 OGG:在动作重新规划时利用预测-观测偏差计算纠正方向,引导生成的新动作回到可恢复轨迹。, OGGOnline Gradient Guidance。可以把它理解成“带纠偏信号的重新规划”:系统发现当前动作块已经跑偏后,不是盲目重新采样动作,而是用视觉偏差提供梯度方向,引导下一段动作朝修正错误的方向生成。)调用校正重规划。VLA-Corrector的检测-校正机制自然诱导了一个事件触发的自适应动作范围:当当前块保持可靠时,它保留长范围执行;当执行开始漂移时,调用短范围校正重规划。通过这种方式,VLA-Corrector缓解了静态范围在执行鲁棒性和策略调用频率之间施加的权衡。它可以集成到不同的VLA模型中而无需进一步重新训练VLA主干,中断误差累积的同时保留了动作块化的大部分效率优势,并显著提高了长范围、富含接触的机器人操作任务的鲁棒性。
背景剖析
背景剖析
1. 技术背景
Vision-Language-Action (VLA) 模型是机器人控制的前沿方向,旨在通过统一的框架实现感知、语言理解和动作生成的协同。这类技术主要应用于需要高灵活性和复杂交互的场景,例如家庭服务机器人(如整理桌面、开门)、工业操作(如装配、搬运)或医疗辅助任务。其核心需求是在保证动作流畅性的同时,应对动态环境中的不确定性(如物体滑动、碰撞或姿态偏移)。然而,传统方法面临一个关键矛盾:单步推理的延迟过高,无法支持实时反馈控制,而固定长度的动作块(action chunk)虽然提高了效率,却会导致“开环系统先根据当前观测或计划生成一串动作,然后按这串动作继续执行;执行过程中不根据新的反馈实时修正。优点是调用少、效率高,缺点是环境一变也可能继续执行旧动作,误差容易累积。盲区”——即执行过程中无法根据新观测调整策略,最终因误差累积引发任务失败。
2. 之前的问题
现有方法的核心缺陷在于静态动作块的设计。较长的动作块减少了策略调用频率(提高效率),但扩大了盲区,导致小扰动迅速放大为任务失败;而较短的块虽能及时响应,却因频繁调用策略(降低效率)而不可行。此外,静态块无法适应不同任务的动态需求(如简单任务需要长块以节省计算,复杂任务需要短块以提高鲁棒性)。此前研究试图通过调整块长度缓解矛盾,但未能从根本上解决“何时终止过时动作”以及“如何有效纠正轨迹”的问题。
3. 本文的解法
VLA-Corrector 提出了一种轻量级的推理框架,在不修改底层模型权重的情况下,通过两个关键机制解决问题:
- 潜在空间视觉监控(LVM):实时比较预测与实际视觉特征的演化,检测执行偏差。一旦发现持续偏离,立即终止剩余动作(事件触发截断)。
- 在线梯度引导Online Gradient Guidance,简称 OGG。这里不是重新训练模型,而是在重新规划动作时,把“预测的视觉变化”和“实际观察到的视觉变化”之间的偏差变成一个纠正方向,像给生成过程加一股外力,把新动作往更可能恢复任务的轨迹上推。(OGGOnline Gradient Guidance。可以把它理解成“带纠偏信号的重新规划”:系统发现当前动作块已经跑偏后,不是盲目重新采样动作,而是用视觉偏差提供梯度方向,引导下一段动作朝修正错误的方向生成。):在截断后,利用预测与观测的差异生成纠正梯度,指导新动作的生成,主动将机器人拉回目标轨迹,而非依赖随机重规划。
这种“检测-纠正”机制将固定动作块转换为自适应块,既保留了长块的效率,又具备短块的响应能力。
4. 切入角度
与前人工作相比,VLA-Corrector 的创新在于:
- 动态适应性:从“预定义固定块”转向“运行时自适应调整”,根据实际执行可靠性决定是否继续或重新规划。
- 纠正导向:不仅检测偏差,还通过梯度引导主动修正轨迹,解决了传统方法“截断后仍可能失败”的问题。
- 非侵入式设计:无需重新训练底层VLA模型,可直接集成到现有框架中,降低了应用门槛。
这一思路平衡了效率与鲁棒性,特别适用于需要长期接触交互的机器人任务(如组装),显著提升了任务成功率。













