Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models
arXiv · HuggingFace · ▲71
摘要(原文)
Embodied Vision-Language-Action (VLA) models are typically obtained by fine-tuning powerful pretrained VLMs on robotics data, yet it is unclear how much commonsense and factual knowledge they retain after adaptation. Failures on knowledge-sensitive tasks are ambiguous, conflating missing knowledge with poor generalization of low-level control. We introduce Act2Answer, a lightweight protocol that adapts VLM knowledge benchmarks to VLA evaluation by requiring agents to answer through action. Each question becomes a short tabletop episode where the agent performs a single object-placement action to select among candidate answers, yielding an action-grounded success rate with reduced control confounds. We curate a test suite of such environments across diverse commonsense and world-knowledge categories and introduce layerwise intent probing to localize answer-relevant information across the VLM backbone and action head. In a large-scale study of 7 VLA models and 9 VLM baselines, we systematically rank models across categories, finding that VLAs show solid performance on simple concepts while exhibiting larger gaps on richer semantic categories relative to their source VLMs, that VQA co-training is associated with better knowledge retention, and that answer-relevant signals peak in middle VLA layers but attenuate in upper layers. Act2Answer is available at https://tttonyalpha.github.io/act2answer/.
摘要(中译)
具身视觉-语言-动作(VLA)模型通常是通过在机器人学数据上微调强大的预训练视觉-语言模型(VLM)获得的,然而目前尚不清楚它们在适应后保留了多少常识和事实知识。在知识敏感型任务上的失败情况是模糊的,将知识的缺失与低层次控制的泛化能力差混为一谈。我们引入了Act2Answer,这是一种轻量级协议,它通过要求智能体通过动作来回答问题,将VLM知识基准适配到VLA评估中。每个问题都变成了一个简短的桌面场景,在该场景中,智能体执行单个物体放置动作,从候选答案中进行选择,从而产生一个基于动作的成功率,减少了控制干扰因素。我们整理了一个涵盖多种常识和世界知识类别的此类环境的测试套件,并引入了分层意图探测,以在VLM主干和动作头中定位与答案相关的信息。在对7个VLA模型和9个VLM基线进行的大规模研究中,我们系统地对不同类别的模型进行了排名,发现VLA在简单概念上表现出色,而与它们的源VLM相比,在更丰富的语义类别上存在较大差距;VQA协同训练与更好的知识保留相关;与答案相关的信号在VLA的中间层达到峰值,但在上层减弱。Act2Answer可在https://tttonyalpha.github.io/act2answer/获取。
背景剖析
背景剖析
1. 技术背景
随着人工智能技术的进步,具身智能体(如家庭服务机器人、零售场景中的自动化系统)正被广泛研究以应用于日常生活环境。这些智能体需要理解世界的常识和事实知识(例如物体的用途、行为的合理性),才能在复杂环境中做出合理决策。Vision-Language-Action (VLA) 模型作为这类智能体的核心,旨在将视觉感知、语言理解和动作执行结合,实现开放世界的交互能力。然而,尽管VLA模型在操控任务中表现出色,其是否保留了基础常识和世界知识仍缺乏系统评估。
2. 之前的问题
现有研究主要关注VLA模型在特定任务中的成功率(如物体操作或导航),但忽视了一个关键问题:经过机器人学训练后,模型是否仍然能够基于常识区分物体、场景和目标?例如,一个经过微调的VLA模型可能擅长移动杯子,但能否判断“杯子应该用来盛水而不是扔向墙壁”?此外,传统评估方法依赖于任务成功率的量化,难以区分“知识缺失”和“控制能力不足”的问题。同时,VLM(视觉-语言模型)领域已有丰富的知识基准,但这些基准通常以文本问答形式存在,无法直接应用于具身智能体的动作导向场景。
3. 本文的解法
为解决这一问题,本文提出了Act2Answer框架,将VLM的知识基准转化为具身智能体的动作导向评估。具体来说,每个知识问题被设计为一个简短的模拟场景,智能体通过执行单一动作(如放置物体)来选择答案。这种方法减少了长时规划和高层次控制的干扰,使评估更聚焦于知识本身。此外,作者引入了分层意图探针,通过分析模型各层表示来定位与答案相关的信息,从而揭示知识在模型内部的分布和传递机制。
4. 切入角度
与以往工作相比,Act2Answer的关键创新在于:
- 动作导向的评估:将文本问答转化为动作选择,更贴近具身智能体的实际需求;
- 多样化的知识覆盖:涵盖常识、世界知识等多个类别,系统评估模型在不同场景下的表现;
- 分层分析:通过线性分类器分析模型各层的知识保留情况,揭示知识遗忘的层级特征。
这一方法弥补了现有研究的不足,为VLA模型的知识评估提供了新的视角。

