Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
arXiv · HuggingFace · ▲48
摘要(原文)
Zero-Shot Compositional Action Recognition (ZS-CAR) requires recognizing novel verb-object combinations composed of previously observed primitives. In this work, we tackle a key failure mode: models predict verbs via object-driven shortcuts (i.e., relying on the labeled object class) rather than temporal evidence. We argue that sparse compositional supervision and verb-object learning asymmetry can promote object-driven shortcut learning. Our analysis with proposed diagnostic metrics shows that existing methods overfit to training co-occurrence patterns and underuse temporal verb cues, resulting in weak generalization to unseen compositions. To address object-driven shortcuts, we propose Robust COmpositional REpresentations (RCORE) with two components. Co-occurrence Prior Regularization (CPR) adds explicit supervision for unseen compositions and regularizes the model against frequent co-occurrence priors by treating them as hard negatives. Temporal Order Regularization for Composition (TORC) enforces temporal-order sensitivity to learn temporally grounded verb representations. Across Sth-com and EK100-com, RCORE reduces shortcut diagnostics and consequently improves compositional generalization.
摘要(中译)
零样本组合动作识别(Zero - Shot Compositional Action Recognition,ZS - CAR)要求识别由先前观察到的基本元素组成的新的动宾组合。在这项工作中,我们解决了一个关键的失败模式:模型通过对象驱动的快捷方式(即依赖于标记的对象类别)而不是时间证据来预测动词。我们认为,稀疏的组合监督和动宾学习不对称性会促进对象驱动的快捷方式学习。我们使用提出的诊断指标进行的分析表明,现有方法过度拟合训练共现模式,并且对时间动词线索利用不足,导致对未见过的组合的泛化能力较弱。为了解决对象驱动的快捷方式问题,我们提出了具有两个组件的鲁棒组合表示(Robust COmpositional REpresentations,RCORE)。共现先验正则化(Co - occurrence Prior Regularization,CPR)为未见过的组合添加显式监督,并通过对它们进行硬负样本处理来规范模型,使其不受频繁共现先验的影响。组合的时间顺序正则化(Temporal Order Regularization for Composition,TORC)强制对时间顺序敏感,以学习基于时间的动词表示。在Sth - com和EK100 - com上,RCORE减少了快捷方式诊断,从而提高了组合泛化能力。
背景剖析
背景剖析
1. 技术背景
视频理解技术需要识别人类动作的两个核心要素:动词(如“打开”)和物体(如“抽屉”),并通过组合这些要素理解复杂行为(例如“打开抽屉”)。这类技术在智能助手、机器人交互等领域有实际需求——比如让AI系统根据视频指令执行“拿起杯子喝水”这样的组合动作。然而,现有方法在面对未见过的动词-物体组合(如训练中见过“打开门”但未见过“打开抽屉”)时表现不佳,这限制了技术的泛化能力。
2. 之前的问题
先前方法的缺陷源于两个关键问题:
- 数据稀疏性:训练数据中动词-物体组合的覆盖范围极低(例如某些数据集仅标注了1%的可能组合),导致模型过度依赖“物体出现频率”来预测动词(例如看到“抽屉”就默认是“打开”,而忽略动作的时间线索)。
- 学习不对称性:物体可通过单帧图像识别(静态信息),而动词需要多帧时序推理(动态信息)。这种不平衡使模型倾向于走“捷径”——直接通过物体标签预测动词,而非学习动作的时间逻辑。
3. 本文的解法
论文提出RCORE框架,通过两种机制解决上述问题:
- 组合感知增强:生成未见过的合理动词-物体组合(如“关闭抽屉”),同时保留视频的时序结构,迫使模型学习新组合的逻辑。
- 时序正则化:通过对比原始视频和打乱时序的视频,惩罚模型对静态物体线索的依赖,强化对动词时序特征的学习。
4. 切入角度
与以往工作不同,本文的关键创新在于:
- 明确诊断问题:首次系统性地指出模型依赖“物体捷径”是ZS-CAR的核心缺陷,并通过量化指标(如“组合差距”)衡量模型是否真正学习了组合推理。
- 针对性设计:不是简单增加数据或调整模型,而是直接针对数据稀疏性和学习不对称性,通过数据增强和时序约束从根源上缓解捷径依赖。
这种方法证明了当前技术的瓶颈并非模型容量不足,而是行为模式错误——模型因“偷懒”而依赖捷径。RCORE通过强制模型关注时序信息,显著提升了对未见组合的泛化能力。



