Video-Oasis: Rethinking Evaluation of Video Understanding
arXiv · HuggingFace · ▲58
摘要(原文)
The inherent complexity of video understanding makes it difficult to determine whether Video-LLM benchmark performance stems from visual perception, linguistic reasoning, or knowledge priors. While many benchmarks have emerged to assess high-level reasoning, shared criteria for evaluating video understanding remain largely overlooked. Instead of introducing yet another benchmark, we take a step back to re-examine the criteria for evaluating video understanding. In this work, we introduce Video-Oasis, a sustainable diagnostic suite for systematically auditing existing video understanding benchmarks. This audit reveals that 55\% of existing benchmark samples are solvable without visual input or temporal context. After filtering these shortcuts, the remaining video-native challenges expose a substantial capability gap: state-of-the-art models perform only marginally above random guessing. Building on these findings, we use the distilled challenges as a testbed to investigate which algorithmic design choices contribute to robust video understanding. We hope our work provides a practical foundation for constructing rigorous video benchmarks and evaluating future Video-LLMs. Code is available at https://github.com/sejong-rcv/Video-Oasis.
摘要(中译)
视频理解的内在复杂性使得难以确定Video - LLM基准性能是源于视觉感知、语言推理还是知识先验(knowledge priors)。虽然已经出现了许多用于评估高层次推理的基准,但评估视频理解的共享标准在很大程度上被忽视了。我们没有引入另一个基准,而是退后一步重新审视评估视频理解的标准。在这项工作中,我们引入了Video - Oasis,这是一个用于系统审计现有视频理解基准的可持续诊断套件。这次审计揭示了现有基准样本中有55%在没有视觉输入或时间上下文的情况下是可以解决的。在过滤掉这些捷径之后,剩余的视频原生挑战暴露出一个巨大的能力差距:最先进的模型表现仅略高于随机猜测。基于这些发现,我们使用提炼出的挑战作为测试平台,以研究哪些算法设计选择有助于实现鲁棒的视频理解。我们希望我们的工作为构建严格的视频基准和评估未来的视频大语言模型(Video - LLMs)提供一个实用的基础。代码可在https://github.com/sejong - rcv/Video - Oasis获取。
背景剖析
背景剖析
1. 技术背景
随着多模态大模型的发展,视频理解技术已从单一任务(如动作识别)转向更复杂的感知与推理结合场景。这类技术的核心需求是让AI模型能够像人类一样“看懂”视频——不仅要识别画面中的物体或动作,还要理解事件的时间顺序、因果关系,甚至回答涉及逻辑推理的问题(例如“为什么这个人会摔倒?”)。典型应用包括智能监控、视频问答、自动驾驶中的环境感知等。然而,当前基准测试(benchmark)往往无法准确评估模型是否真正掌握了视频理解的核心能力,导致性能提升可能来自视觉感知、语言推理或背景知识,而非真正的视频理解。
2. 之前的问题
早期基准测试(如动作识别)聚焦于特定领域,但视频大模型(Video-LLMs)需要处理更复杂的动态和长时推理任务。现有测试的一个关键缺陷是:许多任务可以通过“捷径”完成,例如仅依赖文本描述或静态图像,而无需分析视频的时空依赖关系。这导致基准测试无法区分模型是否真正理解了视频内容。例如,一个模型可能在“描述视频内容”任务中表现优异,但实际上只是通过文本信息猜测答案,而非观察画面。这种评估偏差使得研究人员难以判断模型的真实能力,也阻碍了视频理解技术的发展。
3. 本文的解法
本文提出了一种名为Video-Oasis的诊断框架,旨在系统性地审计现有视频理解基准测试。其核心思路是:通过屏蔽视觉或时间信息,测试任务是否真的需要视频特有的时空推理能力。例如,如果一个任务在仅提供文本描述时就能被解决,那么它可能是一个“捷径”,而非真正的视频理解任务。通过这种方法,Video-Oasis发现现有基准测试中约55%的任务可以通过非视频输入完成,而剩余的“纯视频挑战”则暴露出模型的能力差距——即使是顶尖模型,其表现也仅略高于随机猜测。
4. 切入角度
与以往工作不同,Video-Oasis并未引入新的基准测试,而是重新审视了视频理解的本质标准。它通过三个关键设计解决了前人的不足:(1)通过视觉-时间解耦测试,过滤掉依赖捷径的任务;(2)通过跨模型共识机制减少偏见和不确定性;(3)通过人工验证解决视频问答中的歧义。这种方法使得评估更加严格和可靠,为未来视频基准测试的设计提供了实用指南。




