Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
arXiv · HuggingFace · ▲31
摘要(原文)
Modern AI models achieve strong performance on many established benchmarks, yet they still fail on tasks that humans find almost trivial, such as manipulating a string or drawing a dog with five legs. These examples suggest that existing benchmarks may under-measure persistent blind spots in current systems. We introduce blind-spots-bench, a benchmark designed to expose such blind spots through tasks that appear simple for humans but remain challenging for modern AI. We collect raw questions from students in an AI course, clean and annotate them with structured reference solutions, and propose a task taxonomy tailored to the resulting dataset of 235 samples. We further develop an automated grading pipeline to evaluate a wide range of models, including open-weight and closed-source language, vision-language, and image-generation models. Our analysis on blind-spots-bench reveals that closed-source frontier models can substantially outperform open-weight models with even approx10% gap, even when they attain comparable performance on existing benchmarks. A more fine-grained analysis shows that no single model dominates across all task types, and that some tasks remain challenging for all evaluated models. These results highlight the value of blind-spots-bench as a diagnostic stress test for identifying concrete weaknesses in current modern models.
摘要(中译)
现代人工智能模型在许多已建立的基准测试中取得了强劲的性能,但它们仍然在人类认为几乎微不足道的任务上失败,例如操作字符串或画一只五条腿的狗。这些例子表明,现有的基准测试可能低估了当前系统中持久的盲点。我们引入了blind-spots-bench,这是一个旨在通过看似对人类简单但对现代人工智能仍具有挑战性的任务来揭示这些盲点的基准测试。我们从人工智能课程的学生中收集原始问题,清理并用结构化参考解决方案进行注释,并针对包含235个样本的数据集提出了一个任务分类法。我们进一步开发了一个自动评分管道,以评估广泛的模型,包括开放权重和封闭源语言、视觉-语言和图像生成模型。我们对blind-spots-bench的分析表明,即使在与现有基准测试相当的性能下,封闭源前沿模型也可以大幅超越开放权重模型,甚至差距达到approx10%。更细致的分析表明,没有单一模型在所有任务类型中都占主导地位,而且有些任务对所有评估的模型仍然具有挑战性。这些结果突显了blind-spots-bench作为诊断压力测试的价值,用于识别当前现代模型中的具体弱点。
背景剖析
背景剖析
1. 技术背景
近年来,大型语言模型(LLMs)和多模态模型(如视觉-语言模型、图像生成模型)在数学推理、代码生成、视觉理解等任务中表现出色,广泛应用于教育、医疗、内容创作等领域。例如,它们可以辅助学生解决复杂的数学问题,帮助医生分析医学影像,或生成高质量的图像和文本。然而,这些模型在处理一些对人类来说非常简单的任务时却屡屡失败,比如生成指定长度的字符串、绘制特定细节的图像(如五只腿的狗)或解决基础数独。这种“人类易如反掌,AI却困难重重”的现象表明,现有模型在某些核心能力上仍存在“盲点”,例如空间推理、逻辑一致性和字符级操作等。
2. 之前的问题
尽管现有基准测试(如MMLU、ImageNet)显示模型性能接近或超越人类水平,但这些测试往往侧重于评估模型在特定领域的整体表现,而忽略了那些看似简单但实际需要精细操作的场景。例如,传统基准可能测试模型是否能识别一只猫,但不会测试它能否生成一只“四条腿、两只眼睛”的猫(而人类可以轻松做到)。此外,许多基准依赖于自动化评分,难以捕捉模型在开放性任务中的真实能力缺陷。因此,研究者需要一种更细致的方法来暴露这些“隐藏的弱点”。
3. 本文的解法
为了解决这一问题,本文提出了一个名为“Blind-Spots-Bench”的基准测试。该基准通过收集学生在AI课程中提出的“AI无法正确回答的问题”,构建了一个包含235个任务的数据库。这些问题覆盖了三类核心能力:对象中心任务(如计数、空间推理)、抽象推理任务(如数学逻辑)和语言知识任务(如语言理解)。每个任务都附有结构化的参考答案,并设计了一个自动评分管道,用于评估包括开源和闭源模型在内的38种前沿模型。这种方法不仅能量化模型的弱点,还能揭示不同模型在特定任务类型上的优劣。
4. 切入角度
与以往工作相比,本文的关键差异在于:
- 任务设计:聚焦于“人类易、AI难”的场景,而非传统的“AI擅长、人类也擅长”的任务。
- 评估方法:结合自动评分和手动审计,确保评估的可靠性。
- 任务分类:提出了一套细粒度任务分类法,能够更精确地分析模型在不同子任务上的表现。
- 模型覆盖:同时评估了开源和闭源模型,揭示了两者在性能上的显著差异(例如,闭源模型在某些任务上比开源模型高出约10%)。
通过这种方法,本文为理解和改进多模态模型的“盲点”提供了一个系统性的工具。








