PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
arXiv · HuggingFace · ▲39
摘要(原文)
We introduce PerceptionRubrics, a rubric-based evaluation framework that addresses the gap between saturated benchmark scores and real-world brittleness. Shifting evaluation from holistic semantic matching to rigorous atomic auditing, PerceptionRubrics pairs 1,038 information-dense images with over 12,000 instance-specific rubrics. These criteria are derived from golden captions constructed via a novel Circular Peer-Review consensus pipeline and then distilled into a dual-stream system of Must-Right (essential facts) and Easy-Wrong (fine-grained details) rubrics. Crucially, PerceptionRubrics implements a Gated Scoring mechanism: unlike linear averages, failure on mandatory visual facts triggers sharp binary penalties. Extensive evaluation yields critical insights: (1) The Reliability Gap: models often verify fragmented elements correctly yet fail strict conjunctive constraints, exposing brittleness in dense domains; (2) Open-Closed Stratification: contrary to reasoning trends, we reveal a persistent 8% perception deficit between open-source and proprietary frontiers; and (3) Human-Aligned Rigor: our gated metrics substantially out-align conventional benchmarks, validating that strict perceptual fidelity is the prerequisite for reliable generation.
摘要(中译)
我们引入了PerceptionRubrics,这是一种基于评分标准的评估框架,旨在解决饱和的基准分数与现实世界中的脆弱性之间的差距。将评估从整体语义匹配转向严格的原子审计,PerceptionRubrics将1,038张信息密集型图像与超过12,000个特定实例的评分标准配对。这些标准是通过一种新颖的循环同行评审共识管道构建的金色标题派生的,然后提炼成必须正确(基本事实)和容易错误(细粒度细节)的双流评分标准系统。关键的是,PerceptionRubrics实现了一种门控评分机制:与线性平均值不同,强制视觉事实的失败会触发急剧的二元惩罚。广泛的评估产生了关键的见解:(1)可靠性差距:模型通常正确验证分散的元素,但在严格的连接约束上失败,暴露了密集领域的脆弱性;(2)开放-封闭分层:与推理趋势相反,我们揭示了开源和专有前沿之间持续的8%的感知缺陷;(3)与人类对齐的严谨性:我们的门控指标在很大程度上超越了传统基准,验证了严格的感知保真度是可靠生成的前提条件。
背景剖析
背景剖析
技术背景:多模态大模型(MLLMs)正被广泛应用于图像理解、内容生成等场景(如智能助手解析截图、AI生成报告校验),核心需求是让模型具备“人类级别的感知可靠性”——即不仅能回答问题,还要在复杂视觉信息中准确识别细节(如图表数据、空间关系)。例如,医疗影像分析需要模型精准定位病灶,而现有基准测试却无法有效验证这种能力。
之前的问题:当前评估体系存在两大缺陷:一是数据覆盖不足,多数基准使用信息简单或领域狭窄的图像(如单一物体分类),导致模型依赖语言先验(而非真实视觉理解);二是评分机制失真,传统指标(如CLIPScore)通过线性平均掩盖局部错误,例如模型即使误判表格数字仍能得高分,但这种错误在现实中是“零容忍”的。这导致排行榜高分模型在实际部署中表现脆弱(如漏看关键物体),形成“高分数≠高可靠性”的悖论。
本文的解法:论文提出PerceptionRubrics框架,通过三步解决问题:首先,构建包含1,038张高信息量图像的数据集,并通过“循环同行评审”机制生成“黄金标准描述”(由多模型迭代优化并经人工验证);其次,将这些描述拆解为12,000+条原子级规则,分为“必须正确”(如关键事实)和“容易错误”(如细节偏差)两类;最后,引入“门控评分”机制——若违反“必须正确”规则则直接扣分,确保评分与人类对严重错误的敏感度一致。
切入角度:与先前工作不同,PerceptionRubrics不追求“整体语义匹配”,而是聚焦“细粒度感知审计”。它通过数据驱动的规则提取(从模型错误中学习)和非线性评分(区分致命错误与次要偏差),填补了基准测试与真实场景间的鸿沟。这种方法不仅揭示了模型在复杂域中的可靠性缺陷(如开源与闭源模型的8%感知差距),还为未来模型优化提供了可解释的诊断工具。




