一句话结论
HallusionBench 通过原图、人工编辑图和无图条件的 control pairs,揭示 LVLM 常让语言先验压过视觉反事实;它为编辑理解 benchmark 提供很强的对照设计方法论,但不是视频编辑生成或真实连续视频评测。
Benchmark interface
全部问题为 Yes/No:
- Visual Dependent:无图无法回答,测试视觉理解、常识、视觉错觉与多图时序关系。
- Visual Supplement:语言先验可能已知答案,图像用于补充或反驳先验。
- 同一问题在原图、人工编辑图或无图条件下组成 control pair;答案应随视觉反事实正确变化。
- GPT-4 将自由输出判为 correct/incorrect/unclear;温度 0 仍重复 3 次取平均。
数据规模与指标
- 346 个视觉素材:165 原图、181 人工编辑图。
- 455 个 control pairs、1,129 问;VD 591、VS 538。
- 条件分布:无图 178、原始视觉 447、人工编辑视觉 504。
- “video”分桶是 170 个连续帧 / 顺序反转问题,不能等同原生视频输入。
- 指标:question-level accuracy、figure accuracy、严格的 question-pair accuracy,以及 Yes bias、false-positive ratio、consistency 和基于规则树的 language hallucination / visual illusion 诊断。
主要结果与人评
- GPT-4V 人工评:qAcc 31.42%、fAcc 44.22%、aAcc 67.58%;自动评 qAcc 28.79%。
- Claude 3 自动评 qAcc 21.76%;除 GPT-4V 外多数模型低于 16%,多个模型的严格 pair score 低于 random chance 15.60%。
- GPT-4V 自动评失败中 language hallucination 22.19%、visual illusion 45.66%、mixed 32.14%。
- Math、illusion 与 frame-sequence 最难;GPT-4V 常不能区分正序与逆序。
- 人工复核只覆盖 GPT-4V 与 LLaVA-1.5,自动/人工分数接近,但未报告标注人数、一致性和显著性。
成本与消融
这是一篇 benchmark 论文,没有训练模块消融。核心控制变量是原图/编辑图/无图,以及单题/figure/pair 三种聚合严格度。1,129 问 × 15 模型后,每个输出还做 3 次 GPT-4 判分;论文未报告 API、GPU、人工编辑工时或总成本。
关键局限
- Yes/No 仍受答案偏置影响;diagnostic tree 是行为规则,不是内部机制因果定位。
- 人工编辑可能留下伪影,未做 artifact 控制。
- 标注专家数量、一致性、数据污染与成本均不透明。
- “video”是连续图片,不覆盖真实长视频、音频或剪辑点。
- GPT-4 judge 只在人评两个模型上验证。
对当前 Wiki 判断的影响
- 对 生成模型评测:直接支持反事实 control pairs 和 pair accuracy 比单题平均更能诊断视觉依赖。
- 对 视觉语言:证明模型会在视觉证据冲突时依赖参数记忆。
- 对 视频理解:只提供粗粒度帧序 reasoning 邻近证据。
- 对 现有 benchmark 是否跟踪真实视频编辑理解:应借鉴 source/edited pair 与 consistency,但不能把人工编辑测试图误当视频编辑能力数据。
证据评级
B+(视觉语言失败诊断的强行为证据;对真实视频编辑理解为 C+ 方法论邻近证据)。