LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

HallusionBench视觉语言幻觉与视觉错觉诊断基准

一句话结论

HallusionBench 通过原图、人工编辑图和无图条件的 control pairs,揭示 LVLM 常让语言先验压过视觉反事实;它为编辑理解 benchmark 提供很强的对照设计方法论,但不是视频编辑生成或真实连续视频评测。

Benchmark interface

全部问题为 Yes/No:

  • Visual Dependent:无图无法回答,测试视觉理解、常识、视觉错觉与多图时序关系。
  • Visual Supplement:语言先验可能已知答案,图像用于补充或反驳先验。
  • 同一问题在原图、人工编辑图或无图条件下组成 control pair;答案应随视觉反事实正确变化。
  • GPT-4 将自由输出判为 correct/incorrect/unclear;温度 0 仍重复 3 次取平均。

数据规模与指标

  • 346 个视觉素材:165 原图、181 人工编辑图。
  • 455 个 control pairs、1,129 问;VD 591、VS 538。
  • 条件分布:无图 178、原始视觉 447、人工编辑视觉 504。
  • “video”分桶是 170 个连续帧 / 顺序反转问题,不能等同原生视频输入。
  • 指标:question-level accuracy、figure accuracy、严格的 question-pair accuracy,以及 Yes bias、false-positive ratio、consistency 和基于规则树的 language hallucination / visual illusion 诊断。

主要结果与人评

  • GPT-4V 人工评:qAcc 31.42%、fAcc 44.22%、aAcc 67.58%;自动评 qAcc 28.79%。
  • Claude 3 自动评 qAcc 21.76%;除 GPT-4V 外多数模型低于 16%,多个模型的严格 pair score 低于 random chance 15.60%。
  • GPT-4V 自动评失败中 language hallucination 22.19%、visual illusion 45.66%、mixed 32.14%。
  • Math、illusion 与 frame-sequence 最难;GPT-4V 常不能区分正序与逆序。
  • 人工复核只覆盖 GPT-4V 与 LLaVA-1.5,自动/人工分数接近,但未报告标注人数、一致性和显著性。

成本与消融

这是一篇 benchmark 论文,没有训练模块消融。核心控制变量是原图/编辑图/无图,以及单题/figure/pair 三种聚合严格度。1,129 问 × 15 模型后,每个输出还做 3 次 GPT-4 判分;论文未报告 API、GPU、人工编辑工时或总成本。

关键局限

  • Yes/No 仍受答案偏置影响;diagnostic tree 是行为规则,不是内部机制因果定位。
  • 人工编辑可能留下伪影,未做 artifact 控制。
  • 标注专家数量、一致性、数据污染与成本均不透明。
  • “video”是连续图片,不覆盖真实长视频、音频或剪辑点。
  • GPT-4 judge 只在人评两个模型上验证。

对当前 Wiki 判断的影响

证据评级

B+(视觉语言失败诊断的强行为证据;对真实视频编辑理解为 C+ 方法论邻近证据)

原始链接

相关页面