LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

MVBench综合多模态视频理解基准

一句话结论

MVBench 用 4,000 道多选题把 20 种短视频时序能力组织成可诊断矩阵,并证明早期 MLLM 对视频时序信息的利用远未成熟;但它是通用短视频理解基准,不是生成质量、长视频或视频编辑理解基准。

论文定位

  • 直接测量:短视频时序感知、定位、计数、状态变化、对象交互和推理。
  • 不直接测量:视频生成质量、人类偏好、小时级长视频、源—目标视频编辑执行。
  • 对 wiki 的角色:提供“编辑理解需要哪些底层视频能力”的通用底座,而不是编辑能力结论本身。

问题定义

多数早期 MLLM benchmark 偏静态图像;已有视频 benchmark 又只覆盖少数任务或特定领域。MVBench 试图用可扩展、低人工成本且不依赖 LLM 裁判的方式,系统评估从时间感知到时序认知的能力。

方法与数据

static-to-dynamic

论文从 9 类静态理解任务扩展出 20 类动态任务:动作顺序/预测/反义/细粒度/意外动作,对象存在/交互/遮挡换位,移动方向/动作定位,场景切换,动作/移动计数,移动属性/状态变化/姿态/字符顺序,以及导航、情境推理和反事实。

benchmark 构造

  • 来自 11 个公开数据集,每任务 200 题,共 4,000 QA;
  • 视频主要 5–35 秒,过滤过短、过长、过易/过难样本;
  • 有真值的题直接改成多选,无现成问题时用 ChatGPT 辅助生成;
  • 选项 3–5 个、随机打乱并控制长度;以准确率避免开放问答的 LLM 评分偏差。

配套模型

VideoChat2 采用 UMT-L、QFormer、Vicuna/Mistral 和三阶段视觉—语言训练,并使用 34 个数据集约 200 万条多模态指令。它用于诊断数据、视觉编码器、训练方式与 prompt 对 benchmark 表现的影响。

核心结果

  • Random 27.3%;VideoChatGPT 32.7%、VideoChat 35.5%、LLaVA 36.0%。
  • 纯文本 VideoChat2-text 达 34.7%,几乎追平 VideoChat,暴露语言先验与视频利用不足。
  • VideoChat2/Vicuna 51.1%,Mistral 版 60.4%;GPT-4V 为 43.5%。
  • VideoChat2 对动作、对象、场景、属性、姿态较强;位置、计数、Character Order 仍弱,有些任务不如纯文本版本。
  • 因此“会视频对话”与“可靠利用时序视觉证据”不能画等号。

消融与诊断

  • 0.9M 视频指令数据得到 50.5%,高于 1.1M 图像数据的 42.1%;视频数据更关键。
  • EVA-CLIP-g 换 UMT-L 再增约 6.2 点;扩大 LLM 只带来边际收益。
  • 只训练线性层 38.5%,解冻 QFormer 47.0%,再解冻视觉编码器 51.1%。
  • 8→16 帧从 50.6% 到 51.1%;提高分辨率反降,支持该基准主要依赖时间信息。
  • 去掉 CLEVRER 指令数据降 1.8 点,说明部分近域训练重合影响结果。
  • 详细 system prompt +1.2;固定答案前缀让选项抽取率达到 100%,提示格式会显著影响分数。

局限或疑问

  • 短视频、每类 200 题,不能代表长程记忆或开放世界连续视频。
  • 自动 QA 和多选形式仍可能有模板/语言先验;纯文本 34.7% 是明显风险。
  • benchmark 与自家 VideoChat2 同文提出,且训练源与部分 benchmark 源近域重合,不能把模型领先完全归因于通用能力。
  • 16 帧稀疏采样不能证明密集时序理解;不含音频/字幕。
  • 多选准确率可复现,却不测解释质量、置信度和开放任务完成度。

对 benchmark question 的证据分类

维度分类解释
视频理解直接强证据20 类短视频时序任务及消融
生成质量非目标不评估画质、美学、运动质量或文本对齐
人类偏好非目标真值正确性不等于偏好
长视频边界证据主要 5–35 秒,不能外推小时级能力
时空世界理解部分直接证据测时间、位置、计数、反事实,但不测精确物理量
视频编辑理解间接基础证据底层能力必要,但无编辑指令、剪辑语法或编辑结果

对当前 wiki 判断的影响

MVBench 支持把评测分层:通用短视频理解是视频编辑理解的必要底座,但通用 benchmark 高分不是编辑理解的充分条件。 它也提醒 questions/question-do-benchmarks-track-real-video-editing-understanding:不能把“动作/状态 QA”与“理解用户编辑意图并正确执行”混成一类。

相关页面

原始链接