一句话结论
MVBench 用 4,000 道多选题把 20 种短视频时序能力组织成可诊断矩阵,并证明早期 MLLM 对视频时序信息的利用远未成熟;但它是通用短视频理解基准,不是生成质量、长视频或视频编辑理解基准。
论文定位
- 直接测量:短视频时序感知、定位、计数、状态变化、对象交互和推理。
- 不直接测量:视频生成质量、人类偏好、小时级长视频、源—目标视频编辑执行。
- 对 wiki 的角色:提供“编辑理解需要哪些底层视频能力”的通用底座,而不是编辑能力结论本身。
问题定义
多数早期 MLLM benchmark 偏静态图像;已有视频 benchmark 又只覆盖少数任务或特定领域。MVBench 试图用可扩展、低人工成本且不依赖 LLM 裁判的方式,系统评估从时间感知到时序认知的能力。
方法与数据
static-to-dynamic
论文从 9 类静态理解任务扩展出 20 类动态任务:动作顺序/预测/反义/细粒度/意外动作,对象存在/交互/遮挡换位,移动方向/动作定位,场景切换,动作/移动计数,移动属性/状态变化/姿态/字符顺序,以及导航、情境推理和反事实。
benchmark 构造
- 来自 11 个公开数据集,每任务 200 题,共 4,000 QA;
- 视频主要 5–35 秒,过滤过短、过长、过易/过难样本;
- 有真值的题直接改成多选,无现成问题时用 ChatGPT 辅助生成;
- 选项 3–5 个、随机打乱并控制长度;以准确率避免开放问答的 LLM 评分偏差。
配套模型
VideoChat2 采用 UMT-L、QFormer、Vicuna/Mistral 和三阶段视觉—语言训练,并使用 34 个数据集约 200 万条多模态指令。它用于诊断数据、视觉编码器、训练方式与 prompt 对 benchmark 表现的影响。
核心结果
- Random 27.3%;VideoChatGPT 32.7%、VideoChat 35.5%、LLaVA 36.0%。
- 纯文本 VideoChat2-text 达 34.7%,几乎追平 VideoChat,暴露语言先验与视频利用不足。
- VideoChat2/Vicuna 51.1%,Mistral 版 60.4%;GPT-4V 为 43.5%。
- VideoChat2 对动作、对象、场景、属性、姿态较强;位置、计数、Character Order 仍弱,有些任务不如纯文本版本。
- 因此“会视频对话”与“可靠利用时序视觉证据”不能画等号。
消融与诊断
- 0.9M 视频指令数据得到 50.5%,高于 1.1M 图像数据的 42.1%;视频数据更关键。
- EVA-CLIP-g 换 UMT-L 再增约 6.2 点;扩大 LLM 只带来边际收益。
- 只训练线性层 38.5%,解冻 QFormer 47.0%,再解冻视觉编码器 51.1%。
- 8→16 帧从 50.6% 到 51.1%;提高分辨率反降,支持该基准主要依赖时间信息。
- 去掉 CLEVRER 指令数据降 1.8 点,说明部分近域训练重合影响结果。
- 详细 system prompt +1.2;固定答案前缀让选项抽取率达到 100%,提示格式会显著影响分数。
局限或疑问
- 短视频、每类 200 题,不能代表长程记忆或开放世界连续视频。
- 自动 QA 和多选形式仍可能有模板/语言先验;纯文本 34.7% 是明显风险。
- benchmark 与自家 VideoChat2 同文提出,且训练源与部分 benchmark 源近域重合,不能把模型领先完全归因于通用能力。
- 16 帧稀疏采样不能证明密集时序理解;不含音频/字幕。
- 多选准确率可复现,却不测解释质量、置信度和开放任务完成度。
对 benchmark question 的证据分类
| 维度 | 分类 | 解释 |
|---|---|---|
| 视频理解 | 直接强证据 | 20 类短视频时序任务及消融 |
| 生成质量 | 非目标 | 不评估画质、美学、运动质量或文本对齐 |
| 人类偏好 | 非目标 | 真值正确性不等于偏好 |
| 长视频 | 边界证据 | 主要 5–35 秒,不能外推小时级能力 |
| 时空世界理解 | 部分直接证据 | 测时间、位置、计数、反事实,但不测精确物理量 |
| 视频编辑理解 | 间接基础证据 | 底层能力必要,但无编辑指令、剪辑语法或编辑结果 |
对当前 wiki 判断的影响
MVBench 支持把评测分层:通用短视频理解是视频编辑理解的必要底座,但通用 benchmark 高分不是编辑理解的充分条件。 它也提醒 questions/question-do-benchmarks-track-real-video-editing-understanding:不能把“动作/状态 QA”与“理解用户编辑意图并正确执行”混成一类。
相关页面
- topics/video-understanding
- topics/generative-model-evaluation
- questions/question-do-benchmarks-track-real-video-editing-understanding