一句话结论
LVBench 用平均 68 分钟的视频和密度消融证明:“支持长视频”或拥有长上下文不等于真正理解长视频;密集视觉覆盖、跨事件记忆和长上下文指令遵循仍是独立瓶颈。
论文定位
- 直接测量:长视频实体/事件跟踪、时间定位、细节检索、推理与总结。
- 与 MVBench 的区别:MVBench 扩短视频任务宽度;LVBench 扩时间跨度与跨事件依赖。
- 不直接测量:生成质量、人类偏好、精确物理量或视频编辑执行。
方法与数据
数据与任务设计
- 103 个 YouTube 视频,共 117 小时,平均 4,101 秒;视频至少 30 分钟。
- 六类内容:体育、纪录片、事件记录、生活、电视剧、动画。
- 专业标注员完整观看,每小时约 24 题;最终 1,549 个四选一 QA。
- 六项核心能力:Temporal Grounding、Summarization、Reasoning、Entity Recognition、Event Understanding、Key Information Retrieval;组合成 26 种细粒度题型。
- 每题标注最短
clue duration;用 GLM-4/GPT-4 纯文本双重命中进行过滤,减少语言先验。
实验协议
非原生长视频模型使用固定 32/96 帧;原生模型尽量 1 FPS 输入、超长才下采样。论文评估 26 个模型,并报告人类 94.4% 作为上界。不同 API/模型输入预算并不完全一致,必须谨慎比较。
核心结果
- Gemini-2.5-Pro 67.4%,Seed1.5-VL-Thinking 64.6%,Seed1.5-VL 64.0%,人类 94.4%。
- “原生长视频”不是充分条件:MovieChat 22.5%、LLaMA-VID 23.9%、LWM 25.5%、Gemini-1.5-Pro 33.1%。
- 一些非原生模型仍有竞争力;模型能接收长输入,不代表能保留和调用关键证据。
- Gemini-2.5-Pro KIR 72.8%,但 Summarization 58.6%;复杂全局综合依旧困难。
- 类别差异明显:Gemini-2.5-Pro Event Record 72.1%、Sports 71.3%、Documentary 54.3%。总分会掩盖领域敏感性。
消融与失败诊断
帧密度
0、1、4、8、50 帧到 1 FPS 的消融显示:1→8 帧只温和提升,50 帧→1 FPS 跃升最大;稀疏帧能抓主题,却会漏掉瞬时关键证据。0 帧接近随机,也支持语言先验过滤有效。
指令遵循
Gemini-1.5-Pro 有 20.9% 输出不在四个选项内;MovieChat/LWM 强烈偏 A。长视频低分不仅是记忆或压缩失败,也包含长上下文下的格式遵循与校准失败。
局限或疑问
- 仅 103 个经过高质量筛选的 YouTube 视频;生态与文化覆盖有限。
- 排除关键音频提高视觉纯度,却降低电影、体育解说、会议等真实场景效度。
- Summary 仍被四选一近似,不能代替开放式长文总结质量。
- 原生/非原生模型输入帧率和 API 时长限制不同,分数混合模型能力与输入预算。
- YouTube 链接存在失效/授权风险;专业标注也可能有偏差。
- 更新版榜单含不同年份模型和 API,需要固定版本才能复现。
对 benchmark question 的证据分类
| 维度 | 分类 | 解释 |
|---|---|---|
| 视频理解 | 直接强证据 | 长程检索、实体/事件、定位、推理、总结 |
| 生成质量 | 非目标 | 不评估生成输出 |
| 人类偏好 | 非目标 | 人类分数是能力上界,不是偏好 |
| 长视频 | 直接最强证据 | ≥30 分钟,平均 68 分钟,含帧密度消融 |
| 时空世界理解 | 部分证据 | 测事件时序,不测精确距离/速度/位姿 |
| 视频编辑理解 | 间接前置证据 | 长素材剪辑需要这些能力,但无编辑意图/结果 |
对当前 wiki 判断的影响
LVBench 让“长视频”成为独立评测轴,而不能并入一般视频 QA。对 questions/question-do-benchmarks-track-real-video-editing-understanding,它提供长素材编辑的必要前置能力证据:模型若不能跨小时定位和记住事件,就难以可靠剪辑;但高分仍不代表理解剪辑目的或审美。
相关页面
- topics/video-understanding
- topics/generative-model-evaluation
- questions/question-do-benchmarks-track-real-video-editing-understanding