LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

LVBench极长视频理解基准

一句话结论

LVBench 用平均 68 分钟的视频和密度消融证明:“支持长视频”或拥有长上下文不等于真正理解长视频;密集视觉覆盖、跨事件记忆和长上下文指令遵循仍是独立瓶颈。

论文定位

  • 直接测量:长视频实体/事件跟踪、时间定位、细节检索、推理与总结。
  • 与 MVBench 的区别:MVBench 扩短视频任务宽度;LVBench 扩时间跨度与跨事件依赖。
  • 不直接测量:生成质量、人类偏好、精确物理量或视频编辑执行。

方法与数据

数据与任务设计

  • 103 个 YouTube 视频,共 117 小时,平均 4,101 秒;视频至少 30 分钟。
  • 六类内容:体育、纪录片、事件记录、生活、电视剧、动画。
  • 专业标注员完整观看,每小时约 24 题;最终 1,549 个四选一 QA。
  • 六项核心能力:Temporal Grounding、Summarization、Reasoning、Entity Recognition、Event Understanding、Key Information Retrieval;组合成 26 种细粒度题型。
  • 每题标注最短 clue duration;用 GLM-4/GPT-4 纯文本双重命中进行过滤,减少语言先验。

实验协议

非原生长视频模型使用固定 32/96 帧;原生模型尽量 1 FPS 输入、超长才下采样。论文评估 26 个模型,并报告人类 94.4% 作为上界。不同 API/模型输入预算并不完全一致,必须谨慎比较。

核心结果

  • Gemini-2.5-Pro 67.4%,Seed1.5-VL-Thinking 64.6%,Seed1.5-VL 64.0%,人类 94.4%。
  • “原生长视频”不是充分条件:MovieChat 22.5%、LLaMA-VID 23.9%、LWM 25.5%、Gemini-1.5-Pro 33.1%。
  • 一些非原生模型仍有竞争力;模型能接收长输入,不代表能保留和调用关键证据。
  • Gemini-2.5-Pro KIR 72.8%,但 Summarization 58.6%;复杂全局综合依旧困难。
  • 类别差异明显:Gemini-2.5-Pro Event Record 72.1%、Sports 71.3%、Documentary 54.3%。总分会掩盖领域敏感性。

消融与失败诊断

帧密度

0、1、4、8、50 帧到 1 FPS 的消融显示:1→8 帧只温和提升,50 帧→1 FPS 跃升最大;稀疏帧能抓主题,却会漏掉瞬时关键证据。0 帧接近随机,也支持语言先验过滤有效。

指令遵循

Gemini-1.5-Pro 有 20.9% 输出不在四个选项内;MovieChat/LWM 强烈偏 A。长视频低分不仅是记忆或压缩失败,也包含长上下文下的格式遵循与校准失败。

局限或疑问

  • 仅 103 个经过高质量筛选的 YouTube 视频;生态与文化覆盖有限。
  • 排除关键音频提高视觉纯度,却降低电影、体育解说、会议等真实场景效度。
  • Summary 仍被四选一近似,不能代替开放式长文总结质量。
  • 原生/非原生模型输入帧率和 API 时长限制不同,分数混合模型能力与输入预算。
  • YouTube 链接存在失效/授权风险;专业标注也可能有偏差。
  • 更新版榜单含不同年份模型和 API,需要固定版本才能复现。

对 benchmark question 的证据分类

维度分类解释
视频理解直接强证据长程检索、实体/事件、定位、推理、总结
生成质量非目标不评估生成输出
人类偏好非目标人类分数是能力上界,不是偏好
长视频直接最强证据≥30 分钟,平均 68 分钟,含帧密度消融
时空世界理解部分证据测事件时序,不测精确距离/速度/位姿
视频编辑理解间接前置证据长素材剪辑需要这些能力,但无编辑意图/结果

对当前 wiki 判断的影响

LVBench 让“长视频”成为独立评测轴,而不能并入一般视频 QA。对 questions/question-do-benchmarks-track-real-video-editing-understanding,它提供长素材编辑的必要前置能力证据:模型若不能跨小时定位和记住事件,就难以可靠剪辑;但高分仍不代表理解剪辑目的或审美。

相关页面

原始链接