LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-10

VEU-BenchBenchmarking Video Editing Element Understanding in General Vid-LLMs

VEU-Bench evaluates recognition, reasoning, and functional judgment of editing elements with 19 tasks and 49,536 QA pairs, revealing clear gaps in general Vid-LLMs.

一句话结论

VEU-Bench 显示,论文测试的通用 Vid-LLM 在视频剪辑元素识别、依据推理和叙事功能判断上仍有明显缺口;VEU-50K 专门微调可以显著缩小差距。

研究对象

这篇论文评测 Vid-LLM 对已编辑视频中的剪辑元素与剪辑语法的理解。任务覆盖镜头尺寸、角度、地点、主体、类型、色彩、镜头运动、速度、cut 与 transition,并分为三个层级:

  1. Recognition:识别出现了什么剪辑元素;
  2. Reasoning:解释判断该元素的具体依据;
  3. Judging:判断该元素在视频中的叙事或表达功能。

文本驱动编辑执行、编辑结果质量与 T2V prompt 满足性属于相邻评测坐标。

Benchmark 规模

  • 19 个细粒度任务
  • 10 个剪辑维度
  • 识别、推理、判断 3 个层级
  • 30,000 个视频
  • 49,536 个 QA
  • 训练集 45,154 条,测试集 4,382 条

论文结合剪辑知识库、人工标注与 MLLM 辅助流程构造 reasoning / judging 数据,并用结构化 evaluator 评分开放式回答。

关键结果

论文评测 11 个通用 Vid-LLM:

模型/范围总分或结论
GPT-4o2.64/5
最强开源通用模型 LLaVA-OneVision1.98/5
VEU-50K 微调的 Oscars2.54/5
当前模型的 reasoning / judging 平均表现低于 2/5

部分模型在 shot speed 和 shot motion 识别上低于随机猜测。论文把这一弱点与统一采样策略联系起来;judging 任务还要求建立剪辑元素功能与具体内容之间的联系。

专门监督带来的缓解

作者以 Qwen2-VL-7B 为底座,用 VEU-50K 进行 LoRA 微调,得到专家模型 Oscars。其总分从基础模型对应水平提升至 2.54/5,接近 GPT-4o 的 2.64/5。

该结果给出清晰边界:通用模型在 VEU-Bench 上存在缺口,专门数据与监督能够显著改善该能力。

与 Wiki Claim 的关系

这篇论文直接支持:

Claim 的范围已经限定到:通用 Vid-LLM 对剪辑元素的识别、依据推理和功能判断。FiVE-Bench、NeuS-V、AIGV-Assessor 与 Video-Bench 分别补充编辑执行、时间逻辑满足性和生成视频质量评估,它们作为相关背景保留。

关键图示

首页与任务总览

!900

标注与评测流程

!900

主要实验结果

!900

局限

  • 结论受剪辑 ontology、任务设计和评测协议影响。
  • 论文覆盖 11 个模型,跨 benchmark 与真实剪辑工作流的泛化仍需复核。
  • Oscars 证明专门监督有效;真实场景迁移需要进一步实验。
  • 剪辑理解、编辑执行与结果质量需要多套互补 benchmark 联合判断。

原始链接

相关页面