来源笔记 · 更新于 2026-07-10
VEU-Bench通用 Vid-LLM 的视频剪辑元素理解基准
VEU-Bench 以 19 个任务和 49,536 个 QA 评测剪辑元素识别、推理与功能判断;通用 Vid-LLM 在高层任务上仍有明显缺口。
一句话结论
VEU-Bench 显示,论文测试的通用 Vid-LLM 在视频剪辑元素识别、依据推理和叙事功能判断上仍有明显缺口;VEU-50K 专门微调可以显著缩小差距。
研究对象
这篇论文评测 Vid-LLM 对已编辑视频中的剪辑元素与剪辑语法的理解。任务覆盖镜头尺寸、角度、地点、主体、类型、色彩、镜头运动、速度、cut 与 transition,并分为三个层级:
- Recognition:识别出现了什么剪辑元素;
- Reasoning:解释判断该元素的具体依据;
- Judging:判断该元素在视频中的叙事或表达功能。
文本驱动编辑执行、编辑结果质量与 T2V prompt 满足性属于相邻评测坐标。
Benchmark 规模
- 19 个细粒度任务
- 10 个剪辑维度
- 识别、推理、判断 3 个层级
- 30,000 个视频
- 49,536 个 QA
- 训练集 45,154 条,测试集 4,382 条
论文结合剪辑知识库、人工标注与 MLLM 辅助流程构造 reasoning / judging 数据,并用结构化 evaluator 评分开放式回答。
关键结果
论文评测 11 个通用 Vid-LLM:
| 模型/范围 | 总分或结论 |
|---|
| GPT-4o | 2.64/5 |
| 最强开源通用模型 LLaVA-OneVision | 1.98/5 |
| VEU-50K 微调的 Oscars | 2.54/5 |
| 当前模型的 reasoning / judging 平均表现 | 低于 2/5 |
部分模型在 shot speed 和 shot motion 识别上低于随机猜测。论文把这一弱点与统一采样策略联系起来;judging 任务还要求建立剪辑元素功能与具体内容之间的联系。
专门监督带来的缓解
作者以 Qwen2-VL-7B 为底座,用 VEU-50K 进行 LoRA 微调,得到专家模型 Oscars。其总分从基础模型对应水平提升至 2.54/5,接近 GPT-4o 的 2.64/5。
该结果给出清晰边界:通用模型在 VEU-Bench 上存在缺口,专门数据与监督能够显著改善该能力。
与 Wiki Claim 的关系
这篇论文直接支持:
Claim 的范围已经限定到:通用 Vid-LLM 对剪辑元素的识别、依据推理和功能判断。FiVE-Bench、NeuS-V、AIGV-Assessor 与 Video-Bench 分别补充编辑执行、时间逻辑满足性和生成视频质量评估,它们作为相关背景保留。
关键图示
首页与任务总览
!900
标注与评测流程
!900
主要实验结果
!900
局限
- 结论受剪辑 ontology、任务设计和评测协议影响。
- 论文覆盖 11 个模型,跨 benchmark 与真实剪辑工作流的泛化仍需复核。
- Oscars 证明专门监督有效;真实场景迁移需要进一步实验。
- 剪辑理解、编辑执行与结果质量需要多套互补 benchmark 联合判断。
原始链接
相关页面
元数据
{
"id": "2026-04-12-veu-bench",
"type": "source",
"title": "VEU-Bench:通用 Vid-LLM 的视频剪辑元素理解基准",
"title_en": "VEU-Bench: Benchmarking Video Editing Element Understanding in General Vid-LLMs",
"summary": "VEU-Bench 以 19 个任务和 49,536 个 QA 评测剪辑元素识别、推理与功能判断;通用 Vid-LLM 在高层任务上仍有明显缺口。",
"summary_en": "VEU-Bench evaluates recognition, reasoning, and functional judgment of editing elements with 19 tasks and 49,536 QA pairs, revealing clear gaps in general Vid-LLMs.",
"status": "reviewed",
"created": "2026-04-12",
"updated": "2026-07-10",
"venue": "CVPR 2025",
"ingested_at": "2026-04-12",
"tags": [
"near-cvpr-2025",
"video-editing",
"primary-source"
],
"note_status": "reviewed",
"source_type": "paper",
"authors": [
"Bozheng Li",
"Yongliang Wu",
"Yi Lu",
"Jiashuo Yu",
"Licheng Tang",
"Jiawang Cao",
"Wenqing Zhu",
"Yuyang Sun",
"Jay Wu",
"Wenbo Zhu"
],
"published_at": "2025-06-11",
"canonical_links": [
"https://openaccess.thecvf.com/content/CVPR2025/html/Li_VEU-Bench_Towards_Comprehensive_Understanding_of_Video_Editing_CVPR_2025_paper.html",
"https://openaccess.thecvf.com/content/CVPR2025/papers/Li_VEU-Bench_Towards_Comprehensive_Understanding_of_Video_Editing_CVPR_2025_paper.pdf"
],
"raw_entry": "raw/ingest/2026-04-12-veu-bench/",
"topics": [
"topics/video-editing",
"topics/video-generation",
"topics/generative-model-evaluation"
],
"entities": [
"entities/video-editing-understanding"
],
"claims": [
"claims/claim-current-models-still-struggle-to-understand-video-editing"
],
"questions": [
"questions/question-do-benchmarks-track-real-video-editing-understanding"
]
}