当前判断
有限支持 · 持续复核VEU-Bench 显示通用 Vid-LLM 在剪辑元素识别、依据推理和叙事功能判断上仍有明显缺口;专门监督可以显著改善。
反证与边界 0
当前没有登记反证;保持开放复核。
仍待验证
需要更多同规模、同预算、跨任务的受控比较,才能继续提升判断强度。
审计结论
Verdict:VEU-Bench 定义下的结论获得直接支持;跨任务外推仍需限制。
这里的“视频编辑理解”特指对已编辑视频中的镜头尺寸、角度、运动、速度、cut 和 transition 等剪辑元素进行识别、依据解释与叙事功能判断。它不等同于执行文本驱动的视频编辑,也不等同于评价编辑结果的感知质量或 T2V prompt 的形式化满足性。
本页于 2026-07-10 按 VEU-Bench 及四篇邻近评测论文重新核验。详细审计见 docs/evidence-audit/claim-semantic-audit-2026-07-10.md。
命题
VEU-Bench 测试的 11 个通用 Vid-LLM 在剪辑元素识别、推理和功能判断上仍有明显缺口。论文报告当前模型在推理与判断任务上的平均得分低于 2/5,部分模型在镜头速度和运动识别上甚至低于随机猜测。
直接支持证据:VEU-Bench
sources/2026-04-12-veu-bench 把视频剪辑元素理解组织为 19 个任务、10 个维度和识别/推理/判断三个层级:
- 数据规模:30,000 个视频、49,536 个 QA;
- GPT-4o 总分:2.64/5;
- 最强开源通用模型 LLaVA-OneVision:1.98/5;
- VEU-50K 专门微调的 Oscars:2.54/5;
- 推理与判断任务的模型平均得分低于 2/5。
这些结果直接支持“通用模型在该 benchmark 定义下仍有明显缺口”。Oscars 显著缩小差距,说明专门监督可以改善该能力。
相关但非判定性证据
编辑执行与结果质量
sources/2026-04-14-five-bench 评测 7 个视频编辑生成方法的细粒度对象级编辑结果。最高 FiVE-Acc 仍低于 50,所有方法在对象移除任务上失败。该结果证明当前编辑执行仍困难,论文没有证明失败原因就是剪辑理解不足;VLM 与人工评分接近也说明有限范围内的结果判断可以自动化。
T2V 时间逻辑满足性
sources/2026-04-14-neuro-symbolic-eval-t2v 研究复杂时间逻辑 prompt 的满足性及 evaluator 可信度。它直接支持“传统视觉质量指标会漏测 T2V 时间逻辑”,不测试视频剪辑元素理解。
生成视频质量评测进展
- sources/2026-04-14-aigv-assessor 评测 T2V 生成视频的感知质量,并取得较强的人类评分相关性。
- sources/2026-04-14-video-bench 评测 T2V 生成质量与条件对齐,Human–Video-Bench 的平均 Krippendorff’s α 接近 Human–Human。
这两篇论文说明生成视频 evaluator 正在进步,没有直接反驳通用 Vid-LLM 的剪辑语法理解缺口,因此从 evidence_against 移出。
边界条件
- 结论限定于 VEU-Bench 的剪辑元素、依据解释和功能判断任务;
- 结论对象是论文测试的通用 Vid-LLM;
- 专门微调模型已经显示显著改善;
- 仍需更多独立 benchmark 和真实剪辑工作流复核泛化性。
阶段性评估
对 VEU-Bench 定义下的通用模型短板为高置信;对“所有当前模型都无法真正理解视频编辑”的普遍外推不成立。 当前状态保持 monitored。