概述
这一页整理与视频剪辑相关的多层评测坐标。直接的“剪辑理解”指 Vid-LLM 对镜头属性、运动、cut、transition 及其功能的识别与推理;编辑执行、生成质量、人类偏好和形式化满足性分别由其他 benchmark 衡量。把这些坐标分开,才能判断每篇论文实际支持哪一类结论。
这个实体为什么重要
- 它把视频编辑从“看起来像成功”推进到“能否被系统评价为成功”。
- 它连接了视频编辑、视频理解与评测设计,是一个很典型的交叉层实体。
- 随着视频编辑论文增多,这一类 benchmark / evaluator 很可能会从单点工作演化成长期主题。
当前观察到的核心范围
剪辑元素与剪辑语法理解
- sources/2026-04-12-veu-bench 直接评测通用 Vid-LLM 对镜头属性、运动、cut、transition 的识别、依据推理与功能判断。
编辑执行与结果质量
- sources/2026-04-14-five-bench 评测细粒度对象级视频编辑是否完成,形成编辑成功率和失败类型的能力画像。它衡量执行结果,低成功率还可能来自生成、反演、控制与时序一致性。
生成视频的感知质量与人类偏好
- sources/2026-04-14-aigv-assessor 研究 AIGV / T2V 的感知质量 evaluator。
- sources/2026-04-14-video-bench 研究生成视频质量与条件对齐的人类偏好评测。
T2V 形式化满足性
- sources/2026-04-14-neuro-symbolic-eval-t2v 检查带时间逻辑的 T2V prompt 是否被满足,并分析 evaluator 与人工判断的相关性。
这条实体为什么比最初更厚了
这组论文现在构成四个互补坐标:
- VEU-Bench 测剪辑元素理解;
- FiVE-Bench 测细粒度编辑执行结果;
- AIGV-Assessor 与 Video-Bench 测生成视频质量和人类偏好;
- NeuS-V 测 T2V 时间逻辑满足性与 evaluator 可信度。
这些分支共同形成评测问题域,同时保留清晰的任务边界。
当前关系网络
- topics/video-editing 关心它能否真正暴露方法侧的理解短板。
- topics/generative-model-evaluation 把它放进更大的 benchmark / evaluator 演化中观察。
- claims/claim-current-models-still-struggle-to-understand-video-editing 负责持续判断当前模型是否真的仍然薄弱。
- questions/question-do-benchmarks-track-real-video-editing-understanding 则进一步追问这些评测之间是否能映射到真实任务能力。
证据
- sources/2026-04-12-veu-bench
- sources/2026-04-14-five-bench
- sources/2026-04-14-aigv-assessor
- sources/2026-04-14-video-bench
- sources/2026-04-14-neuro-symbolic-eval-t2v
当前判断
当前最稳妥的定位是:视频剪辑相关评测已经形成理解、执行、质量与形式化满足性四个互补坐标。VEU-Bench 直接支撑通用 Vid-LLM 的剪辑元素理解缺口,其余工作提供相邻评测背景。