LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Video-Bench人类偏好对齐的视频生成评测

一句话结论

Video-Bench 证明 MLLM evaluator 不能靠一句 prompt 直接打总分:chain-of-query 与 few-shot scoring 显著提高对人工评分的相关性;但 human-aligned generation evaluation 仍不等于 video-editing understanding。

论文定位

它代表人类偏好对齐的视频生成评测路线:以 MLLM 同时评估条件对齐与质量,并用人工评分验证。与 VBench 的专用指标工具箱相比,Video-Bench 更像一个经过流程设计和标尺校准的通用视频裁判。

数据与评测维度

  • 419 个 prompt,每维约 70–90 个,每 prompt 生成 3 次。
  • 10 名标注者、每视频 4 份评分,共 35,196 次人工评价。
  • 主要评估 LaVie、Show-1、VideoCrafter2、CogVideoX、Pika-Beta、Kling、Gen3。
  • Video Quality:Imaging、Aesthetic、Temporal Consistency、Motion Effects。
  • Video-Condition Alignment:Object Class、Action、Color、Scene、Video-text Consistency。

方法

Chain-of-query

用于条件对齐:先由 MLLM 描述视频,再由 LLM 针对目标维度生成细化问题,MLLM 重新观察并回答,最后综合对话与评分规则。它把一次性跨模态比较拆成可审计的多轮核对。

Few-shot scoring

用于质量评分:同一 prompt 的多段生成视频成批作为相互参照,缓解“文字规则模糊导致所有视频都得中间分”。它保持 O(N) rating 成本,避免 pairwise O(N²)。

实现

GPT-4o-2024-08-06 处理视频帧,GPT-4o-mini 生成文本 query。论文公开详细评分 rubric 和完整 prompt,有助复现,但结果对闭源模型版本敏感。

核心结果

  • Gen3 总体第一:Imaging 4.66、Aesthetic 4.44、Temporal 4.74、Motion 3.99;CogVideoX 条件对齐平均排名第一。
  • 相对人类的 Spearman 相关为 0.402–0.750,九维均优于对照自动指标;时间一致性仍最低 0.402。
  • 人—人 Krippendorff α 平均 0.52,人—Video-Bench 0.50,人—裸 GPT 0.41。
  • 三次重复精确同分率 67%,但 α=0.867;说明分数不是完全确定,却有较高等级一致性。
  • 人机并非无偏:时间一致性平均差 +0.31,运动效果 -0.26,99% CI 均不含 0。

消融与诊断

  • Few-shot scoring:质量平均相关性约 0.561→0.620;成像 0.639→0.733、美学 0.627→0.702。
  • Chain-of-query:条件对齐平均约 0.679→0.734;Video-text 0.671→0.732。
  • 1/3/5/7-shot 平均质量相关性 0.404/0.511/0.517/0.545,更多参照总体更好但不完全单调。
  • GPT-4o-0806 优于 Gemini1.5-Pro、Qwen2-VL 和其他 GPT-4o 版本;更新版本不必然更好,Motion Effects 在 1120 版明显回退。
  • Gaussian blur 下 Video-text 相对误差低于 5%;简单/复杂 prompt 的若干维度近似,提供有限鲁棒性证据。
  • mini-split 上 Sora 9 维中 5 维第一,但仅 25 prompt,且仍有文本不符、时序断裂和运动轨迹异常。

关键图示

评测框架与维度

!900

Chain-of-query 与 few-shot scoring

!900

主结果与人类对齐证据

!900

局限或疑问

  • evaluator 上限受 GPT-4o 动态细节/时间理解能力约束,Temporal 相关性只有 0.402。
  • 闭源版本变化会改分;论文“使用最优版本”可能带选择偏差。
  • few-shot 分数依赖同批参照集合,不一定可跨批绝对比较。
  • “human-aligned”对齐的是特定 rubric/标注群体,不是全部用户价值;人工自身语义一致性也低。
  • 419 prompt、短 T2V 输出,不含源视频保持、局部编辑、镜头选择、音频或长叙事。
  • 精选的人机分歧案例不足以支持“机器整体比人更客观”的强主张。
  • 闭源 API 带来成本、隐私、版本与可复现性问题。

对 benchmark question 的证据分类

维度分类解释
视频理解evaluator 依赖证据MLLM 用来打分,不是被测对象
生成质量直接强证据九维质量与条件对齐
人类偏好直接强但有偏35,196 人工评分、相关性与 inter-rater
长视频非目标短生成视频
时空世界理解间接输出证据可发现运动/物理错误,不证明世界模型
视频编辑理解边界证据可复用部分协议,但无源视频和编辑约束

对当前 wiki 判断的影响

Video-Bench 进一步确认评测要区分:感知质量、条件对齐、人类偏好、真实编辑理解。它支持 questions/question-do-benchmarks-track-real-video-editing-understanding 中“human preference 更强不自动等于更懂编辑”的判断,并给出量化依据:即使与人工平均一致性接近,人机在时间与运动维度仍存在系统偏差。

相关页面

原始链接