LLLMWIKI
ArticleResearch mapReading portalMetadata

Topic · Updated 2026-07-14

Generative Model Evaluation

研究图像与视频生成、编辑和多模态系统的评测协议,重点判断指标是否测到目标能力、是否与人类判断一致,以及结论能否跨模型复现。

Current view

Generative Model Evaluation

研究图像与视频生成、编辑和多模态系统的评测协议,重点判断指标是否测到目标能力、是否与人类判断一致,以及结论能否跨模型复现。

24 Source notes1 Open questions

Reading path

  1. ProblemDefine task and evidence boundary
  2. MethodsCompare families and design choices
  3. EvidenceReturn to papers and searchable text
  4. Open questionsTrack unresolved tensions

Method family map

From problem definition to verifiable system capability

24 Source notes
1ProblemDefine task and evidence boundary
2MethodsCompare families and design choices
3EvidenceReturn to papers and searchable text
4Open questionsTrack unresolved tensions

三分钟摘要

  • 它研究什么:不是简单给模型排榜,而是验证“指标是否真的测到了论文声称的能力”。
  • 当前共识:生成质量、条件一致性、运动、时序一致性、编辑保持性和真实用户偏好不能被一个分数完整概括。
  • 主要风险:分布指标可能忽略指令语义,语义指标可能忽略视觉质量,大模型评审器(LLM/VLM judge)又会引入版本、提示和模型家族偏差。
  • 研究机会:任务专用协议、可验证人工评测、低成本但不改变模型排序的采样,以及能定位失败原因的诊断集。

评测是整个研究链的测量仪器。如果测量对象、输入预算和统计协议没有先定义清楚,模型分数再精确也无法支持可靠结论。

任务或系统流程

一项生成模型评测怎样避免“先算分、后解释”?

从研究主张到可复核结论

先把论文主张拆成可观察能力,再组合自动指标、人工判断和失败诊断;最后必须通过重复采样、置信区间和跨模型检查验证结论。

  1. 明确主张指定要测生成质量、语义遵循、运动、保持性或工作流成功
  2. 固定协议冻结提示、随机种子、输入预算、模型版本与采样数量
  3. 多轴测量分布、语义、感知、时序和任务专用指标各司其职
  4. 人工校准用盲评和清晰问题检查自动指标是否跟随人类判断
  5. 失败诊断把低分还原为对象遗漏、关系错误、闪烁、漂移或编辑破坏
  6. 统计复核报告置信区间、评审一致性、敏感性和可复现实验资产
Diagram evidence可验证人工评测VBenchVideo-Bench

研究主张被拆为能力维度,能力决定样本与对照,自动指标和人工评测并行执行,再做失败诊断、统计复核和结论收窄。

当前综合判断

1. 不存在跨任务通用的“单一最好分数”

Inception Score(IS)和弗雷歇 Inception 距离(Fréchet Inception Distance, FID)为图像生成提供了分布级比较工具,CLIPScore 又把文本—图像一致性纳入自动评估(ISFIDCLIPScore)。但三者测量对象不同:一个分数改善不能自动推出视觉质量、组合性和真实偏好都改善。

视频进一步增加运动幅度、时间一致性和镜头合理性。EvalCrafter 与 VBench 都采用多维评测,而 VideoCrafter2 的结果也说明外观质量强不等于运动与时序同样强(EvalCrafterVBenchVideoCrafter2)。

2. 评测必须和任务中的“保持—改变”约束对齐

文本到图像生成、局部修补、指令编辑和视频编辑不能共用同一成功定义。EditBench 把对象、属性、绑定和质量拆开;FiVE-Bench 则要求视频编辑同时考虑指令完成、未编辑区域保持和时间稳定性(EditBenchFiVE-Bench)。只比较最终帧的语义相似度,会漏掉身份漂移、背景破坏和时间闪烁。

3. 大模型评审器是测量工具,不是无需校准的裁判

AIGV-Assessor 与 Video-Bench 说明视觉语言模型可以汇总复杂感知维度,但评审器版本、提示措辞、输入帧数和待评模型家族都会改变结果(AIGV-AssessorVideo-Bench)。可靠协议应公开评审提示、版本、重复次数和与独立人评的样本级相关性,不能只报告模型级四五个点的相关系数。

4. 输入预算和数据污染是评测结论的一部分

MVBench、LVBench 与 STI-Bench 分别覆盖短视频技能、长视频检索记忆和精确时空量化;它们不能互相替代(MVBenchLVBenchSTI-Bench)。抽多少帧、是否提供字幕、视频多长、答案是否能靠语言先验猜出,都会决定分数到底在测视频还是测捷径。

5. 好的 benchmark 应定位失败,而不只是扩大题量

HallusionBench、GlitchBench、SOK-Bench、ANetQA、神经符号视频生成评测分别针对幻觉、动态异常、情境常识、组合问答和形式化约束(HallusionBenchGlitchBenchSOK-BenchANetQA神经符号评测)。这类诊断集的价值在于解释模型为什么失败,而不是把不同能力压成一个平均分。

近五年演化(2022—2026)

近五年生成与多模态评测的重点如何变化?

评测从单分数走向证据协议

演化主线是从通用自动分数,转向任务专用维度、人评可复现、长视频输入控制和评审器审计。

  1. 2022图像编辑开始把对象、属性、绑定和视觉质量分别验收
  2. 2023人工评测的任务定义、标注一致性与可复现性成为研究对象
  3. 2024视频生成形成多维套件,并研究代表性提示采样以降低评测成本
  4. 2025长视频、精确时空、细粒度视频编辑和大模型评审器快速扩展
  5. 2026可信结论要求披露输入预算、评审器版本、失败类型与统计不确定性
Diagram evidenceEditBench可验证人工评测VBenchFlashEvalFiVE-Bench

2022 年前后形成编辑专用维度,2023 年强调可验证人评,2024 年出现视频多维套件和低成本采样,2025 年聚焦长视频、细粒度编辑与模型评审器,2026 年收敛为可复核证据协议。

这条演化不是旧指标被完全淘汰。FID、CLIPScore 等仍适合规模化筛选,但它们应成为证据组合的一部分,而不是论文结论的唯一支柱。

方法家族与成熟阶段

方法家族的成熟度

Current stage成熟底座

分布与表征指标

Evidence anchors

IS、FID 和 CLIPScore 已成为图像生成的常用自动测量,但分别受特征空间、样本量和语义捷径限制。

Research opportunity

明确适用边界、置信区间和跨域稳定性,而不是再造一个未经人评校准的综合分。

Current stage活跃发展期

任务专用多维 benchmark

Evidence anchors

VBench、EvalCrafter、EditBench 和 FiVE-Bench 把生成、编辑、运动与保持约束拆成不同维度。

Research opportunity

验证维度是否互相独立,能否预测真实用户任务成功,以及模型排名是否对提示分布稳定。

Current stage系统优化期

可验证人工评测

Evidence anchors

可验证文本到图像人评工作强调清晰问题、盲评和协议复现;Video-Bench 尝试将人类偏好结构化。

Research opportunity

降低标注成本,同时保留评审一致性、置信度和失败原因。

Current stage早期整合期

大模型自动评审

Evidence anchors

AIGV-Assessor、Video-Bench 等显示多模态评审器能覆盖复杂维度,但时间一致性和版本鲁棒性仍有限。

Research opportunity

评审器交叉验证、模型家族偏差、顺序偏差、提示敏感性与拒答机制。

Current stage评测建设期

快速与自适应评测

Evidence anchors

FlashEval 用代表性提示子集降低成本,但搜索成本和跨模型复用边界必须单独核算。

Research opportunity

在给定误差容忍度下选择样本,并验证小样本不会改变模型排序或掩盖长尾失败。

自动指标、人评、模型评审器和诊断集应怎样分工?

不同评测方法测量什么

四类方法分别解决规模、真实偏好、复杂语义和失败定位;可靠研究需要交叉验证,而不是互相替代。

  1. 分布与表征指标高吞吐比较样本集合,但不能解释具体失败
  2. 任务专用指标对齐对象、属性、运动、保持性等明确约束
  3. 人工盲评最接近真实偏好,但成本高且需要一致性控制
  4. 多模态评审器可扩展复杂判断,但必须审计版本和模型偏差
  5. 诊断 benchmark用反事实或压力测试定位捷径与能力缺口
  6. 统计与复现通过重复、区间和敏感性决定结论能否成立
Diagram evidenceFIDCLIPScore可验证人工评测HallusionBench

分布和语义指标负责规模化筛选,任务专用指标负责约束验收,人工与模型评审器负责偏好判断,诊断集负责失败归因,统计层贯穿所有方法。

拥挤方向与研究机会

  • 相对拥挤:把多个旧指标线性相加、只在少量模型上报告相关性、只扩大题量却不检查捷径。
  • 仍有价值:编辑保持性与局部证据、长视频输入预算、真实工作流成功率、评审器跨版本稳定性。
  • 高价值交界:研究“低成本评测是否保持模型排序”时,同时测总体排名、长尾失败和不同模型家族,避免只优化平均相关性。
  • 可形成资产的方向:公开提示、样本、评审说明、原始评分、置信区间和失败标签;一个透明的小 benchmark 往往比一个不可审计的大分数更有长期价值。

反方证据、局限与可证伪条件

最强反方意见是:benchmark 很容易快速过时,模型可能针对公开测试集调优,而新指标也可能只是换一种偏好。因此“与人评相关”不能单独证明指标有效。

一项评测研究至少应满足:

  1. 在未参与指标设计的模型家族和提示分布上复测;
  2. 同时报告模型级与样本级一致性,避免少数模型点造成虚高相关;
  3. 公开输入预算、评审器版本、提示模板和随机性;
  4. 加入简单启发式、文本先验或静态帧基线,确认任务确实需要目标能力;
  5. 预先规定失败条件:若新协议不能稳定区分已知能力差异,或排序对样本轻微变化高度敏感,应收窄结论。

研究生可行的研究入口

候选课题 A:视频编辑的保持—改变评测最推荐

Expand research designCollapse research design
精确研究问题

编辑指令完成度、未编辑区域保持、身份一致性和时间稳定性如何被分开测量?

最小实验

选两类编辑任务、3—5 个公开模型和约 300 个样本,建立区域/时间约束、自动指标与盲评对照。

主要贡献

任务协议、失败标签和跨指标一致性,而不是训练更大的生成模型。

止损条件

若标注者无法稳定理解任务,先缩小到对象替换或局部属性编辑,不继续扩任务。

候选课题 B:多模态评审器的偏差与版本鲁棒性推荐

Expand research designCollapse research design
精确研究问题

评审器模型、提示、帧采样和候选顺序变化会在多大程度上改变生成模型排名?

最小实验

固定视频集合,交叉比较两个评审器、两种帧预算、两套提示和人工盲评。

主要贡献

偏差分解、校准方法与可复现评审脚本。

止损条件

若无法取得稳定人工基准,就将研究收窄为测量不确定性报告,不声称“更接近人类”。

候选课题 C:保序的低成本评测采样条件推荐

Expand research designCollapse research design
精确研究问题

能否用更少提示和样本保持总体排序,同时不丢失长尾失败?

最小实验

在公开 benchmark 上比较随机、聚类和难例感知采样,报告排序相关、置信区间与失败覆盖率。

主要贡献

质量—成本曲线和跨模型复用边界。

止损条件

若子集只对参与选择的模型有效,应将结论限定为一次性评测压缩。

推荐排序与止损条件

  • 首选 A,任务定义具体、算力低且能直接连接图像/视频编辑研究。
  • 偏测量科学与多模态模型时选 B;偏系统和统计时选 C。
  • 不建议把“提出一个总分”当作首个课题,除非已有大规模、独立且可复核的人类判断。

证据基础

开放问题

相关页面