Current view
Generative Model Evaluation
研究图像与视频生成、编辑和多模态系统的评测协议,重点判断指标是否测到目标能力、是否与人类判断一致,以及结论能否跨模型复现。
Reading path
- ProblemDefine task and evidence boundary
- MethodsCompare families and design choices
- EvidenceReturn to papers and searchable text
- Open questionsTrack unresolved tensions
Method family map
From problem definition to verifiable system capability
三分钟摘要
- 它研究什么:不是简单给模型排榜,而是验证“指标是否真的测到了论文声称的能力”。
- 当前共识:生成质量、条件一致性、运动、时序一致性、编辑保持性和真实用户偏好不能被一个分数完整概括。
- 主要风险:分布指标可能忽略指令语义,语义指标可能忽略视觉质量,大模型评审器(LLM/VLM judge)又会引入版本、提示和模型家族偏差。
- 研究机会:任务专用协议、可验证人工评测、低成本但不改变模型排序的采样,以及能定位失败原因的诊断集。
评测是整个研究链的测量仪器。如果测量对象、输入预算和统计协议没有先定义清楚,模型分数再精确也无法支持可靠结论。
任务或系统流程
一项生成模型评测怎样避免“先算分、后解释”?
先把论文主张拆成可观察能力,再组合自动指标、人工判断和失败诊断;最后必须通过重复采样、置信区间和跨模型检查验证结论。
- 明确主张指定要测生成质量、语义遵循、运动、保持性或工作流成功
- 固定协议冻结提示、随机种子、输入预算、模型版本与采样数量
- 多轴测量分布、语义、感知、时序和任务专用指标各司其职
- 人工校准用盲评和清晰问题检查自动指标是否跟随人类判断
- 失败诊断把低分还原为对象遗漏、关系错误、闪烁、漂移或编辑破坏
- 统计复核报告置信区间、评审一致性、敏感性和可复现实验资产
研究主张被拆为能力维度,能力决定样本与对照,自动指标和人工评测并行执行,再做失败诊断、统计复核和结论收窄。
当前综合判断
1. 不存在跨任务通用的“单一最好分数”
Inception Score(IS)和弗雷歇 Inception 距离(Fréchet Inception Distance, FID)为图像生成提供了分布级比较工具,CLIPScore 又把文本—图像一致性纳入自动评估(IS、FID、CLIPScore)。但三者测量对象不同:一个分数改善不能自动推出视觉质量、组合性和真实偏好都改善。
视频进一步增加运动幅度、时间一致性和镜头合理性。EvalCrafter 与 VBench 都采用多维评测,而 VideoCrafter2 的结果也说明外观质量强不等于运动与时序同样强(EvalCrafter、VBench、VideoCrafter2)。
2. 评测必须和任务中的“保持—改变”约束对齐
文本到图像生成、局部修补、指令编辑和视频编辑不能共用同一成功定义。EditBench 把对象、属性、绑定和质量拆开;FiVE-Bench 则要求视频编辑同时考虑指令完成、未编辑区域保持和时间稳定性(EditBench、FiVE-Bench)。只比较最终帧的语义相似度,会漏掉身份漂移、背景破坏和时间闪烁。
3. 大模型评审器是测量工具,不是无需校准的裁判
AIGV-Assessor 与 Video-Bench 说明视觉语言模型可以汇总复杂感知维度,但评审器版本、提示措辞、输入帧数和待评模型家族都会改变结果(AIGV-Assessor、Video-Bench)。可靠协议应公开评审提示、版本、重复次数和与独立人评的样本级相关性,不能只报告模型级四五个点的相关系数。
4. 输入预算和数据污染是评测结论的一部分
MVBench、LVBench 与 STI-Bench 分别覆盖短视频技能、长视频检索记忆和精确时空量化;它们不能互相替代(MVBench、LVBench、STI-Bench)。抽多少帧、是否提供字幕、视频多长、答案是否能靠语言先验猜出,都会决定分数到底在测视频还是测捷径。
5. 好的 benchmark 应定位失败,而不只是扩大题量
HallusionBench、GlitchBench、SOK-Bench、ANetQA、神经符号视频生成评测分别针对幻觉、动态异常、情境常识、组合问答和形式化约束(HallusionBench、GlitchBench、SOK-Bench、ANetQA、神经符号评测)。这类诊断集的价值在于解释模型为什么失败,而不是把不同能力压成一个平均分。
近五年演化(2022—2026)
近五年生成与多模态评测的重点如何变化?
演化主线是从通用自动分数,转向任务专用维度、人评可复现、长视频输入控制和评审器审计。
- 2022图像编辑开始把对象、属性、绑定和视觉质量分别验收
- 2023人工评测的任务定义、标注一致性与可复现性成为研究对象
- 2024视频生成形成多维套件,并研究代表性提示采样以降低评测成本
- 2025长视频、精确时空、细粒度视频编辑和大模型评审器快速扩展
- 2026可信结论要求披露输入预算、评审器版本、失败类型与统计不确定性
2022 年前后形成编辑专用维度,2023 年强调可验证人评,2024 年出现视频多维套件和低成本采样,2025 年聚焦长视频、细粒度编辑与模型评审器,2026 年收敛为可复核证据协议。
这条演化不是旧指标被完全淘汰。FID、CLIPScore 等仍适合规模化筛选,但它们应成为证据组合的一部分,而不是论文结论的唯一支柱。
方法家族与成熟阶段
方法家族的成熟度
分布与表征指标
IS、FID 和 CLIPScore 已成为图像生成的常用自动测量,但分别受特征空间、样本量和语义捷径限制。
明确适用边界、置信区间和跨域稳定性,而不是再造一个未经人评校准的综合分。
任务专用多维 benchmark
VBench、EvalCrafter、EditBench 和 FiVE-Bench 把生成、编辑、运动与保持约束拆成不同维度。
验证维度是否互相独立,能否预测真实用户任务成功,以及模型排名是否对提示分布稳定。
可验证人工评测
可验证文本到图像人评工作强调清晰问题、盲评和协议复现;Video-Bench 尝试将人类偏好结构化。
降低标注成本,同时保留评审一致性、置信度和失败原因。
大模型自动评审
AIGV-Assessor、Video-Bench 等显示多模态评审器能覆盖复杂维度,但时间一致性和版本鲁棒性仍有限。
评审器交叉验证、模型家族偏差、顺序偏差、提示敏感性与拒答机制。
快速与自适应评测
FlashEval 用代表性提示子集降低成本,但搜索成本和跨模型复用边界必须单独核算。
在给定误差容忍度下选择样本,并验证小样本不会改变模型排序或掩盖长尾失败。
自动指标、人评、模型评审器和诊断集应怎样分工?
四类方法分别解决规模、真实偏好、复杂语义和失败定位;可靠研究需要交叉验证,而不是互相替代。
- 分布与表征指标高吞吐比较样本集合,但不能解释具体失败
- 任务专用指标对齐对象、属性、运动、保持性等明确约束
- 人工盲评最接近真实偏好,但成本高且需要一致性控制
- 多模态评审器可扩展复杂判断,但必须审计版本和模型偏差
- 诊断 benchmark用反事实或压力测试定位捷径与能力缺口
- 统计与复现通过重复、区间和敏感性决定结论能否成立
分布和语义指标负责规模化筛选,任务专用指标负责约束验收,人工与模型评审器负责偏好判断,诊断集负责失败归因,统计层贯穿所有方法。
拥挤方向与研究机会
- 相对拥挤:把多个旧指标线性相加、只在少量模型上报告相关性、只扩大题量却不检查捷径。
- 仍有价值:编辑保持性与局部证据、长视频输入预算、真实工作流成功率、评审器跨版本稳定性。
- 高价值交界:研究“低成本评测是否保持模型排序”时,同时测总体排名、长尾失败和不同模型家族,避免只优化平均相关性。
- 可形成资产的方向:公开提示、样本、评审说明、原始评分、置信区间和失败标签;一个透明的小 benchmark 往往比一个不可审计的大分数更有长期价值。
反方证据、局限与可证伪条件
最强反方意见是:benchmark 很容易快速过时,模型可能针对公开测试集调优,而新指标也可能只是换一种偏好。因此“与人评相关”不能单独证明指标有效。
一项评测研究至少应满足:
- 在未参与指标设计的模型家族和提示分布上复测;
- 同时报告模型级与样本级一致性,避免少数模型点造成虚高相关;
- 公开输入预算、评审器版本、提示模板和随机性;
- 加入简单启发式、文本先验或静态帧基线,确认任务确实需要目标能力;
- 预先规定失败条件:若新协议不能稳定区分已知能力差异,或排序对样本轻微变化高度敏感,应收窄结论。
研究生可行的研究入口
候选课题 A:视频编辑的保持—改变评测最推荐
Expand research designCollapse research design
编辑指令完成度、未编辑区域保持、身份一致性和时间稳定性如何被分开测量?
选两类编辑任务、3—5 个公开模型和约 300 个样本,建立区域/时间约束、自动指标与盲评对照。
任务协议、失败标签和跨指标一致性,而不是训练更大的生成模型。
若标注者无法稳定理解任务,先缩小到对象替换或局部属性编辑,不继续扩任务。
候选课题 B:多模态评审器的偏差与版本鲁棒性推荐
Expand research designCollapse research design
评审器模型、提示、帧采样和候选顺序变化会在多大程度上改变生成模型排名?
固定视频集合,交叉比较两个评审器、两种帧预算、两套提示和人工盲评。
偏差分解、校准方法与可复现评审脚本。
若无法取得稳定人工基准,就将研究收窄为测量不确定性报告,不声称“更接近人类”。
候选课题 C:保序的低成本评测采样条件推荐
Expand research designCollapse research design
能否用更少提示和样本保持总体排序,同时不丢失长尾失败?
在公开 benchmark 上比较随机、聚类和难例感知采样,报告排序相关、置信区间与失败覆盖率。
质量—成本曲线和跨模型复用边界。
若子集只对参与选择的模型有效,应将结论限定为一次性评测压缩。
推荐排序与止损条件
- 首选 A,任务定义具体、算力低且能直接连接图像/视频编辑研究。
- 偏测量科学与多模态模型时选 B;偏系统和统计时选 C。
- 不建议把“提出一个总分”当作首个课题,除非已有大规模、独立且可复核的人类判断。
证据基础
- 通用图像指标:Inception Score、FID、CLIPScore。
- 图像生成与编辑:EditBench、FlashEval、可验证人工评测。
- 视频生成与编辑:EvalCrafter、VBench、VideoCrafter2、Video-Bench、AIGV-Assessor、FiVE-Bench、VEU-Bench。
- 视频理解压力测试:MVBench、LVBench、STI-Bench、SOK-Bench、ANetQA。
- 失败与组合性诊断:HallusionBench、GlitchBench、神经符号视频评测、MMMU、MAPLM、ConCon-Chi。
开放问题
- 现有 benchmark 是否追踪真实视频编辑理解
- 模型评审器如何在版本更新后保持纵向可比?
- 怎样在低成本评测中保留少数但高风险的失败?
- 用户工作流成功率与离线感知指标之间能否建立稳定关系?