一句话结论
SOK-Bench 用 LLM/MLLM 把 YouCook2/HOMAGE 的视频描述、视觉标签和生成常识连成三类知识图,再生成约 10K situations/44K QA;问题设置把时空证据与反事实/目的推理结合起来,但 split 不透明、blind ChatGPT 达 36.5%、抽样 human validity 缺细节,合成标签与同族模型耦合限制了排名可信度。
Benchmark interface 与构建
- 输入视频+问题;输出四选一或直接短答案。12 类对象/动作问题覆盖 counterfactual、contribution、purpose、possibility、inference,并组合 spatiotemporal/general knowledge。
- 数据来自 YouCook2(2,000+ cooking videos)和 HOMAGE(1,752 home-activity clips),论文未清楚报告 train/val/test、来源占比、视频级去重与每类题数。
- SKG:LLM 解析原始时间描述,BLIP-2 补对象,MiniGPT-4 从关键帧生成属性/空间关系。
- GKG:LLM 按 usage/physical/chemical/cultural 等生成一般知识。
- SCKG:将视频内容与 GKG 结合,经 few-shot self-prompting 生成情境反事实、目的和贡献。
- 主 benchmark 用人工模板 bottom-up 生成;top-down LLM QA 每题需数秒,只做案例。
指标、human 与主结果
- MC accuracy:若整数选项解析失败,用输出与选项 BLEU 最大者代替。
- direct answer:BLEU + BERTScore-F1;无 LLM judge。
- human helpers 抽查报告 93.08% QA valid,但无样本量、评审数、rubric、agreement 或修订率。
- 四类对象题被判“必须看视频”的比例为 91%/99%/94%/99%,同样缺抽样细节。
| 模型 | MC overall | BLEU | BERTScore |
|---|---|---|---|
| blind ChatGPT | 0.365 | 0.052 | 0.886 |
| GPT-4V | 0.539 | 0.085 | 0.956 |
| Video-LLaMA | 0.264 | 0.036 | 0.961 |
| AskAnything | 0.455 | 0.110 | 0.959 |
BERTScore 全部约 0.95–0.96 且排名反常,基本饱和;自由答案无人工正确性评估。GPT-4V 的部分类型出现 0.000/1.000,暗示样本很少,论文又未清楚披露每模型题数/统一视频接口,不能与全量开源结果严格横比。
污染、泄漏与成本
- YouCook2/HOMAGE、字幕和 annotations 公开,预训练重叠未审计。
- SKG 很大程度从原始文字描述起步,任务混合视频 grounding 与字幕语义;blind ChatGPT 36.5% > 25% 随机,说明选项/常识捷径明显。
- LLM 生成 GKG/SCKG/答案/rationale,BLIP-2/MiniGPT-4 生成视觉标签;GPT family 又参与评测,存在 generator–evaluator family coupling。
- 44K QA 共享约 10K situations,不是独立样本;无 cluster CI、显著性或明确 split。
- 只给 top-down“每题数秒”的相对成本;无 API/token/美元/GPU-hours、人工复核工时或端到端单位成本。
能力边界
- 属于视频理解 + 情境常识/时空推理,不是视频生成质量评测。
- counterfactual、object contribution、action purpose 比一般 VideoQA 更接近编辑语义,但数据没有真实编辑结果。
- 没有 edit instruction、source/edited pair、变化区域、局部保持或生成时序质量,不能证明真实视频编辑理解。
- 自动 rationale 是生成标签,不是经验证的人类推理证据。
证据评级
B-(任务方向有价值、图结构明确;合成标签/同族耦合强,split、human、成本和自由答案指标证据不足)。