LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

SOK-Bench结合开放世界知识的情境视频推理基准

一句话结论

SOK-Bench 用 LLM/MLLM 把 YouCook2/HOMAGE 的视频描述、视觉标签和生成常识连成三类知识图,再生成约 10K situations/44K QA;问题设置把时空证据与反事实/目的推理结合起来,但 split 不透明、blind ChatGPT 达 36.5%、抽样 human validity 缺细节,合成标签与同族模型耦合限制了排名可信度。

Benchmark interface 与构建

  • 输入视频+问题;输出四选一或直接短答案。12 类对象/动作问题覆盖 counterfactual、contribution、purpose、possibility、inference,并组合 spatiotemporal/general knowledge。
  • 数据来自 YouCook2(2,000+ cooking videos)和 HOMAGE(1,752 home-activity clips),论文未清楚报告 train/val/test、来源占比、视频级去重与每类题数。
  • SKG:LLM 解析原始时间描述,BLIP-2 补对象,MiniGPT-4 从关键帧生成属性/空间关系。
  • GKG:LLM 按 usage/physical/chemical/cultural 等生成一般知识。
  • SCKG:将视频内容与 GKG 结合,经 few-shot self-prompting 生成情境反事实、目的和贡献。
  • 主 benchmark 用人工模板 bottom-up 生成;top-down LLM QA 每题需数秒,只做案例。

指标、human 与主结果

  • MC accuracy:若整数选项解析失败,用输出与选项 BLEU 最大者代替。
  • direct answer:BLEU + BERTScore-F1;无 LLM judge。
  • human helpers 抽查报告 93.08% QA valid,但无样本量、评审数、rubric、agreement 或修订率。
  • 四类对象题被判“必须看视频”的比例为 91%/99%/94%/99%,同样缺抽样细节。
模型MC overallBLEUBERTScore
blind ChatGPT0.3650.0520.886
GPT-4V0.5390.0850.956
Video-LLaMA0.2640.0360.961
AskAnything0.4550.1100.959

BERTScore 全部约 0.95–0.96 且排名反常,基本饱和;自由答案无人工正确性评估。GPT-4V 的部分类型出现 0.000/1.000,暗示样本很少,论文又未清楚披露每模型题数/统一视频接口,不能与全量开源结果严格横比。

污染、泄漏与成本

  • YouCook2/HOMAGE、字幕和 annotations 公开,预训练重叠未审计。
  • SKG 很大程度从原始文字描述起步,任务混合视频 grounding 与字幕语义;blind ChatGPT 36.5% > 25% 随机,说明选项/常识捷径明显。
  • LLM 生成 GKG/SCKG/答案/rationale,BLIP-2/MiniGPT-4 生成视觉标签;GPT family 又参与评测,存在 generator–evaluator family coupling。
  • 44K QA 共享约 10K situations,不是独立样本;无 cluster CI、显著性或明确 split。
  • 只给 top-down“每题数秒”的相对成本;无 API/token/美元/GPU-hours、人工复核工时或端到端单位成本。

能力边界

  • 属于视频理解 + 情境常识/时空推理,不是视频生成质量评测。
  • counterfactual、object contribution、action purpose 比一般 VideoQA 更接近编辑语义,但数据没有真实编辑结果。
  • 没有 edit instruction、source/edited pair、变化区域、局部保持或生成时序质量,不能证明真实视频编辑理解
  • 自动 rationale 是生成标签,不是经验证的人类推理证据。

证据评级

B-(任务方向有价值、图结构明确;合成标签/同族耦合强,split、human、成本和自由答案指标证据不足)

原始链接

相关页面