LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

MMMU跨学科专家级多模态理解与推理基准

一句话结论

MMMU 用 11,550 道大学级静态多模态题覆盖 30 学科/30 图像类型,规则评分避免 LLM judge;GPT-4V test 55.7%,按学科聚合的人类 validation 中位 82.6%,但 94% 为选择题、教材/考试公开来源污染难审计,且它不能代替视频或编辑专项评测。

接口与数据构建

  • 输入英语题目及一张/多张交错静态图像;输出选择项或短答案。
  • 11,550 questions;dev/validation/test = 150/900/10,500;6 disciplines、30 subjects、183 subfields、30 image types。
  • 10,861 MC(94.03%)、689 open;854 multi-image;难度 easy/medium/hard = 28%/45%/27%。
  • 50+ 专业大学生从免费在线资源、quizzes、textbooks、lecture materials 收集/新编,初始 13K;内部去重、格式复核并删除约 10% very easy。
  • 协议称 secondary review 和随机 audit,但无每题复核率、agreement、总工时/报酬与来源许可证清单。

指标、human 与模型结果

  • micro-accuracy;规则/正则提取最终答案,不用 LLM judge。MC 无法抽取时随机选,open 无法抽取记错,格式服从性会进入分数。
  • 90 名高年级学生:每 subject 3 人,各答本专业 30 道 validation,可查教材不可上网;worst/median/best 76.2/82.6/88.6。它是按专业聚合,不是单人跨 30 学科通才。
模型ValidationTest
Random22.123.9
BLIP-2 FLAN-T5-XXL35.434.0
LLaVA-1.6-34B(外部)51.144.7
InternVL-Chat-V1.2(外部)51.646.2
GPT-4V Playground56.855.7
GPT-4o(外部)69.1--

GPT-4V easy/medium/hard = 76.1/55.6/31.2;150 个 GPT-4V errors 的人工主因:perception 35%、knowledge 29%、reasoning 26%、其余为文本理解/拒答/标注/抽取。单模型、小样本、无 agreement,属于诊断而非稳定因果分解。

污染、成本与可比性

  • 教材、考试、quizzes 与公开网页很可能进入 foundation-model pretraining。选择“答案不立即可见”的题不是 contamination detection。
  • lexical/source-URL 去重只处理 benchmark 内部重复;无外部语料重叠、canary 或训练截止时间审计。
  • validation 上 prompt engineering 合规,但长期 leaderboard 会过拟合;test/论文版本持续加外部报告结果,API 日期和运行口径不统一。
  • 本地实验只注明 A100;无 GPU-hours、API 成本、分辨率、延迟、失败重试。数据侧也无总人时/费用。

能力边界

  • 属于静态多图 vision-language expert reasoning
  • 没有时间维、帧采样、动作/事件顺序,不是视频理解 benchmark
  • 不评生成 fidelity/alignment/aesthetics,也不排名生成器。
  • 没有 source-target pair、编辑指令、变化定位或 preservation,不评真实编辑理解;只能提供通用多模态推理上位参照。
  • “Expert AGI”是 framing;micro accuracy 不覆盖工具、校准、可靠性、长期任务与专业部署安全。

证据评级

B+(覆盖广、规则评分清楚;公开教材污染、选择题主导、成本和跨版本可比性不足)

原始链接

相关页面