LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings)按需推理的视频理解框架

VideoAuto-R1:按需推理的视频理解框架

会议 / 来源:arXiv preprint;CVPR 2026 accepted claim pending official proceedings
发表日期:2026-03-21
资料加入日期:2026-05-12

一句话结论

VideoAuto-R1 用“初始回答—推理—复核回答”训练与置信度 early exit,把语言 CoT 集中给真正困难的视频问题;Qwen2.5-VL 版本把 VideoMMMU 从 54.7% 提升到 58.6%,平均响应为 44 tokens。

论文定位

这篇论文关注视频 MLLM 的推理预算。它发现固定 CoT 在多数感知型视频问题上会增加数百 token,并可能降低精度;真正稳定受益的样本主要涉及数学、物理、符号和多步推理。论文覆盖 VideoQA、temporal grounding 与 grounding QA,体育动作纠正属于迁移应用设想。

方法概述

  1. Answer–Think–Answer:统一输出初始短答案、<think> 推理和复核答案,困难样本允许 fallback。
  2. Dual-answer GRPO:初始/复核答案权重为 0.9/1.1,加入格式奖励和 0.3 fallback bonus。
  3. Confidence early exit:先解码初始答案,平均 token probability 达到阈值 0.97 时直接返回,低置信样本继续推理。

训练使用过滤后的 83K text/image/video 样本;Qwen2.5-VL-7B 与 Qwen3-VL-8B 基座冻结视觉编码器,训练 projector 和 LLM。训练成本为 32×H100、约 35 小时。

核心实验与结果

  • Qwen2.5-VL:VideoMME 66.0→67.3,VideoMMMU 54.7→58.6,MVP 36.5→39.4。
  • 平均响应长度 44 tokens;MVBench think ratio 25%,VideoMMMU 51%。
  • Charades-STA mIoU 52.9→60.0,ActivityNet 26.9→47.6,NExT-GQA accuracy/mIoU 53.3/20.2→80.6/36.7。
  • Temporal grounding 的初始答案、复核答案和 auto 模式结果完全相同,说明语言 CoT 没有继续修正时间边界。

依据:PDF Table 3、4、6、8、9、16;详细定位见 raw/ingest/2026-05-12-videoauto-r1/analysis.md

关键消融

  • Fixed CoT 在 VideoMME/LongVideoBench 上常与 direct answering 持平或更差。
  • Fixed-CoT RL 响应 149 tokens,VideoAuto-R1 为 44 tokens,并在 VideoMMMU 上更高。
  • 训练期 think/no-think 分类出现 mode collapse;测试时置信度路由更稳定。
  • VideoMMMU 初始平均置信度 0.874、think ratio 51%,获得约 +4 点;MVBench 初始置信度 0.948、think ratio 25%,只提升 0.1 点。
  • 低质量 CoT SFT 将 VideoMME/MVBench/VideoMMMU 降至 60.1/64.0/53.8。

局限或疑问

  • 置信度没有在训练目标中显式校准,跨领域阈值可靠性需要验证。
  • 语言 CoT 对视觉漏检和精确 temporal boundary 的修正能力有限。
  • 响应 token 下降无法代表完整系统延迟;64–2048 帧视觉编码成本仍然存在。
  • 主结果同时受 83K 数据、GRPO、dual-answer reward 和路由机制影响。
  • 体育动作纠正需要额外的姿态、轨迹、错误模式和教练反馈标注。
  • CVPR 2026 accepted claim 等待 official proceedings 核验。

对体育 AI 子线的影响

这篇论文支持“按需解释”机制:第一阶段输出 stroke/error 候选与置信度,高置信样本给短反馈,低置信或多因素样本进入解释和复核。它与 sources/2026-05-12-trackmae 的关系属于潜在上下游组合;当前没有联合实验。

对于 questions/question-badminton-stroke-correction-demo,early exit 可以作为产品策略,教练标注需要同时校准答案正确性、解释正确性和误导风险。

证据评级

  • 视频 QA / temporal grounding:直接证据,中等偏强。
  • 按需推理的 token 效率:直接证据,中等。
  • 体育动作纠正:间接方法证据。
  • CVPR 2026 venue:待官方 proceedings 核验。

原始材料

  • raw/ingest/2026-05-12-videoauto-r1/paper.pdf
  • raw/ingest/2026-05-12-videoauto-r1/paper-text.md
  • raw/ingest/2026-05-12-videoauto-r1/analysis.md
  • raw/ingest/2026-05-12-videoauto-r1/abstract.md
  • raw/ingest/2026-05-12-videoauto-r1/links.yaml

相关页面