VideoAuto-R1:按需推理的视频理解框架
会议 / 来源:arXiv preprint;CVPR 2026 accepted claim pending official proceedings
发表日期:2026-03-21
资料加入日期:2026-05-12
一句话结论
VideoAuto-R1 用“初始回答—推理—复核回答”训练与置信度 early exit,把语言 CoT 集中给真正困难的视频问题;Qwen2.5-VL 版本把 VideoMMMU 从 54.7% 提升到 58.6%,平均响应为 44 tokens。
论文定位
这篇论文关注视频 MLLM 的推理预算。它发现固定 CoT 在多数感知型视频问题上会增加数百 token,并可能降低精度;真正稳定受益的样本主要涉及数学、物理、符号和多步推理。论文覆盖 VideoQA、temporal grounding 与 grounding QA,体育动作纠正属于迁移应用设想。
方法概述
- Answer–Think–Answer:统一输出初始短答案、
<think>推理和复核答案,困难样本允许 fallback。 - Dual-answer GRPO:初始/复核答案权重为 0.9/1.1,加入格式奖励和 0.3 fallback bonus。
- Confidence early exit:先解码初始答案,平均 token probability 达到阈值 0.97 时直接返回,低置信样本继续推理。
训练使用过滤后的 83K text/image/video 样本;Qwen2.5-VL-7B 与 Qwen3-VL-8B 基座冻结视觉编码器,训练 projector 和 LLM。训练成本为 32×H100、约 35 小时。
核心实验与结果
- Qwen2.5-VL:VideoMME 66.0→67.3,VideoMMMU 54.7→58.6,MVP 36.5→39.4。
- 平均响应长度 44 tokens;MVBench think ratio 25%,VideoMMMU 51%。
- Charades-STA mIoU 52.9→60.0,ActivityNet 26.9→47.6,NExT-GQA accuracy/mIoU 53.3/20.2→80.6/36.7。
- Temporal grounding 的初始答案、复核答案和 auto 模式结果完全相同,说明语言 CoT 没有继续修正时间边界。
依据:PDF Table 3、4、6、8、9、16;详细定位见 raw/ingest/2026-05-12-videoauto-r1/analysis.md。
关键消融
- Fixed CoT 在 VideoMME/LongVideoBench 上常与 direct answering 持平或更差。
- Fixed-CoT RL 响应 149 tokens,VideoAuto-R1 为 44 tokens,并在 VideoMMMU 上更高。
- 训练期 think/no-think 分类出现 mode collapse;测试时置信度路由更稳定。
- VideoMMMU 初始平均置信度 0.874、think ratio 51%,获得约 +4 点;MVBench 初始置信度 0.948、think ratio 25%,只提升 0.1 点。
- 低质量 CoT SFT 将 VideoMME/MVBench/VideoMMMU 降至 60.1/64.0/53.8。
局限或疑问
- 置信度没有在训练目标中显式校准,跨领域阈值可靠性需要验证。
- 语言 CoT 对视觉漏检和精确 temporal boundary 的修正能力有限。
- 响应 token 下降无法代表完整系统延迟;64–2048 帧视觉编码成本仍然存在。
- 主结果同时受 83K 数据、GRPO、dual-answer reward 和路由机制影响。
- 体育动作纠正需要额外的姿态、轨迹、错误模式和教练反馈标注。
- CVPR 2026 accepted claim 等待 official proceedings 核验。
对体育 AI 子线的影响
这篇论文支持“按需解释”机制:第一阶段输出 stroke/error 候选与置信度,高置信样本给短反馈,低置信或多因素样本进入解释和复核。它与 sources/2026-05-12-trackmae 的关系属于潜在上下游组合;当前没有联合实验。
对于 questions/question-badminton-stroke-correction-demo,early exit 可以作为产品策略,教练标注需要同时校准答案正确性、解释正确性和误导风险。
证据评级
- 视频 QA / temporal grounding:直接证据,中等偏强。
- 按需推理的 token 效率:直接证据,中等。
- 体育动作纠正:间接方法证据。
- CVPR 2026 venue:待官方 proceedings 核验。
原始材料
raw/ingest/2026-05-12-videoauto-r1/paper.pdfraw/ingest/2026-05-12-videoauto-r1/paper-text.mdraw/ingest/2026-05-12-videoauto-r1/analysis.mdraw/ingest/2026-05-12-videoauto-r1/abstract.mdraw/ingest/2026-05-12-videoauto-r1/links.yaml