LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

通过多模态大模型实现语言驱动视频修补

一句话结论

论文用 ROVI、LGVI 和 LLaVA-7B 增强的 LGVI-I,把指代表达/隐式对话转成对象移除视频;它直接证明语言 grounding 可以接到短视频 inpainting,但 MLLM 只看首帧、GT 与对话大量合成,且缺少 grounding accuracy,不能外推为完整视频理解。

论文定位

该工作首次系统定义 language-driven video inpainting:推理时不用逐帧 mask,用户只需描述要移除的对象。任务分为简单 referring expression 和 chat-style interactive request 两种。

输入、输出与保留目标

  • 输入:原视频 + 指代表达或隐式用户请求。
  • 输出:移除目标对象并补全背景的视频;交互模型同时输出文字回应与显式 removal prompt。
  • 要保留:非目标区域、场景结构和短时序连续性。
  • 要编辑:语言指定对象区域。
  • 边界:只做对象移除/补背景,不是任意添加、替换、属性或动作编辑。

ROVI 数据集

  • 5,650 视频、247,018 帧、9,091 对象/修补结果、12,534 expressions、9,091 chats。
  • 来源:A2D-Sentences 2,967 + Refer-YouTube-VOS 2,683。
  • 测试:478 视频、758 对象。
  • E2FGVI 生成修补 GT;对 mask expansion 六个取值产生候选,由人工择优或丢弃。
  • 对话由 MLLM/LLM 链式生成;mask 面积大于画面 25% 的困难对象被过滤。

因此 ROVI 的 GT 是人工筛选的 teacher output,而非真实无对象视频;benchmark 也主动排除了大洞修补。

方法概述

LGVI

以 MagicBrush/Stable Diffusion U-Net 为基础,加入 temporal attention;源视频 latent 作为 control;FPN-like mask decoder 预测语言所指区域。联合 diffusion loss 与 mask loss,训练用 mask、推理不输入 mask。

LGVI-I

LLaVA-7B 接收首帧与用户请求,生成回答和 <PROMPT> tokens;对应 hidden states 经 MM head 后进入 U-Net cross-attention。联合 diffusion、mask 和 language modeling losses。

这意味着语言理解主要发生在首帧对象 grounding;完整时序由视频 diffusion module 处理,MLLM 本身不看全视频。

数据与训练预算

  • ROVI 视频与 GQA-Inpaint 图像按 3:1 混合。
  • U-Net / mask decoder / MLLM tuned params 学习率为 $3\times10^{-5}$ / $10^{-4}$ / $10^{-4}$。
  • 视频 $512\times320$、24 帧。
  • LGVI 训练 50 epochs;LGVI-I 从 LGVI 再训练 50 epochs。
  • video batch 32、image batch 768;8 张 NVIDIA A100。
  • 未报告 GPU-hours、参数量与推理速度。

核心实验与结果

Referring task

LGVI:PSNR 22.85、SSIM 0.756、VFID 0.308、$E_{warp}=0.901\times10^{-2}$。它优于 image baselines;与 Inpaint Anything* 相比,PSNR/SSIM 略高,但 VFID 0.308 vs 0.283、warp 0.901 vs 0.874 略差,因此不是所有指标都最优。

Interactive task

LGVI-I:PSNR 22.24、SSIM 0.732、VFID 0.299、warp 0.867。它的 PSNR/warp 最优;SSIM 低于 LGVI+MLLM 的 0.738,VFID 低于 IA*+MLLM 的 0.291。相比未增强 LGVI,LGVI-I 有明显整体改善。

指标衡量与伪 GT 的接近度与时序平滑;没有 mask IoU、对象 grounding accuracy、意图解析准确率或人类编辑成功率,无法把“理解”和“生成”分开。

关键消融

完整 LGVI 为 22.85 / 0.756 / 0.308 / 0.901;w/o full U-Net tuning 为 20.53 / 0.607 / 0.370 / 1.101;w/o mask supervision 为 21.80 / 0.631 / 0.358 / 1.059;w/o video inflation 为 22.08 / 0.754 / 0.356 / 1.017;w/o image joint training 为 22.39 / 0.728 / 0.297 / 0.987。

完整微调、mask supervision 与视频 inflation 有效;image joint training 存在 PSNR/SSIM/warp 与 VFID 的权衡。论文未单独消融 MLLM 首帧、prompt extraction 或 LM loss。

局限与失败案例

  • 含糊、长、隐式表达会删错对象;同类多实例密集时尤其困难。
  • 即使语言回复定位近似正确,diffusion output 仍可能错误,说明理解与执行之间存在断层。
  • diffusion 推理慢,实时处理困难。
  • 跨语言、视频类型和未见数据泛化未验证。
  • MLLM 只看首帧;目标后续出现、遮挡或动作关系指代不在能力证据内。
  • 合成对话、合成 GT 和大对象过滤降低了真实世界外推性。

对当前 Wiki 判断的影响

证据评级

B(语言驱动对象移除的中等直接证据;对真实视频编辑理解为 B-)。任务确实从隐式请求到编辑输出,但 synthetic supervision、首帧 MLLM 与缺少 grounding 指标限制了理解结论。

原始链接

相关页面