一句话结论
论文用 ROVI、LGVI 和 LLaVA-7B 增强的 LGVI-I,把指代表达/隐式对话转成对象移除视频;它直接证明语言 grounding 可以接到短视频 inpainting,但 MLLM 只看首帧、GT 与对话大量合成,且缺少 grounding accuracy,不能外推为完整视频理解。
论文定位
该工作首次系统定义 language-driven video inpainting:推理时不用逐帧 mask,用户只需描述要移除的对象。任务分为简单 referring expression 和 chat-style interactive request 两种。
输入、输出与保留目标
- 输入:原视频 + 指代表达或隐式用户请求。
- 输出:移除目标对象并补全背景的视频;交互模型同时输出文字回应与显式 removal prompt。
- 要保留:非目标区域、场景结构和短时序连续性。
- 要编辑:语言指定对象区域。
- 边界:只做对象移除/补背景,不是任意添加、替换、属性或动作编辑。
ROVI 数据集
- 5,650 视频、247,018 帧、9,091 对象/修补结果、12,534 expressions、9,091 chats。
- 来源:A2D-Sentences 2,967 + Refer-YouTube-VOS 2,683。
- 测试:478 视频、758 对象。
- E2FGVI 生成修补 GT;对 mask expansion 六个取值产生候选,由人工择优或丢弃。
- 对话由 MLLM/LLM 链式生成;mask 面积大于画面 25% 的困难对象被过滤。
因此 ROVI 的 GT 是人工筛选的 teacher output,而非真实无对象视频;benchmark 也主动排除了大洞修补。
方法概述
LGVI
以 MagicBrush/Stable Diffusion U-Net 为基础,加入 temporal attention;源视频 latent 作为 control;FPN-like mask decoder 预测语言所指区域。联合 diffusion loss 与 mask loss,训练用 mask、推理不输入 mask。
LGVI-I
LLaVA-7B 接收首帧与用户请求,生成回答和 <PROMPT> tokens;对应 hidden states 经 MM head 后进入 U-Net cross-attention。联合 diffusion、mask 和 language modeling losses。
这意味着语言理解主要发生在首帧对象 grounding;完整时序由视频 diffusion module 处理,MLLM 本身不看全视频。
数据与训练预算
- ROVI 视频与 GQA-Inpaint 图像按 3:1 混合。
- U-Net / mask decoder / MLLM tuned params 学习率为 $3\times10^{-5}$ / $10^{-4}$ / $10^{-4}$。
- 视频 $512\times320$、24 帧。
- LGVI 训练 50 epochs;LGVI-I 从 LGVI 再训练 50 epochs。
- video batch 32、image batch 768;8 张 NVIDIA A100。
- 未报告 GPU-hours、参数量与推理速度。
核心实验与结果
Referring task
LGVI:PSNR 22.85、SSIM 0.756、VFID 0.308、$E_{warp}=0.901\times10^{-2}$。它优于 image baselines;与 Inpaint Anything* 相比,PSNR/SSIM 略高,但 VFID 0.308 vs 0.283、warp 0.901 vs 0.874 略差,因此不是所有指标都最优。
Interactive task
LGVI-I:PSNR 22.24、SSIM 0.732、VFID 0.299、warp 0.867。它的 PSNR/warp 最优;SSIM 低于 LGVI+MLLM 的 0.738,VFID 低于 IA*+MLLM 的 0.291。相比未增强 LGVI,LGVI-I 有明显整体改善。
指标衡量与伪 GT 的接近度与时序平滑;没有 mask IoU、对象 grounding accuracy、意图解析准确率或人类编辑成功率,无法把“理解”和“生成”分开。
关键消融
完整 LGVI 为 22.85 / 0.756 / 0.308 / 0.901;w/o full U-Net tuning 为 20.53 / 0.607 / 0.370 / 1.101;w/o mask supervision 为 21.80 / 0.631 / 0.358 / 1.059;w/o video inflation 为 22.08 / 0.754 / 0.356 / 1.017;w/o image joint training 为 22.39 / 0.728 / 0.297 / 0.987。
完整微调、mask supervision 与视频 inflation 有效;image joint training 存在 PSNR/SSIM/warp 与 VFID 的权衡。论文未单独消融 MLLM 首帧、prompt extraction 或 LM loss。
局限与失败案例
- 含糊、长、隐式表达会删错对象;同类多实例密集时尤其困难。
- 即使语言回复定位近似正确,diffusion output 仍可能错误,说明理解与执行之间存在断层。
- diffusion 推理慢,实时处理困难。
- 跨语言、视频类型和未见数据泛化未验证。
- MLLM 只看首帧;目标后续出现、遮挡或动作关系指代不在能力证据内。
- 合成对话、合成 GT 和大对象过滤降低了真实世界外推性。
对当前 Wiki 判断的影响
- 直接支持 视频编辑 中语言接口可替代推理时 mask,完成窄任务对象移除。
- 对 视觉语言 是 MLLM 作为交互意图解析器的直接案例。
- 对 视频理解 只是相邻证据,因为 MLLM 仅看首帧。
- 对 现有 benchmark 是否跟踪真实视频编辑理解 是关键压力测试:指标混合 grounding、mask、inpainting 和 teacher-GT 拟合。
证据评级
B(语言驱动对象移除的中等直接证据;对真实视频编辑理解为 B-)。任务确实从隐式请求到编辑输出,但 synthetic supervision、首帧 MLLM 与缺少 grounding 指标限制了理解结论。