一句话结论
AVID 把预训练图像修补 U-Net 以 motion modules 和 ControlNet 式结构支路扩成 16 帧视频模型,再在每个去噪步融合重叠时窗并用中间帧 attention 锚定外观;短视频修补的一致性与 mask 外保持证据较强,但“any-length”只在秒级案例上展示,不等于长期身份或视频理解已解决。
输入、输出与方法
- 输入源视频、首帧 mask 与目标文本;XMem 把 mask 传播到后续帧,输出同时间轴的 object swap、re-texturing 或 uncropping 视频。
- Stable Diffusion 式 inpainting latent U-Net 冻结,先训练 pseudo-3D temporal motion modules;再冻结主 U-Net 训练 HED-conditioned ControlNet 支路。
- 结构尺度 $\omega_s$:re-texturing 默认 1,object swap/uncropping 默认 0;高尺度保形但会妨碍类别替换。
- 训练长度 16 帧。长视频在每个 denoising step 用重叠 16 帧窗口处理并平均同一全局帧;默认 stride 4。
- middle-frame $K,V$ 与各帧原 self-attention 以 $\omega=0.3$ 混合,减轻跨窗口颜色/身份漂移。
- 架构是 latent diffusion U-Net,不是 DiT;任务是显式 mask 视频编辑,不是从零视频生成。
数据、指标与人评
- 训练:去水印 Shutterstock,16 帧、$512\times512$、6 FPS;数据量、训练 GPU/时长、参数量、采样步数和推理 runtime 未报告。
- 评测 125 个训练未见视频;Grounding-DINO+SAM 定位首帧对象,XMem 传播,Llama 生成 prompts。
- 定量只比较 16 帧,基线为 per-frame LDM、Text2Video-Zero、VideoComposer。
- BP 是 mask 外 $L_1$(越低),TA 是 CLIP text-video alignment,TC 是相邻帧 CLIP image similarity。
- 人评最佳偏好:uncropping 69.1%、object swap 74.5%、re-texturing 73.2%;未披露 annotator 人数、票数、置信区间或显著性。
主要结果
| 方法 | Uncrop BP↓/TA↑/TC↑ | Swap BP↓/TA↑/TC↑ | Retexture BP↓/TA↑/TC↑ |
|---|---|---|---|
| Per-frame | 43.1 / 31.3 / 93.6 | 41.4 / 31.1 / 92.5 | 41.4 / 31.2 / 92.4 |
| Text2Video-Zero | 49.0 / 31.4 / 96.5 | 47.3 / 30.1 / 94.9 | 47.9 / 30.6 / 95.0 |
| VideoComposer | 55.7 / 31.2 / 96.4 | 71.0 / 31.5 / 96.5 | 64.5 / 32.1 / 95.5 |
| AVID | 42.3 / 31.3 / 97.2 | 41.1 / 31.5 / 96.5 | 40.7 / 32.0 / 96.3 |
AVID 的优势集中于背景保持和时序代理指标,文本对齐并非全面第一。显式 mask 接口也天然有利于 BP,不能把该结果解释为开放式编辑理解更强。
消融、成本与局限
- Temporal MultiDiffusion 定性消除两个 16 帧段在第 15/16 帧的突变;middle-frame guidance 减轻长程颜色漂移,但 $\omega=1$ 会 artifacts。
- 长视频展示主要为 24–48 帧(4–8 秒),消融为 32 帧;没有分钟级、多镜头或长度 scaling benchmark。
- 复杂动作 prompt 会失败;高结构约束阻碍 object swap,低约束又会丢源结构。
- XMem tracking error 会直接改变 mask 边界;没有遮挡后 identity、face/object ID、多实例或 locality 指标。
- 滑窗 zero-shot 不需 per-video training,但会重复计算重叠帧,不能等同于高效无限长度推理。
对当前 Wiki 判断的影响
- 对 视频编辑:补充显式 mask video inpainting 与可调结构忠实度路线。
- 对 扩散模型:说明 U-Net temporal adapters + per-step overlapping-window fusion 可以突破训练帧数,但仍有锚点漂移和线性成本。
- 对 视频编辑理解 与 benchmark 问题:BP/CLIP consistency 证明低层保持,不证明对象身份、动作或复杂指令理解。
证据评级
B-(短视频显式 mask 修补证据较完整;“any-length”与身份/理解证据为 C)。