LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

AVID用 Temporal MultiDiffusion 做任意长度视频修补

一句话结论

AVID 把预训练图像修补 U-Net 以 motion modules 和 ControlNet 式结构支路扩成 16 帧视频模型,再在每个去噪步融合重叠时窗并用中间帧 attention 锚定外观;短视频修补的一致性与 mask 外保持证据较强,但“any-length”只在秒级案例上展示,不等于长期身份或视频理解已解决。

输入、输出与方法

  • 输入源视频、首帧 mask 与目标文本;XMem 把 mask 传播到后续帧,输出同时间轴的 object swap、re-texturing 或 uncropping 视频。
  • Stable Diffusion 式 inpainting latent U-Net 冻结,先训练 pseudo-3D temporal motion modules;再冻结主 U-Net 训练 HED-conditioned ControlNet 支路。
  • 结构尺度 $\omega_s$:re-texturing 默认 1,object swap/uncropping 默认 0;高尺度保形但会妨碍类别替换。
  • 训练长度 16 帧。长视频在每个 denoising step 用重叠 16 帧窗口处理并平均同一全局帧;默认 stride 4。
  • middle-frame $K,V$ 与各帧原 self-attention 以 $\omega=0.3$ 混合,减轻跨窗口颜色/身份漂移。
  • 架构是 latent diffusion U-Net,不是 DiT;任务是显式 mask 视频编辑,不是从零视频生成。

数据、指标与人评

  • 训练:去水印 Shutterstock,16 帧、$512\times512$、6 FPS;数据量、训练 GPU/时长、参数量、采样步数和推理 runtime 未报告。
  • 评测 125 个训练未见视频;Grounding-DINO+SAM 定位首帧对象,XMem 传播,Llama 生成 prompts。
  • 定量只比较 16 帧,基线为 per-frame LDM、Text2Video-Zero、VideoComposer。
  • BP 是 mask 外 $L_1$(越低),TA 是 CLIP text-video alignment,TC 是相邻帧 CLIP image similarity。
  • 人评最佳偏好:uncropping 69.1%、object swap 74.5%、re-texturing 73.2%;未披露 annotator 人数、票数、置信区间或显著性。

主要结果

方法Uncrop BP↓/TA↑/TC↑Swap BP↓/TA↑/TC↑Retexture BP↓/TA↑/TC↑
Per-frame43.1 / 31.3 / 93.641.4 / 31.1 / 92.541.4 / 31.2 / 92.4
Text2Video-Zero49.0 / 31.4 / 96.547.3 / 30.1 / 94.947.9 / 30.6 / 95.0
VideoComposer55.7 / 31.2 / 96.471.0 / 31.5 / 96.564.5 / 32.1 / 95.5
AVID42.3 / 31.3 / 97.241.1 / 31.5 / 96.540.7 / 32.0 / 96.3

AVID 的优势集中于背景保持和时序代理指标,文本对齐并非全面第一。显式 mask 接口也天然有利于 BP,不能把该结果解释为开放式编辑理解更强。

消融、成本与局限

  • Temporal MultiDiffusion 定性消除两个 16 帧段在第 15/16 帧的突变;middle-frame guidance 减轻长程颜色漂移,但 $\omega=1$ 会 artifacts。
  • 长视频展示主要为 24–48 帧(4–8 秒),消融为 32 帧;没有分钟级、多镜头或长度 scaling benchmark。
  • 复杂动作 prompt 会失败;高结构约束阻碍 object swap,低约束又会丢源结构。
  • XMem tracking error 会直接改变 mask 边界;没有遮挡后 identity、face/object ID、多实例或 locality 指标。
  • 滑窗 zero-shot 不需 per-video training,但会重复计算重叠帧,不能等同于高效无限长度推理。

对当前 Wiki 判断的影响

  • 视频编辑:补充显式 mask video inpainting 与可调结构忠实度路线。
  • 扩散模型:说明 U-Net temporal adapters + per-step overlapping-window fusion 可以突破训练帧数,但仍有锚点漂移和线性成本。
  • 视频编辑理解benchmark 问题:BP/CLIP consistency 证明低层保持,不证明对象身份、动作或复杂指令理解。

证据评级

B-(短视频显式 mask 修补证据较完整;“any-length”与身份/理解证据为 C)

原始链接

相关页面