LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

VidToMe用跨帧 token merging 做零样本视频编辑

一句话结论

VidToMe 在冻结 Stable Diffusion 的 self-attention 前后做 local/global temporal token merge-unmerge,在 20 个 DAVIS 源视频上同时改善 32 帧编辑的一致性与显存;它是 training-free video-to-video efficiency plugin,不生成新动作,也不提供对象身份或视频理解证据。

输入、输出与方法

  • 输入源视频与目标 prompt,输出同长度的 style、object appearance 或 background 编辑视频。
  • 每帧 50-step DDIM inversion;每个去噪步把帧随机切为 $B=4$ 的 chunks。
  • local merge 把同 chunk 中最相似 token 合并到随机目标帧,ratio 0.9;global merge 跨 chunk 维护长期 token,ratio 0.8。
  • 合并后做原生 self-attention,再 unmerge 回每帧;不改 attention 权重,可接 PnP、ControlNet 或 SD2-Depth。
  • destination replacement 比 mean merge 更保细节;merge 仅用于浅层/高分辨率 down/up blocks。

数据、指标与人评

  • 20 个 DAVIS 源视频,每个 style/object/background 三种 prompt,共 60 edits;每个 32 帧、$512\times512$。
  • Temporal:Interpolation Error/PSNR、Warp Error、Frame CLIP。
  • Text:Directional CLIP、Text CLIP。
  • 用户研究从 60 edits 抽 10 个案例,本文 preference 0.544;论文未报告参与者人数、每 pair 票数、问题措辞、显著性或置信区间。
  • 基线:Text2Video-Zero、Tune-A-Video、vid2vid-zero、Pix2Video;vid2vid-zero 因 40GB OOM 被关闭原生 full spatiotemporal attention。

主要结果

同底座最公平的比较是 SD2-Depth:

方法Inp.Err ↓PSNR ↑Warp ↓Frame CLIP ↑Dir.CLIP ↑Text CLIP ↑
Pix2Video0.13922.50.0200.9680.1660.285
VidToMe + SD2-Depth0.10525.60.0120.9710.1680.282

VidToMe 明显改善时序代理指标,但 Text CLIP 略低。PnP 版本 Inp.Err 0.111、Warp 0.013、Frame CLIP 0.975,也说明不同控制底座有明显 trade-off,不能把全部差异归于 merging。

消融与成本

  • per-frame / extended / VidToMe attention 的 Inp.Err 为 0.253/0.140/0.105;Directional CLIP 为 0.165/0.168/0.168。
  • mean merge 会损失颜色/细节;去 global merge 会长程漂移;替代 local merge 策略会模糊,后几项仅定性。
  • 参数训练为零;仍需 50-step inversion + 50-step sampling 和每步 token matching。
  • $B=4$、merge ratio 0.9 时,self-attention 理论复杂度从约 $O(4N^2)$ 降至 $O(2N^2)$;不等于端到端减半。
  • 单 A100 的效率图中,正文明确峰值 <7GB;精确 wall-clock 未在文本中报告,不能臆造。

关键局限

  • 编辑上限由外部 image editor 决定;单帧失败会扩散到整段视频。
  • 相似外观的不同对象可能被错误 matching/merge,造成 identity 混杂。
  • 只有 20 个源视频、32 帧;无长视频、镜头切换、严重遮挡或多实例身份 benchmark。
  • 用户研究信息不全;高一致性也可能奖励保守编辑。
  • <7GB 只适用于该分辨率/长度/配置,不代表任意个人设备实时运行。

对当前 Wiki 判断的影响

  • 视频编辑:提供 training-free temporal feature compression 路线。
  • 扩散模型:说明图像 diffusion 的 self-attention 可参数免费改装为跨帧共享,但仍支付 inversion/sampling 成本。
  • 视频编辑理解benchmark 问题:token 相似性和时序指标不等于 identity、动作或指令理解。

证据评级

B-(短视频一致性/显存优化的直接证据;对 identity 与视频编辑理解为 C-/无直接证据)

原始链接

相关页面