LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

Video-P2P用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑

一句话结论

Video-P2P 把 SD1.5 U-Net inflation 成 Text-to-Set model,逐视频微调后用所有帧共享的 null embedding 精确 inversion,再以 source/target 两套 guidance 融合 Prompt-to-Prompt attention;它提升对象语义一致与局部编辑,但 8 帧约需 12 分钟、不能改 motion,且 10-video 评测与未披露 protocol 的人评限制证据。

输入、输出与方法

  • 输入 real video、source prompt、target prompt;输出 8 或 24 帧、$512^2$ 编辑视频。
  • SD1.5 2D conv inflation 为 $1\times3\times3$,加入 temporal attention;每帧 frame-attention 以第一帧提供 K/V。
  • 对目标视频微调 query projections/temporal attention 500 steps,得到 approximate inversion model。
  • DDIM inversion 后逐 step 优化所有帧共享的 unconditional embedding,以较小参数量重建视频并稳定跨帧语义。
  • source branch 用 optimized null 保 reconstruction;target branch 用 initialized null 保 editability;早期 denoising steps 做 cross-attention replacement,并用 token attention binary mask 混合 source/target latents。
  • 支持 word swap、prompt refinement、attention re-weighting、局部/全局编辑;不能 motion editing 或复杂对象注入。
  • 架构是 Stable Diffusion v1.5 latent U-Net,不是 DiT;这是 real-video inversion editing,不是通用 text-to-video generation。

数据、成本与接口

  • 无 dataset-level video training;每个测试视频逐视频优化。
  • 10 个 YouTube videos;论文未给 prompt 总数、清单、许可或 split。
  • 单 V100、8 帧:model tuning 5 分钟、inversion 6 分钟、editing inference 1 分钟,总约 12 分钟
  • 未报告 24 帧 runtime、sampling steps、峰值显存、总参数或 scaling。
  • attention replacement ratio 0.4、threshold 0.3、prompt refinement ratio 0.4,并可按案例调节;固定调参协议不清楚。

自动指标与人评

方法CLIP↑M.PSNR↑LPIPS↓OSV↓
TAV+DDIM0.332217.320.462555.12
Image-P2P0.326922.990.306576.50
Ours w/o DG0.322418.960.386468.76
Video-P2P0.336120.540.329747.57
  • Video-P2P text alignment 与 OSV 最好,但背景保持的 M.PSNR/LPIPS 不如逐帧 Image-P2P;不是四项全胜。
  • OSV 是论文新提的对象语义方差,外部效度未验证;低 variance 也可能奖励静态/欠编辑。
  • 人评中 Video-P2P 的 structure/text/realism preference 为 69.02%/62.50%/69.02%,平均 rank 1.39/1.54/1.43。
  • 但论文没有报告参与者人数、样本数、rating 数、显著性或 inter-rater agreement,人评只能视为有限支持。

消融、失败与边界

  • inversion:TAV+DDIM 15.43 dB/0.13M;multi-uncond 22.97 dB/22.68M;shared-uncond 22.75 dB/2.94M。shared 的核心优势是少约 7.7× embedding 参数,质量只低 0.22 dB。
  • 去 decoupled guidance 后,CLIP 0.3224→0.3361、M.PSNR 18.96→20.54、LPIPS 0.3864→0.3297、OSV 68.76→47.57,支持双 branch guidance。
  • 无 500-step initialization 时,inflated T2S 的单帧质量和背景 reconstruction 明显下降;仅定性。
  • 第一帧 K/V 设计对首帧不可见面、遮挡后出现对象不稳;仅 8/24 帧,无长视频/跨镜头测试。
  • local mask 来自模型 attention,再在其补集测 source preservation,存在循环性。
  • Dreamix 只用官方 demo 定性比较,后续更强基线未覆盖。
  • 不能改变动作是论文明确边界;token attention 不证明对象关系或时序因果理解。

对当前 Wiki 判断的影响

  • 视频编辑:Video-P2P 是“图像 Prompt-to-Prompt → 视频逐视频 inversion”的早期节点,局部控制强但预处理慢。
  • 扩散模型:shared-null 与 decoupled guidance 解决 U-Net reconstruction/editability 张力,不涉及 DiT。
  • 视频编辑理解:OSV 与 attention locality 只测语义稳定/区域保持,不能覆盖动作重写、遮挡逻辑与复杂意图。

证据评级

B-(历史方法贡献与 DG 消融清楚;数据小、人评不透明、成本高且 motion/长视频边界明显)

原始链接

相关页面