LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

QK-Edit在 MM-DiT 中重构图像与视频编辑的 attention 注入

一句话结论

QK-Edit 发现 MM-DiT 的 vision→text 与 vision→vision attention 需要联动控制,并以源轨迹 Q/K replacement 在 FLUX 与 HunyuanVideo 上实现 training-free 编辑;结果总体强,但真实视频 Table 3 是四项中三项最优,而非正文所称“全指标领先”。

论文定位与接口

  • 输入:源/目标 prompt;真实视频需先 inversion。
  • 输出:文本驱动图像/视频编辑,覆盖添加、删除、替换、背景、颜色、材质与风格。
  • 方法不训练模型,只在去噪早期替换 vision query/key。
  • 它是跨两个 MM-DiT 底座的共享机制,不是统一单模型。

方法概述

MM-SA 四 quadrant 中:$Q_{vision}K_{text}$ 负责 region-token 语义关系,$Q_{vision}K_{vision}$ 负责空间/时序 affinity;$Q_{text}K_{vision}$ 在作者 pilot 中影响很小。QK-Edit 因此缓存源轨迹的 vision Q/K,并替换目标轨迹对应项,间接同时干预第三、四 quadrant,无需解包 FlashAttention map。

  • 图像:FLUX.1-dev,前 30% diffusion steps 替换。
  • 视频:HunyuanVideo,前 20% steps;320×320/65 帧至 1280×720/129 帧。

核心结果

PIE-Bench 图像

方法CLIP-T ↑DINO ↑PickScore ↑
RF-Solver0.2570.76921.98
QK-Edit0.2640.77622.33

TGVE+ 生成式视频(同 HunyuanVideo)

方法CLIPframes ↑Pick ↑ViCLIPdir ↑ViCLIPout ↑
DiTCtrl0.90420.010.1410.242
QK-Edit0.95121.240.2170.268

TGVE+ 真实视频

方法ViCLIPdir ↑ViCLIPout ↑CLIPframes ↑Pick ↑
Flatten0.2040.2360.88719.91
AnyV2V0.1170.2280.90620.28
QK-Edit0.1960.2580.92120.52

QK-Edit 在真实视频四项中三项最优;ViCLIPdir 低于 Flatten,正文“all metrics”结论不成立。

关键消融

  • Replace KV/V:结构保留强,但可能不跟 prompt。
  • Replace Q/K:更跟 prompt,但易破坏源结构。
  • Replace QK:折中最好。
  • HiLo-Benchmark(43 个 >1K、>100 帧视频):QKreplace 的 CLIPframes/Pick 为 0.908/20.08,优于 KVconcat 0.896/19.87、Vreplace 0.900/19.94、KVreplace 0.901/19.92。
  • 未报告 20%/30% ratio、block selection 或 inversion 方法的完整数值消融。

局限或疑问

  • 作者承认复杂运动的真实视频 inversion 仍不准,并会污染编辑。
  • 无 mask 会轻微改动本应不变区域;底座文本渲染与体操等复杂运动缺陷会被继承。
  • quadrant 功能只在 FLUX/HunyuanVideo pilot 验证,不能视作所有 MM-DiT 定理。
  • HiLo 仅 43 个精选视频,两项代理指标;没有失败率、显著性或用户研究。
  • training-free 仍需双轨迹、Q/K cache 与 inversion,高分辨率成本未报告。
  • CLIPframes 可能奖励小改动;ViCLIP/Pick 不测局部不变性、物理或多步指令。

对当前 Wiki 判断的影响

  • 图像编辑直接支持MM-DiT 时代的新 attention injection 接口。
  • 视频编辑直接支持同一机制可迁移到生成式/真实视频,但只覆盖文本内容变换。
  • 视频生成压力测试/间接支持,底座 prior 可复用,但 inversion 与复杂运动仍是瓶颈。
  • 统一模型优势问题中性/替代路线;共享机制跨两个模型不等于统一模型整体胜过专用系统。
  • 视频编辑理解评测问题压力测试证据。TGVE+/HiLo 指标不测剪辑语法、依据推理、叙事功能或编辑计划,且正文与 Table 3 已出现结论冲突。

证据评级

B(机制证据中等偏强)。同底座生成视频比较、多 benchmark 与 QKV 消融有价值;但真实视频并非全指标最优,HiLo 小且自建,机制普适性和 inversion 成本未充分验证。

原始链接

相关页面