一句话结论
QK-Edit 发现 MM-DiT 的 vision→text 与 vision→vision attention 需要联动控制,并以源轨迹 Q/K replacement 在 FLUX 与 HunyuanVideo 上实现 training-free 编辑;结果总体强,但真实视频 Table 3 是四项中三项最优,而非正文所称“全指标领先”。
论文定位与接口
- 输入:源/目标 prompt;真实视频需先 inversion。
- 输出:文本驱动图像/视频编辑,覆盖添加、删除、替换、背景、颜色、材质与风格。
- 方法不训练模型,只在去噪早期替换 vision query/key。
- 它是跨两个 MM-DiT 底座的共享机制,不是统一单模型。
方法概述
MM-SA 四 quadrant 中:$Q_{vision}K_{text}$ 负责 region-token 语义关系,$Q_{vision}K_{vision}$ 负责空间/时序 affinity;$Q_{text}K_{vision}$ 在作者 pilot 中影响很小。QK-Edit 因此缓存源轨迹的 vision Q/K,并替换目标轨迹对应项,间接同时干预第三、四 quadrant,无需解包 FlashAttention map。
- 图像:FLUX.1-dev,前 30% diffusion steps 替换。
- 视频:HunyuanVideo,前 20% steps;320×320/65 帧至 1280×720/129 帧。
核心结果
PIE-Bench 图像
| 方法 | CLIP-T ↑ | DINO ↑ | PickScore ↑ |
|---|---|---|---|
| RF-Solver | 0.257 | 0.769 | 21.98 |
| QK-Edit | 0.264 | 0.776 | 22.33 |
TGVE+ 生成式视频(同 HunyuanVideo)
| 方法 | CLIPframes ↑ | Pick ↑ | ViCLIPdir ↑ | ViCLIPout ↑ |
|---|---|---|---|---|
| DiTCtrl | 0.904 | 20.01 | 0.141 | 0.242 |
| QK-Edit | 0.951 | 21.24 | 0.217 | 0.268 |
TGVE+ 真实视频
| 方法 | ViCLIPdir ↑ | ViCLIPout ↑ | CLIPframes ↑ | Pick ↑ |
|---|---|---|---|---|
| Flatten | 0.204 | 0.236 | 0.887 | 19.91 |
| AnyV2V | 0.117 | 0.228 | 0.906 | 20.28 |
| QK-Edit | 0.196 | 0.258 | 0.921 | 20.52 |
QK-Edit 在真实视频四项中三项最优;ViCLIPdir 低于 Flatten,正文“all metrics”结论不成立。
关键消融
- Replace KV/V:结构保留强,但可能不跟 prompt。
- Replace Q/K:更跟 prompt,但易破坏源结构。
- Replace QK:折中最好。
- HiLo-Benchmark(43 个 >1K、>100 帧视频):QKreplace 的 CLIPframes/Pick 为 0.908/20.08,优于 KVconcat 0.896/19.87、Vreplace 0.900/19.94、KVreplace 0.901/19.92。
- 未报告 20%/30% ratio、block selection 或 inversion 方法的完整数值消融。
局限或疑问
- 作者承认复杂运动的真实视频 inversion 仍不准,并会污染编辑。
- 无 mask 会轻微改动本应不变区域;底座文本渲染与体操等复杂运动缺陷会被继承。
- quadrant 功能只在 FLUX/HunyuanVideo pilot 验证,不能视作所有 MM-DiT 定理。
- HiLo 仅 43 个精选视频,两项代理指标;没有失败率、显著性或用户研究。
- training-free 仍需双轨迹、Q/K cache 与 inversion,高分辨率成本未报告。
- CLIPframes 可能奖励小改动;ViCLIP/Pick 不测局部不变性、物理或多步指令。
对当前 Wiki 判断的影响
- 对 图像编辑:直接支持MM-DiT 时代的新 attention injection 接口。
- 对 视频编辑:直接支持同一机制可迁移到生成式/真实视频,但只覆盖文本内容变换。
- 对 视频生成:压力测试/间接支持,底座 prior 可复用,但 inversion 与复杂运动仍是瓶颈。
- 对 统一模型优势问题:中性/替代路线;共享机制跨两个模型不等于统一模型整体胜过专用系统。
- 对 视频编辑理解评测问题:压力测试证据。TGVE+/HiLo 指标不测剪辑语法、依据推理、叙事功能或编辑计划,且正文与 Table 3 已出现结论冲突。
证据评级
B(机制证据中等偏强)。同底座生成视频比较、多 benchmark 与 QKV 消融有价值;但真实视频并非全指标最优,HiLo 小且自建,机制普适性和 inversion 成本未充分验证。