LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

MaskINT关键帧扩散编辑与非自回归结构插帧的视频编辑

一句话结论

MaskINT 把语义编辑交给 Stable-Diffusion/ControlNet 关键帧联合编辑,把中间帧交给 100K 视频训练的 masked transformer;16 帧 22 秒、比 TokenFlow 快约 6.8×,但一致性指标弱于 TokenFlow/ControlVideo,且只能做结构保持型编辑。

模型接口与训练

  • 输入源视频、文本、每帧 HED/depth structure map 与关键帧;输出与源结构对应的编辑视频。
  • Stage 1:ControlNet 编辑关键帧,跨关键帧共享 self-attention K/V。
  • Stage 2:Retina-VQ 把 RGB/structure 离散化,Transformer-Base 用 window-restricted attention 和 MaskGIT 32-step decoding 补中间帧。
  • Stage 2 不读文本,只从关键帧外观与全帧结构插值;“不需要 text-video pairs”不等于模型不依赖 diffusion editor。
  • 训练用 ShutterStock 100K videos、16 帧、384×672、100 epochs;训练 GPU-hours/参数量/batch 未报告。

评测与结果

测试 40 DAVIS + 30 ShutterStock videos,每视频 5 个手写 prompts。指标为 CLIP prompt/temporal consistency、RAFT warp error 与 all-pair long-term error;无主实验人评。

MaskINT 在 DAVIS P.C./T.C./W.E./L.C. 为 .311/.952/9.5/27.7,ShutterStock 为 .304/.971/8.6/22.3,时间 22s。TokenFlow 对应 .317/.977/7.0/19.6 与 .313/.987/5.4/15.8,时间 150s。结论是明显提速、质量代理可比,不是质量领先。

插帧消融中 MaskINT 优于 FILM/RIFE,但它额外获得所有中间帧 structure map,输入协议并不对称。32→128 decoding steps 只小幅增 T.C.,时间 22→62s。

Judge、污染与任务边界

  • 没有 LLM judge 或透明 human study;CLIP consistency 会奖励未编辑,RAFT 对遮挡/结构变化不稳。
  • ShutterStock train/test 同源且未报 asset-level 去重;70 个“selected”视频与 prompt 选择标准不明。
  • 无 edit locality、identity、source preservation 或结构变化成功率。
  • 明确不能 dog→horse、新对象出现或大结构变化;Stage-1/structure detector 失败会传播。

证据评级

B-(两阶段效率证据清楚;测试小、无主实验人评、训练成本与数据去重不透明,结构编辑能力受限)。

原始链接

相关页面