LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

MotionFollower通过 score-guided diffusion 编辑视频运动

一句话结论

MotionFollower 用目标视频 pose 替换源视频人体动作,并以轻量卷积控制器和推理时区域 score regularization 保存源人物、背景与镜头运动;100-case protocol 上质量、时序和显存均优于 MotionEditor,但 pseudo-GT 与 pose-driven 设定证明的是控制执行,不是动作语义理解。

论文定位

这是双视频人体运动编辑:源视频提供身份、服装、背景和相机运动,目标视频提供动作。它区别于单图 animation,也区别于文本属性编辑。关键变量是换动作、保身份、保背景/镜头

输入、输出与保留目标

  • 输入:源视频、目标视频,以及两者提取的 pose sequences。
  • 输出:源人物执行目标动作的视频。
  • 要保留:源人物外观、服装、背景、相机运动。
  • 要编辑:人体 pose/motion。
  • 边界:人体 pose 驱动,不支持文本定义任意动作或一般对象运动。

方法概述

  1. PoCtr:四个纯卷积 blocks 把目标 pose 编码后加到 latent,替代 ControlNet。
  2. ReCtr:四个卷积 blocks 把源帧多尺度特征注入 U-Net encoder,替代重型 reference U-Net 和 inversion。
  3. 两阶段训练:先在单帧对训练 U-Net 与 controllers,再插入 AnimateDiff temporal layers;第二阶段只训练 temporal layers,并以 40% 图像对/60% 视频 clips 混合训练。
  4. 双分支 score guidance:重建分支用 source pose,编辑分支用 target pose;$S_{fg}$、$S_{over}$、$S_{body}$、$S_{com}$ 分别约束人物、重叠背景、姿态残影和腾空区域补全。梯度只更新 editing latent,不改模型权重。
  5. 50 个去噪步中仅前 30 步用 guidance,避免后期纹理损伤。

数据与训练预算

  • 互联网收集 3K 个 60–90 秒视频;DWPose + 自研轻量人物分割。
  • 两个训练阶段各 100,000 steps,batch 64 / 4,学习率均 $10^{-5}$。
  • 训练:4 张 NVIDIA A100;未报告 GPU-hours 和数据许可细节。
  • 推理:单 A100 编辑 24 帧约 50 秒。
  • 8 帧显存 9.8G;作者称单 A100 可编辑 56 帧,MotionEditor 为 16 帧。

核心实验与结果

100 个 wild cases

MotionFollower:L1 $6.31\times10^{-5}$、PSNR* 20.85、SSIM 0.75、LPIPS 0.22、FID 26.30、FID-VID 12.42、FVD 276.04、显存 9.8G。MotionEditor 为 17.34 / 0.68 / 0.34 / 31.98 / 20.57 / 395.43 / 42.6G。

真实 cross-identity 编辑没有 GT,作者把同一测试视频切成两段作为 source/target 构造 pseudo-GT。该 protocol 可计算全参考指标,但不完全代表不同人物动作替换。

Motion transfer 与 consistency

TikTok motion-transfer protocol 上,MotionFollower 的 SSIM 0.793、LPIPS 0.230、FVD 159.88 最优;PSNR 29.25 不是最高。Optical Flow L2 为 3.21,优于 MotionEditor 5.87。100-video pairwise user study 中相对各基线的 motion/temporal/appearance preference 多为 88.6%–96.8%,但参与人数和置信区间未报告。

关键消融

完整模型为 PSNR 20.85、SSIM 0.75、LPIPS 0.22、FVD 276.04、9.8G。

  • w/o ReCtr:9.03 / 0.42 / 0.45 / 545.39。
  • 用 ReferenceNet 替代:19.82 / 0.72 / 0.25 / 288.57,显存 17.8G。
  • 用 ControlNet 替代 PoCtr:18.13 / 0.65 / 0.28 / 381.52,15.2G。
  • w/o score guidance:16.50 / 0.61 / 0.36 / 437.69。
  • w/o all masks:SSIM 0.53、FID-VID 24.87、FVD 442.34。

ReCtr、score guidance 和区域 masks 是主要增益来源;轻量卷积 controllers 在当前数据规模下也更省显存。

局限或疑问

  • 没有真实 cross-identity GT;量化依赖同视频分段 pseudo-GT。
  • 以人体 pose 为中心,不能外推到动物、刚体或非关节运动。
  • 强依赖 pose alignment 与 segmentation,未报告前置模块失败率。
  • 24 帧需 50 秒,双分支逐步反向梯度仍不实时。
  • 600-frame、大镜头运动和多动作类型主要是定性证据。
  • 用户研究 protocol 细节不足。
  • 不接受动作语言,只跟随 pose;高性能不等于理解动作名称、意图或因果。

对当前 Wiki 判断的影响

证据评级

B(人体 motion editing 的中等直接证据;对真实视频编辑理解为 C)。多指标、消融和效率证据扎实,但 protocol 与 pose-driven 本质限制了语义理解结论。

原始链接

相关页面