一句话结论
CAMEL 通过 per-video motion prompts 与可学习因果时间滤波器,在改变对象、背景或风格时增强源运动保持;它在 TGVE 的文本对齐和 CLIP 帧一致性上领先所选基线,但没有直接 motion metric,因此不能据此断言模型理解了动作。
论文定位
这是逐视频微调的文本驱动视频编辑,不是任意运动重定向。给定源视频、源文本与目标文本,模型保留源运动模式并重绘语义外观。它代表“语义编辑中的运动保持/增强”,而不是语言驱动动作生成。
输入、输出与保留目标
- 输入:源视频模板、源描述、目标编辑文本。
- 输出:遵循目标文本且尽量继承源运动的视频。
- 要保留:源运动、跨帧主体与结构稳定。
- 可改变:对象、背景、风格和多项语义属性。
- 边界:没有显式目标动作、轨迹或区域 mask;preservation 是感知层而非像素级保证。
方法概述
- 从单个源视频直接优化长度 32 的 motion prompts,把运动概念作为类似文本的条件注入去噪。
- 用窗口 $\sigma=11$ 的可学习因果高通滤波器沿时间维提取高频分量;作者把高频近似为运动、低频近似为外观。
- 在 CAM-Attn 中让高频分量 cross-attend motion prompts,再与低频分量重组。
- 微调固定 temporal-attention 的 K/V,只训练 Q 与 CAMEL;推理使用源视频 DDIM inversion。
相比 Tune-A-Video,它显式分解并条件化运动;相比 edge/depth control,它不施加严格空间轨迹约束。
数据与训练预算
- LOVEU-TGVE:53 个视频(DAVIS 16、Videvo 37)。
- 每视频 32 帧、$480\times480$,四类目标 prompt:对象、背景、风格、多重编辑。
- Stable Diffusion v1.4;per-video 500 steps,学习率 $3\times10^{-5}$,batch 1。
- 50-step inversion + 50-step sampling;单张 A100。
- 未报告训练时长、GPU-hours、参数增量或运行时间。
核心实验与结果
UMTScore(视频—文本对齐)
TGVE-DAVIS 上 CAMEL 为 36.52 / 36.60 / 34.08 / 33.92,Tune-A-Video 为 35.02 / 34.98 / 33.31 / 32.76。TGVE-Videvo 上 CAMEL 为 37.03 / 37.54 / 35.26 / 37.36,四类任务均为表中最高。
CLIP frame consistency
CAMEL 在 TGVE-DAVIS 为 93.35 / 95.16 / 93.87 / 93.46,TGVE-Videvo 为 97.10 / 97.56 / 97.55 / 97.02,均领先 Tune-A-Video、Text2Video-Zero、ControlVideo。
Frame consistency 只测帧 embedding 相似性,可能奖励静态结果;UMTScore 也不直接测源动作复现。基线较少,且无用户研究。
关键消融
TGVE-DAVIS UMTScore:Haar only 为 35.03 / 34.95 / 33.24 / 32.91;causal filter only 为 36.03 / 35.98 / 33.78 / 33.54;motion prompt only 为 35.31 / 35.24 / 33.56 / 33.14;两者组合达到完整模型 36.52 / 36.60 / 34.08 / 33.92。
消融支持两个模块互补和宽因果窗口优于两帧 Haar,但只报告文本对齐,未直接量化 motion fidelity。
局限或疑问
- 53 个短视频、每个 32 帧,不覆盖长视频、剪辑点或复杂遮挡。
- “高频=运动、低频=外观”会混入纹理、闪烁、镜头和光照变化。
- 逐视频 500 步优化不适合即时编辑。
- 没有光流、轨迹、pose 或人工 motion preference。
- 多对象能力主要是定性示例。
对当前 Wiki 判断的影响
- 直接支持 视频编辑 中“运动保持/增强已成为独立方法线”。
- 对 视频生成 只提供底座与时序模块的相邻证据。
- 对 现有 benchmark 是否跟踪真实视频编辑理解 是压力测试:代理指标不能把动作保持、语义对齐和输出静态性分开。
- 对 视频编辑理解 只能作为编辑执行系统,不能作为通用理解能力证据。
证据评级
B-(窄任务中的中等直接执行证据;对真实视频编辑理解为 C)。论文直接证明所选 benchmark 与基线上的代理指标优势和模块贡献;对动作忠实度、长时序与理解能力的主张仍缺直接测量。