一句话结论
DynVideo-E 把单目人体视频重建为动态人体 NeRF 与静态背景 NeRF,再以参考图、2D/3D diffusion SDS 和姿态变形场做 3D 编辑;在 11 个专门的大运动/大视角视频上显著赢得人评,但单视频 7.3 小时、输入接口不对称且缺几何/身份指标,不能外推到通用视频编辑。
输入、输出与方法
- 输入源视频、参考人物图及文本、背景风格图;输出沿源相机轨迹或自由视角渲染的编辑视频。
- HOSNeRF/HSNeRF 将视频分成 pose-conditioned dynamic human canonical space、deformation field、static Mip-NeRF 360 background;交互物体从原模型按 mask 保留。
- 参考姿态/视角用 RGB、SAM mask、pseudo-depth reconstruction 注入身份。
- Zero-1-to-3 提供随机视角 3D SDS;参考图经 DreamBooth-LoRA 个性化的 Stable Diffusion 提供随机姿态/视角 2D SDS。
- 七个人体局部区域 zoom-in 提高 $128^2$ 全局训练的有效细节;背景用 VGG NNFM style loss。
- 核心是 dynamic NeRF MLP,不是 U-Net/DiT。SD U-Net 与 Zero-1-to-3 只是监督先验;这不是从零 video generation,也不支持动作/镜头重写。
数据、训练与成本
- HOSNeRF:300–400 帧;NeuMan:30–90 帧;均 $1280\times720$。共 11 videos、24 editing prompts。
- 背景 10 层 MLP、原 human-object 8 层 MLP、editable human 9 层 MLP;前 8 层由重建模型初始化。
- Adam、LR $5\times10^{-4}$、20K iterations;单 A100。
- 长视频(300–400 帧)editing operation:7.3 小时;CoDeF/StableVideo 约 1 分钟,Text2Video-Zero 15 分钟,Rerender 1.2 小时,Text2LIVE 约 2 小时。
- 论文未完整拆分源 NeRF reconstruction、DreamBooth-LoRA、参考图/预处理与渲染成本,也未报告参数量、显存和 GPU-hours。
指标与人评
| 方法 | CLIPScore↑ |
|---|---|
| Text2Video-Zero | 26.70 |
| Rerender-A-Video | 26.11 |
| Text2LIVE | 22.77 |
| StableVideo | 22.02 |
| CoDeF | 16.77 |
| DynVideo-E | 31.31 |
- 24 prompts,MTurk 每 pair 10 ratings;共 1,140 comparisons、32 raters。
- DynVideo-E 对五基线的文本忠实度偏好为 90.83%–98.75%,时序偏好 73.33%–96.25%,总体质量 87.92%–98.75%。
- 但输入不对称:DynVideo-E 使用参考图、个性化 2D/3D priors;基线使用由参考图生成的文本描述。场景也专门选择基线 2D atlas/canonical representation 易失败的大运动/大视角人体视频。
- 没有 identity、pose/trajectory、novel-view geometry、source LPIPS/locality 或自动 temporal metric;人评无置信区间和一致性。
消融、失败与边界
- 两场景 CLIP image similarity:Full 0.756/0.647;去 local SR 0.736/0.645;再去 reconstruction 0.728/0.617;去 2D SDS 0.679/0.517;去 3D SDS 0.711/0.613;去 LoRA 0.698/0.539。
- 附录平均 Full 0.674,删减后最低到 0.572;但若删太多组件,部分视频不收敛,平均有 survivor bias,且消融不是严格单因素。
- 强依赖 COLMAP、人体姿态、SAM、深度和 HOSNeRF reconstruction;复杂遮挡、多主体、拓扑变化与非人体缺证据。
- 交互物体“保持”来自原模型和 mask 路由,不是语义理解。
- SDS 和 $128^2$ 全局训练可能产生未观察视角、身份和几何错误。
- 不能改变动作或镜头;free-view rendering 不等于通用 text-to-video generation。
对当前 Wiki 判断的影响
- 对 视频编辑:这是 2D attention/atlas 路线之外的 3D dynamic representation 分支,适合源视频大视角与人体动作,但付出极高逐视频优化成本。
- 对 视频编辑理解:显式 pose/camera/segmentation 提供几何控制,不证明模型理解动作、交互关系或自然语言镜头意图。
- 对 benchmark 问题:专门小数据与输入不对称会产生极高 pairwise win rate,却不能回答通用编辑能力。
证据评级
B-(专门场景优势和人评强,但数据小、比较接口不对称、成本极高且缺几何/身份量化)。