LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

DynVideo-E用动态 NeRF 编辑大运动与大视角人体视频

一句话结论

DynVideo-E 把单目人体视频重建为动态人体 NeRF 与静态背景 NeRF,再以参考图、2D/3D diffusion SDS 和姿态变形场做 3D 编辑;在 11 个专门的大运动/大视角视频上显著赢得人评,但单视频 7.3 小时、输入接口不对称且缺几何/身份指标,不能外推到通用视频编辑。

输入、输出与方法

  • 输入源视频、参考人物图及文本、背景风格图;输出沿源相机轨迹或自由视角渲染的编辑视频。
  • HOSNeRF/HSNeRF 将视频分成 pose-conditioned dynamic human canonical space、deformation field、static Mip-NeRF 360 background;交互物体从原模型按 mask 保留。
  • 参考姿态/视角用 RGB、SAM mask、pseudo-depth reconstruction 注入身份。
  • Zero-1-to-3 提供随机视角 3D SDS;参考图经 DreamBooth-LoRA 个性化的 Stable Diffusion 提供随机姿态/视角 2D SDS。
  • 七个人体局部区域 zoom-in 提高 $128^2$ 全局训练的有效细节;背景用 VGG NNFM style loss。
  • 核心是 dynamic NeRF MLP,不是 U-Net/DiT。SD U-Net 与 Zero-1-to-3 只是监督先验;这不是从零 video generation,也不支持动作/镜头重写。

数据、训练与成本

  • HOSNeRF:300–400 帧;NeuMan:30–90 帧;均 $1280\times720$。共 11 videos、24 editing prompts。
  • 背景 10 层 MLP、原 human-object 8 层 MLP、editable human 9 层 MLP;前 8 层由重建模型初始化。
  • Adam、LR $5\times10^{-4}$、20K iterations;单 A100。
  • 长视频(300–400 帧)editing operation:7.3 小时;CoDeF/StableVideo 约 1 分钟,Text2Video-Zero 15 分钟,Rerender 1.2 小时,Text2LIVE 约 2 小时。
  • 论文未完整拆分源 NeRF reconstruction、DreamBooth-LoRA、参考图/预处理与渲染成本,也未报告参数量、显存和 GPU-hours。

指标与人评

方法CLIPScore↑
Text2Video-Zero26.70
Rerender-A-Video26.11
Text2LIVE22.77
StableVideo22.02
CoDeF16.77
DynVideo-E31.31
  • 24 prompts,MTurk 每 pair 10 ratings;共 1,140 comparisons、32 raters
  • DynVideo-E 对五基线的文本忠实度偏好为 90.83%–98.75%,时序偏好 73.33%–96.25%,总体质量 87.92%–98.75%
  • 但输入不对称:DynVideo-E 使用参考图、个性化 2D/3D priors;基线使用由参考图生成的文本描述。场景也专门选择基线 2D atlas/canonical representation 易失败的大运动/大视角人体视频。
  • 没有 identity、pose/trajectory、novel-view geometry、source LPIPS/locality 或自动 temporal metric;人评无置信区间和一致性。

消融、失败与边界

  • 两场景 CLIP image similarity:Full 0.756/0.647;去 local SR 0.736/0.645;再去 reconstruction 0.728/0.617;去 2D SDS 0.679/0.517;去 3D SDS 0.711/0.613;去 LoRA 0.698/0.539。
  • 附录平均 Full 0.674,删减后最低到 0.572;但若删太多组件,部分视频不收敛,平均有 survivor bias,且消融不是严格单因素。
  • 强依赖 COLMAP、人体姿态、SAM、深度和 HOSNeRF reconstruction;复杂遮挡、多主体、拓扑变化与非人体缺证据。
  • 交互物体“保持”来自原模型和 mask 路由,不是语义理解。
  • SDS 和 $128^2$ 全局训练可能产生未观察视角、身份和几何错误。
  • 不能改变动作或镜头;free-view rendering 不等于通用 text-to-video generation。

对当前 Wiki 判断的影响

  • 视频编辑:这是 2D attention/atlas 路线之外的 3D dynamic representation 分支,适合源视频大视角与人体动作,但付出极高逐视频优化成本。
  • 视频编辑理解:显式 pose/camera/segmentation 提供几何控制,不证明模型理解动作、交互关系或自然语言镜头意图。
  • benchmark 问题:专门小数据与输入不对称会产生极高 pairwise win rate,却不能回答通用编辑能力。

证据评级

B-(专门场景优势和人评强,但数据小、比较接口不对称、成本极高且缺几何/身份量化)

原始链接

相关页面