LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

OSV高质量图像到视频生成一步就够

一句话结论

OSV 把 SVD 图像到视频模型经 latent GAN预训练与对抗一致性蒸馏压到一/少步;最佳FVD 171.15来自“1 step + Time Travel Sampler”,实际 NFE=2,接近25-step教师156.94,而不是纯单次网络评估。

问题定义

视频扩散迭代慢;LCM在1–2步时模糊,GAN蒸馏易坍塌且像素空间判别需VAE解码。OSV目标是兼得早期快速收敛、后期稳定性与少步refinement。

方法概述

两阶段训练

  1. LGP:student从SVD teacher初始化,仅训练LoRA;真实视频latent与student输出做Huber+GAN。冻结DINOv2外接2D空间、1D时间判别头。
  2. ACD:以阶段一初始化;teacher多步ODE target与student做consistency+adversarial学习,降低GAN后期干扰。
  3. Latent discriminator:不经VAE decoder,latent经sub-pixel upsample直接进DINOv2。
  4. TTS:取消会导致过曝的CFG,通过低时间点预测后“回跳”修正;标称一步、NFE=2。

主干是SVD时空U-Net/latent video diffusion,不是DiT。

数据与成本

  • OpenVid-1M:1M训练、1,000测试;7 FPS,batch 1,Adam,lr 5e-6。
  • 阶段一:1024×768,2K iterations,8×H800。
  • 阶段二:20K iterations,2×H800;576×320起步,最后10K升到1024×768。
  • 判别器局部测试:4.29→2.61秒/iteration;显存73.5→35.8GB(相对SF-V)。
  • 未报告完整GPU-hours、美元成本或OSV推理秒数。

主结果

方法stepsNFEFVD↓
SVD教师2550156.94
AnimateLCM88184.79
SF-V(作者复现)11425.68
OSV普通11335.36
OSV+TTS12171.15
OSV普通22181.95

所以OSV+TTS超过AnimateLCM 8-step,但未超过教师。SF-V无公开权重,公平性依赖作者复现。

消融与人评

teacher solver 1→5步使FVD 332.25→171.15;去阶段一为221.75;去对抗损失为405.41;加入VAE decoder为232.25;latent判别器为171.15。CFG 3/1.5/无CFG为531.23/426.71/335.36。

人评每模型生成30条视频,比较清晰度与平滑度;正文称OSV更受偏好,但未给参与者人数、总票数、置信区间,不能写成显著结论。

局限或疑问

  • 接口是条件图像→短视频,不是通用T2V、长视频或视频编辑。
  • 一步手部/人体运动会明显模糊;增加到4步可缓解。
  • 主自动评测几乎只有FVD,缺少VBench、identity与文本控制指标。
  • “一步”最佳数字依赖TTS NFE=2,必须明确口径。
  • 不支持DiT主干趋势判断。

相关页面

证据评级

A-:训练资源、主表与多项消融完整;评测单一、人评披露不足、推理wall-clock缺失及step/NFE口径易混淆。