一句话结论
OSV 把 SVD 图像到视频模型经 latent GAN预训练与对抗一致性蒸馏压到一/少步;最佳FVD 171.15来自“1 step + Time Travel Sampler”,实际 NFE=2,接近25-step教师156.94,而不是纯单次网络评估。
问题定义
视频扩散迭代慢;LCM在1–2步时模糊,GAN蒸馏易坍塌且像素空间判别需VAE解码。OSV目标是兼得早期快速收敛、后期稳定性与少步refinement。
方法概述
两阶段训练
- LGP:student从SVD teacher初始化,仅训练LoRA;真实视频latent与student输出做Huber+GAN。冻结DINOv2外接2D空间、1D时间判别头。
- ACD:以阶段一初始化;teacher多步ODE target与student做consistency+adversarial学习,降低GAN后期干扰。
- Latent discriminator:不经VAE decoder,latent经sub-pixel upsample直接进DINOv2。
- TTS:取消会导致过曝的CFG,通过低时间点预测后“回跳”修正;标称一步、NFE=2。
主干是SVD时空U-Net/latent video diffusion,不是DiT。
数据与成本
- OpenVid-1M:1M训练、1,000测试;7 FPS,batch 1,Adam,lr 5e-6。
- 阶段一:1024×768,2K iterations,8×H800。
- 阶段二:20K iterations,2×H800;576×320起步,最后10K升到1024×768。
- 判别器局部测试:4.29→2.61秒/iteration;显存73.5→35.8GB(相对SF-V)。
- 未报告完整GPU-hours、美元成本或OSV推理秒数。
主结果
| 方法 | steps | NFE | FVD↓ |
|---|---|---|---|
| SVD教师 | 25 | 50 | 156.94 |
| AnimateLCM | 8 | 8 | 184.79 |
| SF-V(作者复现) | 1 | 1 | 425.68 |
| OSV普通 | 1 | 1 | 335.36 |
| OSV+TTS | 1 | 2 | 171.15 |
| OSV普通 | 2 | 2 | 181.95 |
所以OSV+TTS超过AnimateLCM 8-step,但未超过教师。SF-V无公开权重,公平性依赖作者复现。
消融与人评
teacher solver 1→5步使FVD 332.25→171.15;去阶段一为221.75;去对抗损失为405.41;加入VAE decoder为232.25;latent判别器为171.15。CFG 3/1.5/无CFG为531.23/426.71/335.36。
人评每模型生成30条视频,比较清晰度与平滑度;正文称OSV更受偏好,但未给参与者人数、总票数、置信区间,不能写成显著结论。
局限或疑问
- 接口是条件图像→短视频,不是通用T2V、长视频或视频编辑。
- 一步手部/人体运动会明显模糊;增加到4步可缓解。
- 主自动评测几乎只有FVD,缺少VBench、identity与文本控制指标。
- “一步”最佳数字依赖TTS NFE=2,必须明确口径。
- 不支持DiT主干趋势判断。
相关页面
证据评级
A-:训练资源、主表与多项消融完整;评测单一、人评披露不足、推理wall-clock缺失及step/NFE口径易混淆。