一句话结论
StreamingT2V 把短视频U-Net扩散模型改成chunk-wise长视频系统:CAM记上一块、APM记第一块anchor外观,再以重叠块随机融合做720²增强;240帧评测MAWE 52.3最优,但“2分钟/无限延展”、身份保持、实时streaming与DiT泛化都缺少同强度定量证据。
问题定义
简单把I2V/T2V短片自回归拼接会hard cut、外观漂移或运动停滞。论文将问题拆成短期边界连续、长期场景/外观记忆和高分辨率重叠块融合。
方法概述
- off-the-shelf T2V生成16帧、256²首块。
- CAM:上一块最后8帧经condition encoder,在U-Net各skip connection上作为temporal cross-attention的K/V;避免SparseCtrl补黑帧。
- APM:第一块anchor frame的CLIP image token扩成16 tokens,与文本融合并注入cross-attention,作为长期外观提示。
- 生成240/1200帧后,以24帧块、8帧重叠送入MS-Vid2Vid-XL式refiner;共享noise并逐去噪步随机选择overlap切点。
主实现是ModelScope风格latent diffusion U-Net,不是DiT。对OpenSora只把CAM接到最后14个Transformer blocks做定性展示。
评测协议与结果
作者自建50 prompts;所有方法共享同一首块和refiner,统一评240帧。指标:MAWE↓同时惩罚warp error与低运动,SCuts↓检测硬切,CLIP↑衡量逐帧文本对齐。
| 方法 | MAWE↓ | SCuts↓ | CLIP↑ |
|---|---|---|---|
| OpenSoraPlan | 72.9 | 0.24 | 29.34 |
| FreeNoise | 1298.4 | 0 | 31.55 |
| StreamingT2V | 52.3 | 0.04 | 31.73 |
FreeNoise的SCuts最低是因为接近静止。StreamingT2V相对第二名OpenSoraPlan的MAWE约低28%。120→220帧CLIP从32.45缓降到31.79,但不能外推1200帧仍稳定。
成本、人评与消融
论文未披露CAM/APM训练数据、steps、GPU数、GPU-hours、推理wall-clock、显存或随长度增长曲线;不能称实时或低成本。refinement本身无需额外训练,不代表整套系统training-free。
没有正式用户研究、无identity/re-ID指标。随机blending只以X-T slice定性优于naive concatenation/shared noise;CAM/APM核心消融缺少可复核的完整定量表。
局限或疑问
- 单prompt、单anchor,不支持多段剧情或角色状态记忆。
- APM是CLIP外观提示,不是严格人脸/主体identity guarantee。
- “streaming”是可循环分块生成,不等于实时在线、恒定内存或边播边生成。
- 1200帧/2分钟主要靠定性展示;主定量只到240帧。
- OpenSora/DiT迁移没有量化、成本和消融,不能作为DiT主干证据。
- 无训练/推理成本与正式人评。
相关页面
证据评级
B:240帧多基线结果与MAWE设计有价值;成本、人评、身份度量、关键消融和超长视频定量不足。