LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

StreamingT2V一致、动态、可扩展的长视频文本生成

一句话结论

StreamingT2V 把短视频U-Net扩散模型改成chunk-wise长视频系统:CAM记上一块、APM记第一块anchor外观,再以重叠块随机融合做720²增强;240帧评测MAWE 52.3最优,但“2分钟/无限延展”、身份保持、实时streaming与DiT泛化都缺少同强度定量证据。

问题定义

简单把I2V/T2V短片自回归拼接会hard cut、外观漂移或运动停滞。论文将问题拆成短期边界连续、长期场景/外观记忆和高分辨率重叠块融合。

方法概述

  1. off-the-shelf T2V生成16帧、256²首块。
  2. CAM:上一块最后8帧经condition encoder,在U-Net各skip connection上作为temporal cross-attention的K/V;避免SparseCtrl补黑帧。
  3. APM:第一块anchor frame的CLIP image token扩成16 tokens,与文本融合并注入cross-attention,作为长期外观提示。
  4. 生成240/1200帧后,以24帧块、8帧重叠送入MS-Vid2Vid-XL式refiner;共享noise并逐去噪步随机选择overlap切点。

主实现是ModelScope风格latent diffusion U-Net,不是DiT。对OpenSora只把CAM接到最后14个Transformer blocks做定性展示。

评测协议与结果

作者自建50 prompts;所有方法共享同一首块和refiner,统一评240帧。指标:MAWE↓同时惩罚warp error与低运动,SCuts↓检测硬切,CLIP↑衡量逐帧文本对齐。

方法MAWE↓SCuts↓CLIP↑
OpenSoraPlan72.90.2429.34
FreeNoise1298.4031.55
StreamingT2V52.30.0431.73

FreeNoise的SCuts最低是因为接近静止。StreamingT2V相对第二名OpenSoraPlan的MAWE约低28%。120→220帧CLIP从32.45缓降到31.79,但不能外推1200帧仍稳定。

成本、人评与消融

论文未披露CAM/APM训练数据、steps、GPU数、GPU-hours、推理wall-clock、显存或随长度增长曲线;不能称实时或低成本。refinement本身无需额外训练,不代表整套系统training-free。

没有正式用户研究、无identity/re-ID指标。随机blending只以X-T slice定性优于naive concatenation/shared noise;CAM/APM核心消融缺少可复核的完整定量表。

局限或疑问

  • 单prompt、单anchor,不支持多段剧情或角色状态记忆。
  • APM是CLIP外观提示,不是严格人脸/主体identity guarantee。
  • “streaming”是可循环分块生成,不等于实时在线、恒定内存或边播边生成。
  • 1200帧/2分钟主要靠定性展示;主定量只到240帧。
  • OpenSora/DiT迁移没有量化、成本和消融,不能作为DiT主干证据。
  • 无训练/推理成本与正式人评。

相关页面

证据评级

B:240帧多基线结果与MAWE设计有价值;成本、人评、身份度量、关键消融和超长视频定量不足。