LLLMWIKI
ArticleResearch mapReading portalMetadata

Topic · Updated 2026-07-14

Video Generation

研究文本到视频与图像到视频怎样同时获得空间质量、运动可控、主体一致、长时结构和可承受的训练/推理成本。

Current view

Video Generation

研究文本到视频与图像到视频怎样同时获得空间质量、运动可控、主体一致、长时结构和可承受的训练/推理成本。

34 Source notes0 Open questions

Reading path

  1. ProblemDefine task and evidence boundary
  2. MethodsCompare families and design choices
  3. EvidenceReturn to papers and searchable text
  4. Open questionsTrack unresolved tensions

Method family map

From problem definition to verifiable system capability

34 Source notes
1ProblemDefine task and evidence boundary
2MethodsCompare families and design choices
3EvidenceReturn to papers and searchable text
4Open questionsTrack unresolved tensions

三分钟摘要

  • 视频生成不是“每帧图像生成”。系统必须同时保持主体/场景、产生合理运动、覆盖足够时间、服从条件并控制时空 token 成本。
  • 短视频质量已经很强,但长时一致、事件推进、物理/几何、可重复运动控制和可靠评测仍是主要瓶颈。
  • 近五年形成四条并行主线:复用图像扩散先验、构建视频预训练底座、显式轨迹/草图/运动控制、以及流式/线性/一步生成效率。
  • 适合研究生的入口是可诊断的运动控制、长时错误指标、同预算系统测量和专业场景数据,而不是从头训练通用视频基础模型。

任务或系统流程

一段视频的内容、运动、时间和成本分别由哪里决定?

条件怎样变成可验收视频

条件先被编码,模型还要规划或隐式表示时间;时空生成主干产生 latent 序列,解码后必须同时检查空间与时间维度。

  1. 条件输入文本、首帧/参考图、轨迹、草图、摄像机或结构控制
  2. 时空表示/规划帧 token、3D latent、运动 token、窗口或长短期记忆
  3. 生成主干视频 U-Net、DiT、分解 attention、线性模块或少步学生
  4. 解码与拼接从 latent 恢复帧,并处理窗口边界、分辨率与流式上下文
  5. 联合验收空间质量、时间一致、动态程度、条件遵循、时长和真实成本
Diagram evidenceVideoCrafter2ToraStreamingT2VVideo-Bench

文本、图像或轨迹条件经编码和时间规划,进入时空生成主干,解码为帧序列,再评估画质、运动、主体一致、条件遵循与延迟。

当前综合判断

视频生成的核心竞争已从“能不能动”转向“怎样按意图稳定地动,并持续足够长”。Tune-A-Video 展示图像扩散模型可通过轻量时序适配迁移到视频,VideoCrafter2 则代表专门视频数据与训练系统。两者说明图像先验重要,但视频运动不能只靠复制帧级语义。

长视频和效率需要分层判断。StreamingT2V 用短/长期记忆扩展生成,LinGen 通过线性复杂度模块冲击分钟级生成,OSV 将 image-to-video 压到一步并保留 refinement。它们分别改变上下文管理、单步主干和采样步数,不能只用“更快/更长”合并。

控制接口正在从文本扩展到轨迹、草图和运动强度。ToraMotionStoneSketchVideo 表明显式结构有用,但控制正确不等于物理真实、身份稳定或长时事件合理。

近五年演化(2022—2026)

视频生成近五年的研究重心如何变化?

从图像先验迁移到长视频与少步系统

节点按系统能力组织;编辑论文作为反方/邻近证据,只用于解释一致性和控制接口,不等同于纯生成结果。

  1. 2022–2023 · 迁移图像先验单视频适配与时序模块让 T2I 扩散进入视频
  2. 2023–2024 · 专门视频底座VideoCrafter2 等扩大视频数据与训练,质量/运动开始分开优化
  3. 2024 · 多维评测EvalCrafter、Video-Bench 等强调画质、时间与条件的不同维度
  4. 2025 · 显式运动控制Tora、MotionStone、SketchVideo 将轨迹、强度和草图接入生成
  5. 2025 · 长时与效率StreamingT2V、LinGen、OSV 分别推进记忆、线性主干和一步 I2V
  6. 2026 · 可靠系统比较重点转向真实时长、事件一致、物理失败和完整训练/推理预算
Diagram evidenceTune-A-VideoVideoCrafter2EvalCrafterLinGenOSV

2022 到 2023 年复用图像扩散和视频训练,2024 年评测与一致性,2025 年轨迹、流式、线性和一步生成,2026 年强调同预算长时可靠性。

方法家族与成熟阶段

一篇论文是在提高画面、运动、时长、控制还是效率?

视频生成的五类方法对应五种瓶颈

同一方法常同时改多层;必须用对应指标和消融分开验证,避免只凭整体偏好分数归因。

  1. 图像先验迁移在预训练 T2I 上加入时间层、adapter 或逐视频微调
  2. 专用视频底座用视频数据从头/继续训练时空 U-Net 或 DiT
  3. 结构化运动控制轨迹、光流、草图、姿态或摄像机控制运动路径
  4. 长时与流式扩展窗口生成、记忆、层级计划或线性序列模块延长时间
  5. 少步与系统效率蒸馏、缓存、token 压缩、量化和解码并行降低成本
Diagram evidenceTune-A-VideoToraStreamingT2VOSV

方法地图包括图像先验迁移、专用视频底座、结构化运动控制、长时记忆/流式生成、效率与评测。

方法家族的成熟度

Current stage成熟底座

短视频扩散底座

Evidence anchors

Tune-A-Video、VideoCrafter2 等已建立可复现时空扩散平台。

Research opportunity

价值转向数据治理、域外运动和受控成本,而非再证明视频扩散可行。

Current stage活跃发展期

图像到视频与首帧保持

Evidence anchors

OSV、MotionStone 等表明首帧条件与运动调制可产生强 I2V。

Research opportunity

身份/几何保持与动态幅度的可校准 Pareto 边界。

Current stage活跃发展期

轨迹、草图与显式运动控制

Evidence anchors

Tora、SketchVideo 提供结构条件接口,但复杂交互和物理约束不足。

Research opportunity

多对象轨迹冲突、遮挡、摄像机与对象运动解耦。

Current stage早期整合期

长时、流式与记忆

Evidence anchors

StreamingT2V、LinGen 已推进可生成时长,长事件语义和误差累积仍是边界。

Research opportunity

事件级计划、可回滚记忆和随时长增长的失效曲线。

Current stage评测建设期

少步部署与可靠评测

Evidence anchors

OSV 展示一步 I2V;AIGV-Assessor、EvalCrafter、Video-Bench、神经符号评测拆分质量与条件。

Research opportunity

同硬件端到端延迟、长时/控制维度和人评一致性的统一协议。

哪些方向拥挤,哪些方向仍值得做

拥挤方向与研究机会

相对拥挤:只做短 prompt 短视频总体质量;仅增加 attention 层而不控制数据/预算;只用精选样例证明长时一致;只报告生成步数或 backbone FLOPs。

仍值得做:轨迹和多对象交互的可证伪控制;随时长增长的身份/场景/事件错误曲线;中文或体育/工业专业运动数据;统一报告主干、NFE、解码与流式缓存成本;评测器与人类偏好的失效审计。

反方证据、局限与可证伪条件

  • 如果随机抽取长片段后主体/场景错误随时长快速增长,“长视频生成已解决”应被否定,即使拼接后总时长很长。
  • 如果轨迹命中依赖简单背景/单对象,或控制器改善位置却损害外观,不能宣称通用运动控制。
  • 如果一步模型的训练成本、解码器或 refinement 被排除在延迟外,效率结论必须收窄。
  • GlitchBench 与多维评测说明定性平滑可能掩盖物理/时序异常;自动评测器也可能只捕捉表面一致。
  • 数据许可、人物身份、记忆、安全、音视频同步和真实物理仍是共同风险。

研究生可行的研究入口

候选课题 A:长时错误增长与可定位评测优先推荐

Expand research designCollapse research design
研究问题

身份、背景、动作、事件和物理错误怎样随生成时长增长?

最小实验

固定 2–3 个公开模型,按 2/4/8/16 秒切片,人工核验 300–500 个 prompt。

指标

首次失效时间、错误持续/恢复、身份和条件命中、评测器—人类一致性。

止损条件

若模型输出时长不可比,先固定短窗口滚动生成协议。

候选课题 B:多对象轨迹与遮挡控制方法型

Expand research designCollapse research design
研究问题

轨迹条件怎样处理交叉、遮挡和摄像机运动,能否定位控制冲突?

最小实验

合成/体育轨迹小集,对比文本、单轨迹和多轨迹控制。

指标

轨迹误差、ID 保持、遮挡恢复、外观质量和额外延迟。

止损条件

若基础模型无法生成目标对象,先缩小到单一域并分离概念覆盖。

候选课题 C:同预算 I2V/长视频系统账本稳健

Expand research designCollapse research design
研究问题

采样步数、单步主干、token、解码与流式缓存分别贡献多少成本?

最小实验

公开 checkpoint + 统一硬件,报告端到端 P50/P95、显存和质量。

指标

秒视频/秒计算、峰值显存、能耗代理、动态/保持和失败率。

止损条件

若训练预算不透明,结论限定为推理系统,不外推全生命周期。

推荐排序与止损条件

A 的评测资产最易复用,B 的方法新颖度更高,C 可建立工程基线。任何方法改造前先用 A/C 协议证明问题存在且可测。

证据基础

开放问题

  • 怎样定义“长时一致”而不只比较相邻帧?
  • 事件计划与像素生成应统一还是分层?
  • 视频评测器能否抵抗静态高质量、低动态和 prompt 捷径?
  • 训练数据的授权、身份与时序重复怎样审计?

相关页面