当前判断
视频生成
研究文本到视频与图像到视频怎样同时获得空间质量、运动可控、主体一致、长时结构和可承受的训练/推理成本。
阅读路径
- 问题明确任务与证据边界
- 方法比较方法族与结构选择
- 证据回到论文与可检索全文
- 开放问题记录仍待验证的张力
研究方法族地图
从问题定义走向可复核的系统能力
三分钟摘要
- 视频生成不是“每帧图像生成”。系统必须同时保持主体/场景、产生合理运动、覆盖足够时间、服从条件并控制时空 token 成本。
- 短视频质量已经很强,但长时一致、事件推进、物理/几何、可重复运动控制和可靠评测仍是主要瓶颈。
- 近五年形成四条并行主线:复用图像扩散先验、构建视频预训练底座、显式轨迹/草图/运动控制、以及流式/线性/一步生成效率。
- 适合研究生的入口是可诊断的运动控制、长时错误指标、同预算系统测量和专业场景数据,而不是从头训练通用视频基础模型。
任务或系统流程
一段视频的内容、运动、时间和成本分别由哪里决定?
条件先被编码,模型还要规划或隐式表示时间;时空生成主干产生 latent 序列,解码后必须同时检查空间与时间维度。
- 条件输入文本、首帧/参考图、轨迹、草图、摄像机或结构控制
- 时空表示/规划帧 token、3D latent、运动 token、窗口或长短期记忆
- 生成主干视频 U-Net、DiT、分解 attention、线性模块或少步学生
- 解码与拼接从 latent 恢复帧,并处理窗口边界、分辨率与流式上下文
- 联合验收空间质量、时间一致、动态程度、条件遵循、时长和真实成本
文本、图像或轨迹条件经编码和时间规划,进入时空生成主干,解码为帧序列,再评估画质、运动、主体一致、条件遵循与延迟。
当前综合判断
视频生成的核心竞争已从“能不能动”转向“怎样按意图稳定地动,并持续足够长”。Tune-A-Video 展示图像扩散模型可通过轻量时序适配迁移到视频,VideoCrafter2 则代表专门视频数据与训练系统。两者说明图像先验重要,但视频运动不能只靠复制帧级语义。
长视频和效率需要分层判断。StreamingT2V 用短/长期记忆扩展生成,LinGen 通过线性复杂度模块冲击分钟级生成,OSV 将 image-to-video 压到一步并保留 refinement。它们分别改变上下文管理、单步主干和采样步数,不能只用“更快/更长”合并。
控制接口正在从文本扩展到轨迹、草图和运动强度。Tora、MotionStone 与 SketchVideo 表明显式结构有用,但控制正确不等于物理真实、身份稳定或长时事件合理。
近五年演化(2022—2026)
视频生成近五年的研究重心如何变化?
节点按系统能力组织;编辑论文作为反方/邻近证据,只用于解释一致性和控制接口,不等同于纯生成结果。
- 2022–2023 · 迁移图像先验单视频适配与时序模块让 T2I 扩散进入视频
- 2023–2024 · 专门视频底座VideoCrafter2 等扩大视频数据与训练,质量/运动开始分开优化
- 2024 · 多维评测EvalCrafter、Video-Bench 等强调画质、时间与条件的不同维度
- 2025 · 显式运动控制Tora、MotionStone、SketchVideo 将轨迹、强度和草图接入生成
- 2025 · 长时与效率StreamingT2V、LinGen、OSV 分别推进记忆、线性主干和一步 I2V
- 2026 · 可靠系统比较重点转向真实时长、事件一致、物理失败和完整训练/推理预算
2022 到 2023 年复用图像扩散和视频训练,2024 年评测与一致性,2025 年轨迹、流式、线性和一步生成,2026 年强调同预算长时可靠性。
方法家族与成熟阶段
一篇论文是在提高画面、运动、时长、控制还是效率?
同一方法常同时改多层;必须用对应指标和消融分开验证,避免只凭整体偏好分数归因。
- 图像先验迁移在预训练 T2I 上加入时间层、adapter 或逐视频微调
- 专用视频底座用视频数据从头/继续训练时空 U-Net 或 DiT
- 结构化运动控制轨迹、光流、草图、姿态或摄像机控制运动路径
- 长时与流式扩展窗口生成、记忆、层级计划或线性序列模块延长时间
- 少步与系统效率蒸馏、缓存、token 压缩、量化和解码并行降低成本
方法地图包括图像先验迁移、专用视频底座、结构化运动控制、长时记忆/流式生成、效率与评测。
方法家族的成熟度
短视频扩散底座
Tune-A-Video、VideoCrafter2 等已建立可复现时空扩散平台。
价值转向数据治理、域外运动和受控成本,而非再证明视频扩散可行。
图像到视频与首帧保持
OSV、MotionStone 等表明首帧条件与运动调制可产生强 I2V。
身份/几何保持与动态幅度的可校准 Pareto 边界。
轨迹、草图与显式运动控制
Tora、SketchVideo 提供结构条件接口,但复杂交互和物理约束不足。
多对象轨迹冲突、遮挡、摄像机与对象运动解耦。
长时、流式与记忆
StreamingT2V、LinGen 已推进可生成时长,长事件语义和误差累积仍是边界。
事件级计划、可回滚记忆和随时长增长的失效曲线。
少步部署与可靠评测
OSV 展示一步 I2V;AIGV-Assessor、EvalCrafter、Video-Bench、神经符号评测拆分质量与条件。
同硬件端到端延迟、长时/控制维度和人评一致性的统一协议。
哪些方向拥挤,哪些方向仍值得做
拥挤方向与研究机会
相对拥挤:只做短 prompt 短视频总体质量;仅增加 attention 层而不控制数据/预算;只用精选样例证明长时一致;只报告生成步数或 backbone FLOPs。
仍值得做:轨迹和多对象交互的可证伪控制;随时长增长的身份/场景/事件错误曲线;中文或体育/工业专业运动数据;统一报告主干、NFE、解码与流式缓存成本;评测器与人类偏好的失效审计。
反方证据、局限与可证伪条件
- 如果随机抽取长片段后主体/场景错误随时长快速增长,“长视频生成已解决”应被否定,即使拼接后总时长很长。
- 如果轨迹命中依赖简单背景/单对象,或控制器改善位置却损害外观,不能宣称通用运动控制。
- 如果一步模型的训练成本、解码器或 refinement 被排除在延迟外,效率结论必须收窄。
- GlitchBench 与多维评测说明定性平滑可能掩盖物理/时序异常;自动评测器也可能只捕捉表面一致。
- 数据许可、人物身份、记忆、安全、音视频同步和真实物理仍是共同风险。
研究生可行的研究入口
候选课题 A:长时错误增长与可定位评测优先推荐
展开研究设计收起研究设计
身份、背景、动作、事件和物理错误怎样随生成时长增长?
固定 2–3 个公开模型,按 2/4/8/16 秒切片,人工核验 300–500 个 prompt。
首次失效时间、错误持续/恢复、身份和条件命中、评测器—人类一致性。
若模型输出时长不可比,先固定短窗口滚动生成协议。
候选课题 B:多对象轨迹与遮挡控制方法型
展开研究设计收起研究设计
轨迹条件怎样处理交叉、遮挡和摄像机运动,能否定位控制冲突?
合成/体育轨迹小集,对比文本、单轨迹和多轨迹控制。
轨迹误差、ID 保持、遮挡恢复、外观质量和额外延迟。
若基础模型无法生成目标对象,先缩小到单一域并分离概念覆盖。
候选课题 C:同预算 I2V/长视频系统账本稳健
展开研究设计收起研究设计
采样步数、单步主干、token、解码与流式缓存分别贡献多少成本?
公开 checkpoint + 统一硬件,报告端到端 P50/P95、显存和质量。
秒视频/秒计算、峰值显存、能耗代理、动态/保持和失败率。
若训练预算不透明,结论限定为推理系统,不外推全生命周期。
推荐排序与止损条件
A 的评测资产最易复用,B 的方法新颖度更高,C 可建立工程基线。任何方法改造前先用 A/C 协议证明问题存在且可测。
证据基础
- 底座与迁移:sources/2026-04-14-tune-a-video、sources/2026-04-14-videocrafter2、sources/2026-04-14-encapsulated-composition-t2i-t2v。
- 控制与主干:sources/2026-04-12-tora、sources/2026-04-14-motionstone、sources/2026-04-14-sketchvideo、sources/2026-04-14-pathways-image-manifold。
- 长时与效率:sources/2026-04-12-lingen、sources/2026-04-12-osv、sources/2026-04-12-streamingt2v。
- 评测:sources/2026-04-14-aigv-assessor、sources/2026-04-14-video-bench、sources/2026-04-14-evalcrafter、sources/2026-04-14-glitchbench、sources/2026-04-14-neuro-symbolic-eval-t2v。
- 邻近编辑/一致性证据:sources/2026-04-14-rave-video-editing、sources/2026-04-14-motioneditor、sources/2026-04-14-maskint、sources/2026-04-14-ccedit、sources/2026-04-14-framepainter、sources/2026-04-14-qk-edit、sources/2026-04-14-insvie-1m、sources/2026-04-14-camel-video-editing、sources/2026-04-14-vidtome、sources/2026-04-14-motionfollower、sources/2026-04-14-reangle-a-video、sources/2026-04-14-stablevideo、sources/2026-04-14-pix2video、sources/2026-04-14-avid-video-inpainting、sources/2026-04-14-dynvideo-e、sources/2026-04-14-shape-aware-layered-video-editing、sources/2026-04-14-vive3d、sources/2026-04-14-fairy-video-to-video、sources/2026-04-14-flowvid。
开放问题
- 怎样定义“长时一致”而不只比较相邻帧?
- 事件计划与像素生成应统一还是分层?
- 视频评测器能否抵抗静态高质量、低动态和 prompt 捷径?
- 训练数据的授权、身份与时序重复怎样审计?