LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

InsViE-1M通过精细数据构造实现 instruction-based 视频编辑

一句话结论

InsViE-1M 用约 102 万个高分辨率三元组、GPT-4o + optical-flow 双过滤和三阶段课程微调 CogVideoX-2B,在自建 100 视频与 TGVE/TGVE+ 上取得强结果;它证明数据工程与原生视频底座可以共同改善编辑,但没有把数据质量、规模、架构与 64×A100 训练预算完全拆开。

论文定位与接口

  • 输入:源视频 + 自然语言 instruction,无需 mask 或 edited first frame。
  • 输出:instruction-based edited video。
  • 核心对象:数据构造、质量过滤、CogVideoX-2B LoRA 与分阶段训练。
  • 非目标:长视频、多镜头剪辑、编辑解释或叙事推理。

数据与方法

来源数量输出帧数GPTEPE
Real videos450,7901024×576253.470.79
Image pairs110,3741024×576253.431.22
Real images458,4291024×576254.070.16
总计1,019,5931024×576253.740.55
  1. CosXL 以 CFG 3–8 生成 6 个首帧候选,GPT-4o 选四维最佳结果。
  2. SVD 传播到视频,再以 GPT-4o 六维评分和 GMFlow EPE 过滤。
  3. CogVideoX-2B 仅训练 input embedding 与 rank-128 LoRA。
  4. Set-S1 全量 20k steps;Set-S2 高质量子集 10k;Set-S3 静态:真实=5:1、加入 LPIPS loss,再 10k。

实验设置

  • 720×480 crop,batch 128,64×A100;训练约 100 小时,推理约 90 秒/20 GB/单 GPU。
  • 自建 100 视频测试集(DAVIS/YoutubeVOS/Pexels)以及 TGVE/TGVE+。
  • 八指标覆盖 temporal consistency、text alignment、video quality;GPT-4o 同时参与过滤与评测。

核心结果

方法TC CLIP ↑EPE ↓TA CLIP ↑Pick ↑DOVER ↑VQ GPT ↑
TokenFlow0.9516.5818.5918.630.5663.77
Videoshop0.9525.0218.9218.780.5013.42
InsV2V0.9514.9719.0118.750.5593.68
InsViE0.9564.8419.3718.910.5673.79

主表八项均最优,但部分差距很小,且底座、训练数据、分辨率与计算量未受控。TGVE/TGVE+ 上 InsViE 四项也均最优;InsV2V 在该数据上重训后多数指标改善,是数据价值的相邻受控证据。

关键消融

设置TC CLIP ↑EPE ↓TA CLIP ↑Pick ↑DOVER ↑
w/o GPT filter0.9445.6618.4718.230.515
w/o OF filter0.9416.5818.7318.370.490
Stage 10.9505.0818.8718.400.510
Stage 1&20.9514.8719.0318.650.519
Stage 1&2&30.9564.8419.3718.910.567

GPT filter 更影响文本对齐,OF filter 更影响运动/画质;Stage 3 同时改变静态数据比例并加入 LPIPS,无法拆开两者贡献。

局限或疑问

  • 作者承认过滤受 GPT-4o 视觉理解上限制约,25 帧仍不够长。
  • 干净 instruction 训练导致对无用描述鲁棒性较差,并继承开源生成底座缺陷。
  • GPT-4o 既筛数据又参与三组评测,存在 evaluator coupling。
  • 64×A100、100 小时,加上数据生成/筛选,成本和复现门槛高。
  • 原始数据近半来自静态图像,Set-S3 静态:真实=5:1;高画质不等于复杂运动覆盖。
  • 自建测试仅 100 视频,CLIP/Pick/DOVER/EPE 不测关系、物理、叙事与编辑规划。

对当前 Wiki 判断的影响

  • 视频编辑直接支持大规模过滤数据 + 原生视频底座微调路线。
  • 视频生成间接支持生成底座会限制编辑能力,不等于评测开放式 T2V。
  • 图像编辑背景/迁移证据,只因图像编辑对参与数据构造。
  • 数据与架构问题相邻间接支持,且问题域不同;不能据此证明数据比架构更重要。
  • 视频编辑理解评测问题压力测试证据。八项输出指标仍不测剪辑元素识别、依据推理、叙事功能或多步计划。

证据评级

B+(视频编辑数据工程强案例)。数据统计、跨 benchmark 主表与过滤/课程消融较完整;但 GPT 循环评估、比较不受控、训练成本大,无法精确分离数据、架构和预算贡献。

原始链接

相关页面