Open question
图像编辑的进步主要来自数据扩展还是架构升级
This question remains open and needs new primary evidence.
问题
当前图像编辑方向里的性能提升,到底主要来自更大、更干净、覆盖更广的编辑数据,还是来自更强的架构设计、表示分配与多模态控制接口?这个问题并不只是技术归因;它会直接决定后续研究更应该押注数据工厂、主干改造、推理接口,还是这几者的协同设计。
这个问题现在为什么变得更重要
topics/image-editing 已经不再是一条单线升级路线,而是同时出现了数据工厂、区域 grounding、统一接口、低时延编辑、视频化架构重写等多股力量。随着这几条路线都开始拿出看起来显著的提升,单纯说“又变好了”已经不够;更关键的是要判断改进到底来自哪一层,才能知道哪些增益具有可迁移性,哪些只是局部工程套利。
当前证据在说什么
更偏向“数据先打开上限”
- sources/2026-04-14-instructpix2pix 很早就说明,instruction-based image editing 能成立,本身就强依赖合成 supervision 与任务定义。
- sources/2026-04-12-anyedit 把高质量多任务编辑数据和任务组织推到主线前台,说明数据覆盖面仍然是统一编辑系统最稳的杠杆。
- sources/2026-04-12-insightedit 进一步证明,光有任务定义不够,数据质量、指令复杂度与背景保持监督都会显著影响最终表现。
更偏向“架构决定能不能把数据兑现出来”
- sources/2026-04-12-fireedit 说明局部 grounding 与区域感知控制不是简单喂更多数据就能自然长出来,架构接口本身在决定编辑精度。
- sources/2026-04-14-diffeditor 代表的是通过编辑机制、采样设计与局部约束来提升效果的路线。
- sources/2026-04-12-d2it 与 sources/2026-04-14-motionstone 都说明,哪怕不改变任务定义,主干内部的表示分配与结构调制也能单独形成强增益。
- sources/2026-04-14-pathways-image-manifold 更激进:它不是优化原问题,而是把图像编辑直接重写成视频生成式的连续路径问题。
更像“数据与架构共同重写任务”
- sources/2026-04-12-dreamomni 说明统一训练与 synthetic data pipeline 往往是一起出现的,难以拆成纯数据或纯架构因素。
- sources/2026-04-12-swiftedit 说明当速度成为核心目标时,数据监督、蒸馏目标和一步式架构会紧密耦合,不能单独理解。
2026-07-12 全文复核:九个可量化归因锚点
- AnyDoor—大规模混合数据与身份/细节接口耦合:13 组视频、分割、多视角、试衣和显著性来源支撑未见对象泛化;DINOv2 global+patch+去背景把 CLIP/DINO 提到 82.1/67.8,HF-map 与 ATS 又控制保真—变化折中。论文没有同预算数据规模/模块因果比较。
- CDS—固定数据与主干时的目标函数收益:冻结 SD1.4、无 paired edit data,只加入 self-attention patch contrastive loss;cat→dog 的 Dist/LPIPS 0.023/0.080→0.020/0.079,CLIP 97.9→97.5,展示结构保持与语义编辑的可量化 trade-off。
- Imagen Editor—训练样本组织改变条件使用率:固定 Imagen Editor 架构,object-detector mask training 相对 random-mask training 获得 68% text-alignment 人工偏好;新条件 encoder/downsampler 又负责 1024×1024 边界保真。它把“数据”细化为 mask-policy/任务难度,把“架构”细化为条件注入与高分辨率重建。
- LDM—表示空间重写系统成本:同一 A100、同参数量和训练步数下,$f=4$–8 形成压缩 sweet spot;inpainting 的 pixel LDM-1 到 LDM-4 VQ,train/sample@256/sample@512 throughput 从 0.11/0.26/0.07 提升到 0.33/0.97/0.34,FID@epoch6 从 24.74 改善到 14.99。LAION-400M 又决定开放文本概念覆盖,说明表示结构与数据规模共同构成平台能力。
- Null-text Inversion—机制层改变真实图像可编辑性:固定 Stable Diffusion 权重和训练数据,只以 DDIM pivot 优化 per-timestep unconditional embeddings;250 iterations 约 1 分钟/A100,user study 选择率为 65.1%。它改善 reconstruction/editability,同时没有扩展概念覆盖或复杂结构生成能力。
- InstructPix2Pix—数据打开任务:454,445 个合成文本三元组建立统一自然语言编辑接口;只用 1%/10% 数据时,大幅结构编辑明显退化。数据量改变能力类型,双条件 CFG 再调节编辑强度与输入保持。
- DiffEditor—专用结构兑现精度:在同一 SD/DragonDiffusion 家族中,17/68 点拖拽 MSE 从 DragonDiffusion 的 18.51/13.94 降至 17.05/11.52;收益来自区域随机性、局部梯度和 time travel。其图像提示模块仍在 LAION 上训练 100 万步。
- GLIGEN—数据和接口可分开观察:gated self-attention 相比 cross-attention 的 YOLO AP 为 21.7 vs 16.6;Fourier box embedding 换成 MLP 后 AP 从 21.7 降至 3.2。扩展 grounding 数据又把 LVIS zero-shot AP 从 6.4 提升到 11.1。
- DreamBooth—少样本激活既有先验:3–5 张主体图即可个性化,正确类别词与 prior-preservation 决定身份绑定和类别遗忘;它更接近“预训练世界知识 + 少样本主体证据 + 优化约束”的三因素组合。
四篇全文证据共同支持一个可执行分解:数据决定概念、任务和长尾覆盖;结构与目标函数决定这些监督能否转成空间控制、身份保持和副作用治理。 后续归因实验应固定基础模型与数据预算,再分别替换 adapter、conditioning、sampler 和 loss。
为什么还没有被真正解决
现在的大多数论文并不是在做干净的归因实验,而是在同时改:数据来源、任务拆分、模型主干、控制接口、训练损失和推理预算。也就是说,我们已经有很多“混合成功案例”,但还缺少足够多“同数据换架构”或“同架构换数据”的强对照证据。因此,当前更适合做结构化判断,而不适合下二选一结论。
阶段性综合判断
基于当前已经编译进 wiki 的证据,这个问题最稳的阶段性答案是:数据扩展仍然是图像编辑进步最稳定的地基,但架构升级越来越决定这些数据能否转化成可见的编辑质量、控制精度与副作用治理。
换句话说,数据更像“决定上限有没有被打开”,架构更像“决定这些上限能否被兑现”。在早期任务建立阶段,数据和监督设计的重要性最突出;但到了当前这轮竞争里,真正拉开差距的已经不是简单多收一点数据,而是能否把编辑问题重写成模型更擅长学习的结构问题,例如区域 grounding、主干内部调制、甚至跨任务借用视频生成路径。
当前更倾向的结论
- 短期内,继续做高质量数据与任务构造,仍然是最稳的收益来源。
- 但中期真正会把系统拉开差距的,往往是“能否把新增监督转成更强结构归纳”的架构设计。
- 因此这条 question 目前不支持“数据胜出”或“架构胜出”的简单结论;更合理的说法是:图像编辑已经进入数据工程与架构改写强耦合的阶段。
下一步最有价值的证据
- 同一 benchmark 下的“同架构不同数据”对照。
- 同一数据预算下的“同数据不同架构 / 不同控制接口”对照。
- 同时报告指令跟随、背景保持、局部精度与推理成本的系统级评测。
- 能明确回答“任务重写本身是不是比继续堆数据更值钱”的新工作。