Current view
Image Generation
研究如何把生成底座、条件控制、数据与评测接成可靠图像系统,并判断统一生成—编辑、少步部署和组合控制中仍有价值的问题。
Reading path
- ProblemDefine task and evidence boundary
- MethodsCompare families and design choices
- EvidenceReturn to papers and searchable text
- Open questionsTrack unresolved tensions
Method family map
From problem definition to verifiable system capability
三分钟摘要
- 任务已经从“给文字出图”扩展为系统问题。 现代图像生成同时受表示空间、去噪主干、条件接口、训练数据、推理预算和评测协议约束。
- 成熟底座不等于完整答案。 LDM 与 DiT 已把潜空间和可扩展主干做成平台,但精确布局、多个条件冲突、文字与细节、数据许可、真实延迟和可靠人评仍未被一个指标解决。
- 统一生成—编辑正在形成,但证据多为系统覆盖而非严格胜出。 OmniGen、DreamOmni 与 UniReal 说明共享接口和联合训练可行;它们没有完成同数据、同参数、同算力下对全部专用模型的受控替代实验。
- 适合研究生的机会更偏“可证伪的系统问题”。 例如组合控制失效、同预算质量—延迟比较、中文或专业领域数据、统一与模块化的受控比较,而不是只换一个更大的主干。
任务或系统流程
一个现代图像生成系统中,哪些环节分别决定语义、构图、细节和成本?
条件编码决定模型能“听懂”什么,生成主干决定怎样形成视觉样本,解码器决定可恢复的细节上限,评测层决定我们是否真的知道系统变好了。
- 用户条件文本、参考图、主体、边缘、深度、姿态或布局
- 条件表示与路由文本编码、视觉 token、交叉注意力或专用控制分支
- 生成主干在像素或潜空间中用扩散、流或自回归过程形成样本
- 解码与后处理从潜变量恢复分辨率、纹理、文字与局部细节
- 联合验收同时检查感知质量、条件一致、空间控制、多样性、延迟和失败模式
用户条件先编码为语义与空间约束,再进入迭代或少步生成主干,潜变量被解码为图像,最后用质量、对齐、控制与成本联合验收。
阅读论文时先标注每项工作改的是哪一环。只报告生成主干 FID 的论文,不能自动支持控制、数据合规或端到端延迟结论。
当前综合判断
图像生成已经进入“成熟底座上的系统竞争”。潜空间扩散 降低高分辨率计算,DiT 提供可扩展 Transformer 去噪器,GLIGEN 与 ControlNet 把开放集合与空间条件接入预训练底座。继续证明“扩散能生成图像”或“Transformer 能做去噪”的边际价值已经很低。
真正仍在变化的是四个接口:
- 任务接口:生成、编辑、参考图与多条件是否由同一模型处理;
- 控制接口:全局文本、主体身份、局部布局和像素级结构怎样组合并处理冲突;
- 成本接口:训练预算、网络函数求值、单步主干成本、CFG、解码器与硬件如何共同形成真实延迟;
- 证据接口:自动指标、人类偏好、空间遵循、文字细节、安全和数据来源怎样形成可复核结论。
因此本页不把“统一”或“一步生成”写成已完成趋势。当前更可靠的说法是:统一模型是重要平台路线,模块化条件器仍有明确价值;少步模型已能在特定配置达到亚秒级,但训练成本、质量退化和迁移范围必须单独核算。
近五年演化(2022—2026)
近五年图像生成的研究重心怎样移动?
时间线强调问题变化而非穷举模型。2026 表示截至本库复核时间的综合状态,不暗示每个节点都有同年论文。
- 2022 · 可扩展底座LDM 把高分辨率扩散搬入压缩潜空间
- 2023 · 主干与控制DiT、DreamBooth、GLIGEN、ControlNet 分别推进扩展、个性化与空间接口
- 2024 · 数据与评测开放许可数据、快速评测和可验证人评开始补齐系统证据
- 2025 · 统一与少步统一生成—编辑接口、动态主干和一步/少步部署并行推进
- 2026 · 受控系统比较研究价值转向同预算、跨域、失败模式和统一—模块化边界的可复现实验
2022 年潜空间扩散建立底座;2023 年主干、个性化与空间控制成形;2024 年开放数据和评测加强;2025 年统一生成编辑与少步系统发展;2026 年关注受控比较与可靠部署。
这条演化不等于旧方法被线性淘汰。DreamBooth 显示高保真个性化仍可能需要逐主体适配;DiffuSSM 则构成“注意力是唯一可扩展主干”的反证。平台越统一,越需要说明哪些能力来自共享先验、哪些仍来自专用数据与模块。
方法家族与成熟阶段
常被放在同一排行榜的方法,实际分别解决什么?
底座、主干、个性化、空间控制、统一接口和部署优化并非可互换路线。比较前必须先对齐任务、数据、预算与输出约束。
- 表示与基础生成像素或潜空间决定细节上限和计算尺度
- 主干与扩展U-Net、DiT、SSM 或混合网络决定单步表示与硬件特性
- 个性化与主体保持少样本适配、视觉提示或检索增强解决特定主体一致性
- 空间与组合控制box、mask、pose、depth、layout 和多条件冲突需要显式接口
- 统一生成—编辑共享模型与任务路由减少工作流割裂,但可能发生任务干扰
- 效率与部署蒸馏、求解器、缓存、量化和解码器共同形成端到端成本
方法地图列出潜空间底座、可扩展主干、个性化、空间控制、统一生成编辑、效率与部署六个分支。
方法家族的成熟度
潜空间扩散与基础生成
LDM 已用固定预算比较像素与多个压缩率;现代系统广泛复用这层表示,但精细文字和几何仍受解码上限影响。
价值不在重复证明潜空间更省,而在可测量地改进压缩—细节—延迟取舍。
可扩展去噪主干
同 FLOPs、显存和真实硬件下比较混合主干,避免只以参数量或单数据集 FID 排名。
个性化与主体驱动生成
DreamBooth 建立少样本主体适配基线,AnyDoor 与 CosmicMan 扩展对象与人物专门能力。
身份保持、组合多个主体、版权/记忆审计和低存储适配仍可形成明确问题。
空间与多条件控制
GLIGEN 与 ControlNet 证明专用接口有效,但复杂冲突条件、多模态组合和跨主干迁移证据不足。
建立冲突条件诊断集、控制强度校准与局部证据指标,比再加一个条件器更有辨识度。
统一生成—编辑系统
测量任务干扰、路由、数据混合和模块化补偿,回答“统一到哪一层最划算”。
少步生成、数据与可靠评测
SANA-Sprint 展示特定硬件上的一步端到端延迟;CommonCanvas 与 可验证人评 分别暴露数据来源和评测协议的重要性。
把训练预算、真实延迟、偏好、组合遵循和数据许可放进同一可复现实验账本。
哪些方向拥挤,哪些方向仍值得做
成熟度描述的是“证据与基础设施到了哪里”,不是给方向贴好坏标签。底座成熟后,研究需要更窄、更可证伪的问题定义。
拥挤方向与研究机会
相对拥挤、需要更强差异化的方向:
- 只在通用文本到图像上替换主干,并只报告单个 FID/CLIP 指标;
- 只把采样步数从若干步减到更少,却不报告单步成本、训练预算、CFG 与端到端延迟;
- 新增一个条件注入模块,但没有冲突条件、跨域或强基线消融;
- 用若干漂亮样例宣称统一模型已替代专用系统。
仍有清晰研究价值的方向:
- 可靠组合控制:关系、计数、文字、多个主体与空间条件同时出现时,定位失败发生在编码、路由、去噪还是评测层;
- 同预算生成系统比较:固定数据、参数/训练算力、分辨率、NFE 与硬件,比较 U-Net、DiT、SSM、蒸馏和求解器;
- 中文与专业领域生成:建立许可清楚、术语准确、含困难负例的数据和人评协议,而不只是翻译英文 prompt;
- 统一—模块化边界:量化联合训练的迁移收益与任务干扰,寻找“共享底座 + 专用轻模块”的最小系统;
- 评测可靠性:自动指标、人评、数据重叠、记忆和安全失败共同进入版本化评测。
反方证据、局限与可证伪条件
- 反方 1:主干并未收敛为唯一答案。 DiffuSSM 在受限设置中以更低训练计算接近 DiT;若后续同预算跨任务结果持续成立,“标准注意力 DiT 是唯一可扩展主干”应被否定。
- 反方 2:统一覆盖不等于全面优越。 DreamBooth、GLIGEN 与 ControlNet 都显示专用适配仍能提供统一文本接口缺失的能力。若同数据、同规模评测中统一模型在多个关键任务持续落后,强“统一替代”结论应撤回。
- 反方 3:少步不自动等于低成本。 SANA-Sprint 的推理很快,但依赖大规模蒸馏训练;若完整生命周期成本或质量—多样性下降抵消收益,就只能称部署优化而非全面效率胜出。
- 反方 4:单一自动指标可能反向排序。 可验证人评 发现 FID/CLIPScore 与人类判断可能冲突。任何“全面更好”结论都应至少覆盖质量、条件遵循、多样性和成本。
- 共同局限:训练数据许可、记忆、偏差、深度伪造、文字/手部/细几何失败及模型更新后的不可复现性,不能由更低 FID 自动消除。
研究生可行的研究入口
候选课题 A:多条件冲突的可解释诊断优先推荐
Expand research designCollapse research design
当文本、布局、姿态与参考主体冲突时,系统在哪一层失效,能否用局部证据定位并校准控制强度?
冻结同一个公开底座,对比纯文本、ControlNet/GLIGEN 类条件器与简单组合。
先构造 300–1000 组可程序生成的冲突/非冲突条件,人工核验一小部分。
全局语义、局部区域命中、关系/计数正确率、身份相似度、延迟与失败类型。
若错误主要来自基础模型无法生成目标概念,先收窄为单一专业域;不要把概念缺失误判为控制器失败。
候选课题 B:同预算主干与少步方法账本稳健
Expand research designCollapse research design
在固定训练/推理预算和硬件上,主干、NFE、CFG、解码器分别贡献多少质量与延迟?
选择 2–3 个公开 checkpoint,不从头训练超大模型;统一分辨率、prompt、样本数和测量脚本。
先比较 1/4/20/50 步、开启/关闭 CFG、端到端和仅主干延迟,再决定是否训练轻量蒸馏模型。
质量、文本/组合遵循、显存、吞吐、P50/P95 延迟和能耗代理。
若 checkpoint 数据与规模差异无法控制,就把结论限定为系统测量,不声称架构因果。
候选课题 C:中文或专业领域的许可数据与可靠人评应用驱动
Expand research designCollapse research design
领域术语、文字渲染、关系和文化实体的失败来自数据覆盖、文本编码还是生成器?
公开模型零样本、轻量适配和检索增强三组;数据许可与来源逐条记录。
500–3000 条高信息 prompt,包含对照、改写和困难负例;先做评测集再决定训练集。
专家正确率、可验证属性、文字 OCR、人评一致性、数据重叠与成本。
若专家标注一致性不足,先修订任务定义,不用模型分数掩盖标签歧义。
候选课题 D:统一模型与模块化系统的受控边界高风险
Expand research designCollapse research design
统一训练在哪些任务产生正迁移,在哪些任务发生干扰;轻量路由或 adapter 能否恢复?
共享底座 + 独立适配、联合训练统一模型、带路由统一模型三组。
只选 2–3 个互补任务,固定总样本与更新步数,避免“大而全”。
每任务质量、最差任务退化、参数/存储、训练算力与任务扩展成本。
若无法获得可比训练预算,退回表征/梯度冲突的小模型实验,不外推到基础模型。
推荐排序与止损条件
优先级建议为 A → B → C → D。A 最容易形成“数据集 + 诊断指标 + 方法”连续成果;B 最可复现;C 需要真实领域资源;D 的训练预算与因果控制风险最高。任何入口都先用小规模数据证明测量可靠,再扩大模型或训练量。
证据基础
- 底座与主干:sources/2026-04-14-latent-diffusion-models、sources/2026-04-15-scalable-diffusion-models-with-transformers、sources/2026-04-15-diffusion-models-without-attention。
- 个性化与控制:sources/2026-04-14-dreambooth、sources/2026-04-14-gligen、sources/2026-04-16-controlnet、sources/2026-04-14-anydoor。
- 统一生成—编辑:sources/2026-04-12-omnigen、sources/2026-04-12-dreamomni、sources/2026-04-12-unireal、sources/2026-04-12-anyedit。
- 效率:sources/2026-04-16-sana-sprint、sources/2026-04-16-on-distillation-of-guided-diffusion-models。
- 个性化、训练目标与表示效率补充:sources/2026-04-14-attention-calibration-personalization、sources/2026-04-14-conform、sources/2026-04-14-domain-expansion-image-generators、sources/2026-04-14-specialist-diffusion、sources/2026-04-14-wavelet-diffusion-models。
- 数据与评测:sources/2026-04-14-commoncanvas、sources/2026-04-14-verifiable-human-eval-t2i、sources/2026-04-14-flasheval。
开放问题
- 数据与架构怎样共同决定生成—编辑上限?
- 统一图像模型能否在长期维持优势?
- 如何在不依赖闭源评估器的情况下,稳定测量关系、计数、文字与局部控制?
- 少步模型的训练生命周期成本怎样与部署收益统一核算?
- 训练数据来源、删除请求与模型记忆怎样进入公开 benchmark?