LLLMWIKI
ArticleResearch mapReading portalMetadata

Topic · Updated 2026-07-14

Image Generation

研究如何把生成底座、条件控制、数据与评测接成可靠图像系统,并判断统一生成—编辑、少步部署和组合控制中仍有价值的问题。

Current view

Image Generation

研究如何把生成底座、条件控制、数据与评测接成可靠图像系统,并判断统一生成—编辑、少步部署和组合控制中仍有价值的问题。

25 Source notes2 Open questions

Reading path

  1. ProblemDefine task and evidence boundary
  2. MethodsCompare families and design choices
  3. EvidenceReturn to papers and searchable text
  4. Open questionsTrack unresolved tensions

Method family map

From problem definition to verifiable system capability

25 Source notes
1ProblemDefine task and evidence boundary
2MethodsCompare families and design choices
3EvidenceReturn to papers and searchable text
4Open questionsTrack unresolved tensions

三分钟摘要

  • 任务已经从“给文字出图”扩展为系统问题。 现代图像生成同时受表示空间、去噪主干、条件接口、训练数据、推理预算和评测协议约束。
  • 成熟底座不等于完整答案。 LDMDiT 已把潜空间和可扩展主干做成平台,但精确布局、多个条件冲突、文字与细节、数据许可、真实延迟和可靠人评仍未被一个指标解决。
  • 统一生成—编辑正在形成,但证据多为系统覆盖而非严格胜出。 OmniGenDreamOmniUniReal 说明共享接口和联合训练可行;它们没有完成同数据、同参数、同算力下对全部专用模型的受控替代实验。
  • 适合研究生的机会更偏“可证伪的系统问题”。 例如组合控制失效、同预算质量—延迟比较、中文或专业领域数据、统一与模块化的受控比较,而不是只换一个更大的主干。

任务或系统流程

一个现代图像生成系统中,哪些环节分别决定语义、构图、细节和成本?

文本或视觉条件怎样变成一张可验收图像

条件编码决定模型能“听懂”什么,生成主干决定怎样形成视觉样本,解码器决定可恢复的细节上限,评测层决定我们是否真的知道系统变好了。

  1. 用户条件文本、参考图、主体、边缘、深度、姿态或布局
  2. 条件表示与路由文本编码、视觉 token、交叉注意力或专用控制分支
  3. 生成主干在像素或潜空间中用扩散、流或自回归过程形成样本
  4. 解码与后处理从潜变量恢复分辨率、纹理、文字与局部细节
  5. 联合验收同时检查感知质量、条件一致、空间控制、多样性、延迟和失败模式
Diagram evidenceLDMControlNet可验证人评

用户条件先编码为语义与空间约束,再进入迭代或少步生成主干,潜变量被解码为图像,最后用质量、对齐、控制与成本联合验收。

阅读论文时先标注每项工作改的是哪一环。只报告生成主干 FID 的论文,不能自动支持控制、数据合规或端到端延迟结论。

当前综合判断

图像生成已经进入“成熟底座上的系统竞争”。潜空间扩散 降低高分辨率计算,DiT 提供可扩展 Transformer 去噪器,GLIGENControlNet 把开放集合与空间条件接入预训练底座。继续证明“扩散能生成图像”或“Transformer 能做去噪”的边际价值已经很低。

真正仍在变化的是四个接口:

  1. 任务接口:生成、编辑、参考图与多条件是否由同一模型处理;
  2. 控制接口:全局文本、主体身份、局部布局和像素级结构怎样组合并处理冲突;
  3. 成本接口:训练预算、网络函数求值、单步主干成本、CFG、解码器与硬件如何共同形成真实延迟;
  4. 证据接口:自动指标、人类偏好、空间遵循、文字细节、安全和数据来源怎样形成可复核结论。

因此本页不把“统一”或“一步生成”写成已完成趋势。当前更可靠的说法是:统一模型是重要平台路线,模块化条件器仍有明确价值;少步模型已能在特定配置达到亚秒级,但训练成本、质量退化和迁移范围必须单独核算。

近五年演化(2022—2026)

近五年图像生成的研究重心怎样移动?

从生成底座到统一系统与可靠验收

时间线强调问题变化而非穷举模型。2026 表示截至本库复核时间的综合状态,不暗示每个节点都有同年论文。

  1. 2022 · 可扩展底座LDM 把高分辨率扩散搬入压缩潜空间
  2. 2023 · 主干与控制DiT、DreamBooth、GLIGEN、ControlNet 分别推进扩展、个性化与空间接口
  3. 2024 · 数据与评测开放许可数据、快速评测和可验证人评开始补齐系统证据
  4. 2025 · 统一与少步统一生成—编辑接口、动态主干和一步/少步部署并行推进
  5. 2026 · 受控系统比较研究价值转向同预算、跨域、失败模式和统一—模块化边界的可复现实验
Diagram evidenceLDMDreamBoothDiTOmniGenSANA-Sprint

2022 年潜空间扩散建立底座;2023 年主干、个性化与空间控制成形;2024 年开放数据和评测加强;2025 年统一生成编辑与少步系统发展;2026 年关注受控比较与可靠部署。

这条演化不等于旧方法被线性淘汰。DreamBooth 显示高保真个性化仍可能需要逐主体适配;DiffuSSM 则构成“注意力是唯一可扩展主干”的反证。平台越统一,越需要说明哪些能力来自共享先验、哪些仍来自专用数据与模块。

方法家族与成熟阶段

常被放在同一排行榜的方法,实际分别解决什么?

图像生成的六类方法对应六种不同问题

底座、主干、个性化、空间控制、统一接口和部署优化并非可互换路线。比较前必须先对齐任务、数据、预算与输出约束。

  1. 表示与基础生成像素或潜空间决定细节上限和计算尺度
  2. 主干与扩展U-Net、DiT、SSM 或混合网络决定单步表示与硬件特性
  3. 个性化与主体保持少样本适配、视觉提示或检索增强解决特定主体一致性
  4. 空间与组合控制box、mask、pose、depth、layout 和多条件冲突需要显式接口
  5. 统一生成—编辑共享模型与任务路由减少工作流割裂,但可能发生任务干扰
  6. 效率与部署蒸馏、求解器、缓存、量化和解码器共同形成端到端成本
Diagram evidenceLDMDreamBoothControlNetOmniGenSANA-Sprint

方法地图列出潜空间底座、可扩展主干、个性化、空间控制、统一生成编辑、效率与部署六个分支。

方法家族的成熟度

Current stage成熟底座

潜空间扩散与基础生成

Evidence anchors

LDM 已用固定预算比较像素与多个压缩率;现代系统广泛复用这层表示,但精细文字和几何仍受解码上限影响。

Research opportunity

价值不在重复证明潜空间更省,而在可测量地改进压缩—细节—延迟取舍。

Current stage系统优化期

可扩展去噪主干

Evidence anchors

DiT 证明计算规模与 FID 强相关;DiffuSSM 说明注意力并非唯一扩展路径。

Research opportunity

同 FLOPs、显存和真实硬件下比较混合主干,避免只以参数量或单数据集 FID 排名。

Current stage活跃发展期

个性化与主体驱动生成

Evidence anchors

DreamBooth 建立少样本主体适配基线,AnyDoorCosmicMan 扩展对象与人物专门能力。

Research opportunity

身份保持、组合多个主体、版权/记忆审计和低存储适配仍可形成明确问题。

Current stage活跃发展期

空间与多条件控制

Evidence anchors

GLIGENControlNet 证明专用接口有效,但复杂冲突条件、多模态组合和跨主干迁移证据不足。

Research opportunity

建立冲突条件诊断集、控制强度校准与局部证据指标,比再加一个条件器更有辨识度。

Current stage早期整合期

统一生成—编辑系统

Evidence anchors

OmniGenDreamOmniUniReal 证明共享接口与联合训练可行,但统一模型与强专用系统缺少同预算全任务对照。

Research opportunity

测量任务干扰、路由、数据混合和模块化补偿,回答“统一到哪一层最划算”。

Current stage评测建设期

少步生成、数据与可靠评测

Evidence anchors

SANA-Sprint 展示特定硬件上的一步端到端延迟;CommonCanvas可验证人评 分别暴露数据来源和评测协议的重要性。

Research opportunity

把训练预算、真实延迟、偏好、组合遵循和数据许可放进同一可复现实验账本。

哪些方向拥挤,哪些方向仍值得做

成熟度描述的是“证据与基础设施到了哪里”,不是给方向贴好坏标签。底座成熟后,研究需要更窄、更可证伪的问题定义。

拥挤方向与研究机会

相对拥挤、需要更强差异化的方向:

  • 只在通用文本到图像上替换主干,并只报告单个 FID/CLIP 指标;
  • 只把采样步数从若干步减到更少,却不报告单步成本、训练预算、CFG 与端到端延迟;
  • 新增一个条件注入模块,但没有冲突条件、跨域或强基线消融;
  • 用若干漂亮样例宣称统一模型已替代专用系统。

仍有清晰研究价值的方向:

  • 可靠组合控制:关系、计数、文字、多个主体与空间条件同时出现时,定位失败发生在编码、路由、去噪还是评测层;
  • 同预算生成系统比较:固定数据、参数/训练算力、分辨率、NFE 与硬件,比较 U-Net、DiT、SSM、蒸馏和求解器;
  • 中文与专业领域生成:建立许可清楚、术语准确、含困难负例的数据和人评协议,而不只是翻译英文 prompt;
  • 统一—模块化边界:量化联合训练的迁移收益与任务干扰,寻找“共享底座 + 专用轻模块”的最小系统;
  • 评测可靠性:自动指标、人评、数据重叠、记忆和安全失败共同进入版本化评测。

反方证据、局限与可证伪条件

  • 反方 1:主干并未收敛为唯一答案。 DiffuSSM 在受限设置中以更低训练计算接近 DiT;若后续同预算跨任务结果持续成立,“标准注意力 DiT 是唯一可扩展主干”应被否定。
  • 反方 2:统一覆盖不等于全面优越。 DreamBooth、GLIGEN 与 ControlNet 都显示专用适配仍能提供统一文本接口缺失的能力。若同数据、同规模评测中统一模型在多个关键任务持续落后,强“统一替代”结论应撤回。
  • 反方 3:少步不自动等于低成本。 SANA-Sprint 的推理很快,但依赖大规模蒸馏训练;若完整生命周期成本或质量—多样性下降抵消收益,就只能称部署优化而非全面效率胜出。
  • 反方 4:单一自动指标可能反向排序。 可验证人评 发现 FID/CLIPScore 与人类判断可能冲突。任何“全面更好”结论都应至少覆盖质量、条件遵循、多样性和成本。
  • 共同局限:训练数据许可、记忆、偏差、深度伪造、文字/手部/细几何失败及模型更新后的不可复现性,不能由更低 FID 自动消除。

研究生可行的研究入口

候选课题 A:多条件冲突的可解释诊断优先推荐

Expand research designCollapse research design
研究问题

当文本、布局、姿态与参考主体冲突时,系统在哪一层失效,能否用局部证据定位并校准控制强度?

最小基线

冻结同一个公开底座,对比纯文本、ControlNet/GLIGEN 类条件器与简单组合。

最小数据

先构造 300–1000 组可程序生成的冲突/非冲突条件,人工核验一小部分。

指标

全局语义、局部区域命中、关系/计数正确率、身份相似度、延迟与失败类型。

止损条件

若错误主要来自基础模型无法生成目标概念,先收窄为单一专业域;不要把概念缺失误判为控制器失败。

候选课题 B:同预算主干与少步方法账本稳健

Expand research designCollapse research design
研究问题

在固定训练/推理预算和硬件上,主干、NFE、CFG、解码器分别贡献多少质量与延迟?

最小基线

选择 2–3 个公开 checkpoint,不从头训练超大模型;统一分辨率、prompt、样本数和测量脚本。

最小实验

先比较 1/4/20/50 步、开启/关闭 CFG、端到端和仅主干延迟,再决定是否训练轻量蒸馏模型。

指标

质量、文本/组合遵循、显存、吞吐、P50/P95 延迟和能耗代理。

止损条件

若 checkpoint 数据与规模差异无法控制,就把结论限定为系统测量,不声称架构因果。

候选课题 C:中文或专业领域的许可数据与可靠人评应用驱动

Expand research designCollapse research design
研究问题

领域术语、文字渲染、关系和文化实体的失败来自数据覆盖、文本编码还是生成器?

最小基线

公开模型零样本、轻量适配和检索增强三组;数据许可与来源逐条记录。

最小数据

500–3000 条高信息 prompt,包含对照、改写和困难负例;先做评测集再决定训练集。

指标

专家正确率、可验证属性、文字 OCR、人评一致性、数据重叠与成本。

止损条件

若专家标注一致性不足,先修订任务定义,不用模型分数掩盖标签歧义。

候选课题 D:统一模型与模块化系统的受控边界高风险

Expand research designCollapse research design
研究问题

统一训练在哪些任务产生正迁移,在哪些任务发生干扰;轻量路由或 adapter 能否恢复?

最小基线

共享底座 + 独立适配、联合训练统一模型、带路由统一模型三组。

最小数据

只选 2–3 个互补任务,固定总样本与更新步数,避免“大而全”。

指标

每任务质量、最差任务退化、参数/存储、训练算力与任务扩展成本。

止损条件

若无法获得可比训练预算,退回表征/梯度冲突的小模型实验,不外推到基础模型。

推荐排序与止损条件

优先级建议为 A → B → C → D。A 最容易形成“数据集 + 诊断指标 + 方法”连续成果;B 最可复现;C 需要真实领域资源;D 的训练预算与因果控制风险最高。任何入口都先用小规模数据证明测量可靠,再扩大模型或训练量。

证据基础

开放问题

相关页面