LLLMWIKI
正文研究地图阅读入口元数据

主题 · 更新于 2026-07-14

图像生成

研究如何把生成底座、条件控制、数据与评测接成可靠图像系统,并判断统一生成—编辑、少步部署和组合控制中仍有价值的问题。

当前判断

图像生成

研究如何把生成底座、条件控制、数据与评测接成可靠图像系统,并判断统一生成—编辑、少步部署和组合控制中仍有价值的问题。

25 来源笔记2 开放问题

阅读路径

  1. 问题明确任务与证据边界
  2. 方法比较方法族与结构选择
  3. 证据回到论文与可检索全文
  4. 开放问题记录仍待验证的张力

研究方法族地图

从问题定义走向可复核的系统能力

25 来源笔记
1问题明确任务与证据边界
2方法比较方法族与结构选择
3证据回到论文与可检索全文
4开放问题记录仍待验证的张力

三分钟摘要

  • 任务已经从“给文字出图”扩展为系统问题。 现代图像生成同时受表示空间、去噪主干、条件接口、训练数据、推理预算和评测协议约束。
  • 成熟底座不等于完整答案。 LDMDiT 已把潜空间和可扩展主干做成平台,但精确布局、多个条件冲突、文字与细节、数据许可、真实延迟和可靠人评仍未被一个指标解决。
  • 统一生成—编辑正在形成,但证据多为系统覆盖而非严格胜出。 OmniGenDreamOmniUniReal 说明共享接口和联合训练可行;它们没有完成同数据、同参数、同算力下对全部专用模型的受控替代实验。
  • 适合研究生的机会更偏“可证伪的系统问题”。 例如组合控制失效、同预算质量—延迟比较、中文或专业领域数据、统一与模块化的受控比较,而不是只换一个更大的主干。

任务或系统流程

一个现代图像生成系统中,哪些环节分别决定语义、构图、细节和成本?

文本或视觉条件怎样变成一张可验收图像

条件编码决定模型能“听懂”什么,生成主干决定怎样形成视觉样本,解码器决定可恢复的细节上限,评测层决定我们是否真的知道系统变好了。

  1. 用户条件文本、参考图、主体、边缘、深度、姿态或布局
  2. 条件表示与路由文本编码、视觉 token、交叉注意力或专用控制分支
  3. 生成主干在像素或潜空间中用扩散、流或自回归过程形成样本
  4. 解码与后处理从潜变量恢复分辨率、纹理、文字与局部细节
  5. 联合验收同时检查感知质量、条件一致、空间控制、多样性、延迟和失败模式
图示依据LDMControlNet可验证人评

用户条件先编码为语义与空间约束,再进入迭代或少步生成主干,潜变量被解码为图像,最后用质量、对齐、控制与成本联合验收。

阅读论文时先标注每项工作改的是哪一环。只报告生成主干 FID 的论文,不能自动支持控制、数据合规或端到端延迟结论。

当前综合判断

图像生成已经进入“成熟底座上的系统竞争”。潜空间扩散 降低高分辨率计算,DiT 提供可扩展 Transformer 去噪器,GLIGENControlNet 把开放集合与空间条件接入预训练底座。继续证明“扩散能生成图像”或“Transformer 能做去噪”的边际价值已经很低。

真正仍在变化的是四个接口:

  1. 任务接口:生成、编辑、参考图与多条件是否由同一模型处理;
  2. 控制接口:全局文本、主体身份、局部布局和像素级结构怎样组合并处理冲突;
  3. 成本接口:训练预算、网络函数求值、单步主干成本、CFG、解码器与硬件如何共同形成真实延迟;
  4. 证据接口:自动指标、人类偏好、空间遵循、文字细节、安全和数据来源怎样形成可复核结论。

因此本页不把“统一”或“一步生成”写成已完成趋势。当前更可靠的说法是:统一模型是重要平台路线,模块化条件器仍有明确价值;少步模型已能在特定配置达到亚秒级,但训练成本、质量退化和迁移范围必须单独核算。

近五年演化(2022—2026)

近五年图像生成的研究重心怎样移动?

从生成底座到统一系统与可靠验收

时间线强调问题变化而非穷举模型。2026 表示截至本库复核时间的综合状态,不暗示每个节点都有同年论文。

  1. 2022 · 可扩展底座LDM 把高分辨率扩散搬入压缩潜空间
  2. 2023 · 主干与控制DiT、DreamBooth、GLIGEN、ControlNet 分别推进扩展、个性化与空间接口
  3. 2024 · 数据与评测开放许可数据、快速评测和可验证人评开始补齐系统证据
  4. 2025 · 统一与少步统一生成—编辑接口、动态主干和一步/少步部署并行推进
  5. 2026 · 受控系统比较研究价值转向同预算、跨域、失败模式和统一—模块化边界的可复现实验
图示依据LDMDreamBoothDiTOmniGenSANA-Sprint

2022 年潜空间扩散建立底座;2023 年主干、个性化与空间控制成形;2024 年开放数据和评测加强;2025 年统一生成编辑与少步系统发展;2026 年关注受控比较与可靠部署。

这条演化不等于旧方法被线性淘汰。DreamBooth 显示高保真个性化仍可能需要逐主体适配;DiffuSSM 则构成“注意力是唯一可扩展主干”的反证。平台越统一,越需要说明哪些能力来自共享先验、哪些仍来自专用数据与模块。

方法家族与成熟阶段

常被放在同一排行榜的方法,实际分别解决什么?

图像生成的六类方法对应六种不同问题

底座、主干、个性化、空间控制、统一接口和部署优化并非可互换路线。比较前必须先对齐任务、数据、预算与输出约束。

  1. 表示与基础生成像素或潜空间决定细节上限和计算尺度
  2. 主干与扩展U-Net、DiT、SSM 或混合网络决定单步表示与硬件特性
  3. 个性化与主体保持少样本适配、视觉提示或检索增强解决特定主体一致性
  4. 空间与组合控制box、mask、pose、depth、layout 和多条件冲突需要显式接口
  5. 统一生成—编辑共享模型与任务路由减少工作流割裂,但可能发生任务干扰
  6. 效率与部署蒸馏、求解器、缓存、量化和解码器共同形成端到端成本
图示依据LDMDreamBoothControlNetOmniGenSANA-Sprint

方法地图列出潜空间底座、可扩展主干、个性化、空间控制、统一生成编辑、效率与部署六个分支。

方法家族的成熟度

当前阶段成熟底座

潜空间扩散与基础生成

证据锚点

LDM 已用固定预算比较像素与多个压缩率;现代系统广泛复用这层表示,但精细文字和几何仍受解码上限影响。

研究机会

价值不在重复证明潜空间更省,而在可测量地改进压缩—细节—延迟取舍。

当前阶段系统优化期

可扩展去噪主干

证据锚点

DiT 证明计算规模与 FID 强相关;DiffuSSM 说明注意力并非唯一扩展路径。

研究机会

同 FLOPs、显存和真实硬件下比较混合主干,避免只以参数量或单数据集 FID 排名。

当前阶段活跃发展期

个性化与主体驱动生成

证据锚点

DreamBooth 建立少样本主体适配基线,AnyDoorCosmicMan 扩展对象与人物专门能力。

研究机会

身份保持、组合多个主体、版权/记忆审计和低存储适配仍可形成明确问题。

当前阶段活跃发展期

空间与多条件控制

证据锚点

GLIGENControlNet 证明专用接口有效,但复杂冲突条件、多模态组合和跨主干迁移证据不足。

研究机会

建立冲突条件诊断集、控制强度校准与局部证据指标,比再加一个条件器更有辨识度。

当前阶段早期整合期

统一生成—编辑系统

证据锚点

OmniGenDreamOmniUniReal 证明共享接口与联合训练可行,但统一模型与强专用系统缺少同预算全任务对照。

研究机会

测量任务干扰、路由、数据混合和模块化补偿,回答“统一到哪一层最划算”。

当前阶段评测建设期

少步生成、数据与可靠评测

证据锚点

SANA-Sprint 展示特定硬件上的一步端到端延迟;CommonCanvas可验证人评 分别暴露数据来源和评测协议的重要性。

研究机会

把训练预算、真实延迟、偏好、组合遵循和数据许可放进同一可复现实验账本。

哪些方向拥挤,哪些方向仍值得做

成熟度描述的是“证据与基础设施到了哪里”,不是给方向贴好坏标签。底座成熟后,研究需要更窄、更可证伪的问题定义。

拥挤方向与研究机会

相对拥挤、需要更强差异化的方向:

  • 只在通用文本到图像上替换主干,并只报告单个 FID/CLIP 指标;
  • 只把采样步数从若干步减到更少,却不报告单步成本、训练预算、CFG 与端到端延迟;
  • 新增一个条件注入模块,但没有冲突条件、跨域或强基线消融;
  • 用若干漂亮样例宣称统一模型已替代专用系统。

仍有清晰研究价值的方向:

  • 可靠组合控制:关系、计数、文字、多个主体与空间条件同时出现时,定位失败发生在编码、路由、去噪还是评测层;
  • 同预算生成系统比较:固定数据、参数/训练算力、分辨率、NFE 与硬件,比较 U-Net、DiT、SSM、蒸馏和求解器;
  • 中文与专业领域生成:建立许可清楚、术语准确、含困难负例的数据和人评协议,而不只是翻译英文 prompt;
  • 统一—模块化边界:量化联合训练的迁移收益与任务干扰,寻找“共享底座 + 专用轻模块”的最小系统;
  • 评测可靠性:自动指标、人评、数据重叠、记忆和安全失败共同进入版本化评测。

反方证据、局限与可证伪条件

  • 反方 1:主干并未收敛为唯一答案。 DiffuSSM 在受限设置中以更低训练计算接近 DiT;若后续同预算跨任务结果持续成立,“标准注意力 DiT 是唯一可扩展主干”应被否定。
  • 反方 2:统一覆盖不等于全面优越。 DreamBooth、GLIGEN 与 ControlNet 都显示专用适配仍能提供统一文本接口缺失的能力。若同数据、同规模评测中统一模型在多个关键任务持续落后,强“统一替代”结论应撤回。
  • 反方 3:少步不自动等于低成本。 SANA-Sprint 的推理很快,但依赖大规模蒸馏训练;若完整生命周期成本或质量—多样性下降抵消收益,就只能称部署优化而非全面效率胜出。
  • 反方 4:单一自动指标可能反向排序。 可验证人评 发现 FID/CLIPScore 与人类判断可能冲突。任何“全面更好”结论都应至少覆盖质量、条件遵循、多样性和成本。
  • 共同局限:训练数据许可、记忆、偏差、深度伪造、文字/手部/细几何失败及模型更新后的不可复现性,不能由更低 FID 自动消除。

研究生可行的研究入口

候选课题 A:多条件冲突的可解释诊断优先推荐

展开研究设计收起研究设计
研究问题

当文本、布局、姿态与参考主体冲突时,系统在哪一层失效,能否用局部证据定位并校准控制强度?

最小基线

冻结同一个公开底座,对比纯文本、ControlNet/GLIGEN 类条件器与简单组合。

最小数据

先构造 300–1000 组可程序生成的冲突/非冲突条件,人工核验一小部分。

指标

全局语义、局部区域命中、关系/计数正确率、身份相似度、延迟与失败类型。

止损条件

若错误主要来自基础模型无法生成目标概念,先收窄为单一专业域;不要把概念缺失误判为控制器失败。

候选课题 B:同预算主干与少步方法账本稳健

展开研究设计收起研究设计
研究问题

在固定训练/推理预算和硬件上,主干、NFE、CFG、解码器分别贡献多少质量与延迟?

最小基线

选择 2–3 个公开 checkpoint,不从头训练超大模型;统一分辨率、prompt、样本数和测量脚本。

最小实验

先比较 1/4/20/50 步、开启/关闭 CFG、端到端和仅主干延迟,再决定是否训练轻量蒸馏模型。

指标

质量、文本/组合遵循、显存、吞吐、P50/P95 延迟和能耗代理。

止损条件

若 checkpoint 数据与规模差异无法控制,就把结论限定为系统测量,不声称架构因果。

候选课题 C:中文或专业领域的许可数据与可靠人评应用驱动

展开研究设计收起研究设计
研究问题

领域术语、文字渲染、关系和文化实体的失败来自数据覆盖、文本编码还是生成器?

最小基线

公开模型零样本、轻量适配和检索增强三组;数据许可与来源逐条记录。

最小数据

500–3000 条高信息 prompt,包含对照、改写和困难负例;先做评测集再决定训练集。

指标

专家正确率、可验证属性、文字 OCR、人评一致性、数据重叠与成本。

止损条件

若专家标注一致性不足,先修订任务定义,不用模型分数掩盖标签歧义。

候选课题 D:统一模型与模块化系统的受控边界高风险

展开研究设计收起研究设计
研究问题

统一训练在哪些任务产生正迁移,在哪些任务发生干扰;轻量路由或 adapter 能否恢复?

最小基线

共享底座 + 独立适配、联合训练统一模型、带路由统一模型三组。

最小数据

只选 2–3 个互补任务,固定总样本与更新步数,避免“大而全”。

指标

每任务质量、最差任务退化、参数/存储、训练算力与任务扩展成本。

止损条件

若无法获得可比训练预算,退回表征/梯度冲突的小模型实验,不外推到基础模型。

推荐排序与止损条件

优先级建议为 A → B → C → D。A 最容易形成“数据集 + 诊断指标 + 方法”连续成果;B 最可复现;C 需要真实领域资源;D 的训练预算与因果控制风险最高。任何入口都先用小规模数据证明测量可靠,再扩大模型或训练量。

证据基础

开放问题

相关页面