LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Domain Expansion of Image Generators图像生成器的领域扩展

一句话结论

论文把StyleGAN2潜空间中原本不起作用的dormant directions改造成独立“域轴”,让一个不增参数的生成器容纳最多105个新域,并在base subspace近似保持源FID;它依赖线性可分潜空间和per-domain训练,不是开放文本接口、DiT或统一生成编辑模型。

问题定义

普通domain adaptation把源生成器整体改成目标域,往往遗忘原域。Domain expansion要求同一生成器同时保留源域与多个新域,支持连续域强度和多域组合,而不为每域部署独立权重。

方法概述

  1. 对生成器第一层用SeFA/SVD得到正交潜方向;末尾低奇异值方向视为dormant。
  2. 为每个新域分配一个$v_i$;其余方向构成$Z_{base}$。
  3. 将base subspace沿$v_i$平移$s=20$得到域子空间$Z_i$。
  4. 把StyleGAN-NADA或MyStyle的adaptation loss只施加于投影到$Z_i$的latents。
  5. 只在$Z_{base}$继续原训练loss,并用冻结源生成器的pixel-L2+LPIPS replay保持源行为。

每增加一个域仍需训练一个loss与占用一个方向;“不增模型大小”不等于新增域零成本。

数据、主干与成本

  • StyleGAN2主实验:FFHQ 105域(100 NADA+5 MyStyle)、AFHQ Dog 50、LSUN Church 20、SD-Elephant 20。
  • MyStyle身份域每个约100张图;NADA域由源/目标文本通过CLIP监督。
  • Diffusion Autoencoder只做定性泛化。
  • 未披露统一GPU型号、GPU-hours、wall-clock、batch或每域成本;不能从参数共享推导训练廉价。

主干不是latent diffusion T2I或DiT;DiffAE有语义latent但验证仅定性。

结果与人评

32名用户、1440次2AFC中,expanded NADA结果获58.8%偏好,独立StyleGAN-NADA为41.2%。MyStyle对比:identity 0.76±0.05 vs 0.80±0.06略低,diversity×10 3.14±0.14 vs 3.08±0.15略高。

数据Parent FID↓Ours base FID↓仅继续源训练↓
FFHQ2.772.802.75±0.08
AFHQ7.437.517.38±0.09
LSUN Church3.923.763.31±0.22
SD-Elephant2.302.703.91±0.67

源域是近似保持,不是严格函数等价。人评未给每域票数、置信区间或显著性。

多域与消融

1/5/50域实验显示域越多收敛越慢,但“Sketch”不会明显泄漏到“Sumo”子空间。两个已学directions相加,在10对prompts上比NADA权重插值与DiffusionCLIP activation插值更能同时保留两种效果。

无regularization的定性图出现新风格泄漏;但缺少完整定量正则消融。低奇异值不必然等于语义无效,容量上限也未实测到崩溃。

局限或疑问

  • 只支持训练过的有限域轴,不是自然语言zero-shot新域。
  • 假设潜空间线性、正交、平滑且有闲置容量;现代条件扩散/DiT未验证。
  • 一个域一个方向,最终受潜维度和网络容量限制。
  • 组合的是全局域语义,不等于对象、布局或局部图像编辑。
  • MyStyle身份准确率有小幅下降;没有严格身份保持保证。

相关页面

证据评级

B+:105域、人评与源FID有力;成本缺失、DiffAE仅定性、正则消融不足及对现代扩散/DiT不可外推。