一句话结论
论文把StyleGAN2潜空间中原本不起作用的dormant directions改造成独立“域轴”,让一个不增参数的生成器容纳最多105个新域,并在base subspace近似保持源FID;它依赖线性可分潜空间和per-domain训练,不是开放文本接口、DiT或统一生成编辑模型。
问题定义
普通domain adaptation把源生成器整体改成目标域,往往遗忘原域。Domain expansion要求同一生成器同时保留源域与多个新域,支持连续域强度和多域组合,而不为每域部署独立权重。
方法概述
- 对生成器第一层用SeFA/SVD得到正交潜方向;末尾低奇异值方向视为dormant。
- 为每个新域分配一个$v_i$;其余方向构成$Z_{base}$。
- 将base subspace沿$v_i$平移$s=20$得到域子空间$Z_i$。
- 把StyleGAN-NADA或MyStyle的adaptation loss只施加于投影到$Z_i$的latents。
- 只在$Z_{base}$继续原训练loss,并用冻结源生成器的pixel-L2+LPIPS replay保持源行为。
每增加一个域仍需训练一个loss与占用一个方向;“不增模型大小”不等于新增域零成本。
数据、主干与成本
- StyleGAN2主实验:FFHQ 105域(100 NADA+5 MyStyle)、AFHQ Dog 50、LSUN Church 20、SD-Elephant 20。
- MyStyle身份域每个约100张图;NADA域由源/目标文本通过CLIP监督。
- Diffusion Autoencoder只做定性泛化。
- 未披露统一GPU型号、GPU-hours、wall-clock、batch或每域成本;不能从参数共享推导训练廉价。
主干不是latent diffusion T2I或DiT;DiffAE有语义latent但验证仅定性。
结果与人评
32名用户、1440次2AFC中,expanded NADA结果获58.8%偏好,独立StyleGAN-NADA为41.2%。MyStyle对比:identity 0.76±0.05 vs 0.80±0.06略低,diversity×10 3.14±0.14 vs 3.08±0.15略高。
| 数据 | Parent FID↓ | Ours base FID↓ | 仅继续源训练↓ |
|---|---|---|---|
| FFHQ | 2.77 | 2.80 | 2.75±0.08 |
| AFHQ | 7.43 | 7.51 | 7.38±0.09 |
| LSUN Church | 3.92 | 3.76 | 3.31±0.22 |
| SD-Elephant | 2.30 | 2.70 | 3.91±0.67 |
源域是近似保持,不是严格函数等价。人评未给每域票数、置信区间或显著性。
多域与消融
1/5/50域实验显示域越多收敛越慢,但“Sketch”不会明显泄漏到“Sumo”子空间。两个已学directions相加,在10对prompts上比NADA权重插值与DiffusionCLIP activation插值更能同时保留两种效果。
无regularization的定性图出现新风格泄漏;但缺少完整定量正则消融。低奇异值不必然等于语义无效,容量上限也未实测到崩溃。
局限或疑问
- 只支持训练过的有限域轴,不是自然语言zero-shot新域。
- 假设潜空间线性、正交、平滑且有闲置容量;现代条件扩散/DiT未验证。
- 一个域一个方向,最终受潜维度和网络容量限制。
- 组合的是全局域语义,不等于对象、布局或局部图像编辑。
- MyStyle身份准确率有小幅下降;没有严格身份保持保证。
相关页面
证据评级
B+:105域、人评与源FID有力;成本缺失、DiffAE仅定性、正则消融不足及对现代扩散/DiT不可外推。