一句话结论
FreeU 在既有 diffusion U-Net decoder 中放大 backbone feature、频域抑制 skip feature 的低频成分,用无训练、无新增网络前向的方式改善生成;它是 U-Net inference patch,不是 DiT 或新 backbone。
问题定义
U-Net decoder 会拼接 backbone 与 encoder skip feature。论文观察到 backbone 主要承担去噪,skip 更容易带入高频细节并削弱 backbone 语义。问题是能否只在推理时重新平衡二者,避免重训、蒸馏或换主干。
方法概述
- 用样本自适应的结构相关 factor map $\alpha_l$ 放大 decoder backbone feature 的前半通道。
- 对 skip feature 做 FFT,仅将低频半径内系数乘 $s_l$,再 IFFT。
- 在 decoder 拼接前应用;宿主 U-Net 参数、sampler 与采样步数保持不变。
- 固定常数 backbone 放大容易过平滑/过饱和;结构相关缩放与 skip 频域调节共同恢复平衡。
Backbone、数据与成本
| 维度 | 全文核验 |
|---|---|
| 生成 backbone | Stable Diffusion/SDXL/ModelScope 等 U-Net;无 DiT |
| 展示管线 | SD 1.4、SDXL、DreamBooth、ReVersion、ModelScope、Rerender |
| 训练 | 0;无微调、无新增可学习参数 |
| sampling | 步数不变,无额外 U-Net forward |
| 额外算子 | feature 统计/缩放,以及 skip feature 的 FFT、mask、IFFT |
| 成本证据 | 作者声称无 memory/sampling-time 增量,但没有 latency、显存、FLOPs 表 |
因此“free”应解释成无训练、无额外模型调用、无额外 sampling step;论文没有严格证明所有硬件上 wall-clock 为零增量。
关键结果
35 人同 seed 配对偏好:
| 任务 | 指标 | 基线 | +FreeU |
|---|---|---|---|
| SD 文生图 | 图文对齐 | 14.12% | 85.88% |
| SD 文生图 | 图像质量 | 14.66% | 85.34% |
| ModelScope 文生视频 | 文本对齐 | 15.29% | 84.71% |
| ModelScope 文生视频 | 视频质量 | 14.33% | 85.67% |
论文没有报告标准自动指标、置信区间或提示词规模;这些数值是相对偏好,不是 FID/CLIPScore 的绝对提升。
消融
- backbone factor $b$ 是主要去噪增益来源,但单独使用会过平滑。
- skip factor $s$ 单独影响较小,配合 $b$ 才能改善纹理平衡。
- backbone + skip 优于只改 backbone。
- 结构相关 factor map 优于固定常数放大。
- Fourier/feature 可视化支持机制解释,但主要是相关性证据。
迁移边界与局限
- 已展示跨图像、视频、个性化与关系生成管线的兼容性。
- 仅对具有对应 U-Net decoder/skip 接口的模型直接成立;纯 DiT、无 skip Transformer、autoregressive/flow 主干不能直接套用。
- 未系统验证 ControlNet、多条件控制或跨 checkpoint 自动超参数选择。
- 主要证据是主观偏好,不能据此建立跨架构通用质量 claim。
相关页面
备注
本库将该论文作为 U-Net inference engineering 证据,不关联 DiT 主干实体或“DiT 默认化”claim。