一句话结论
CAFE 用冻结 Llama-2-13B-chat 理解模糊/明确请求,以 CLIP global embedding 控语义、DINOv2-Giant patch embedding 保主体,并训练新的 SD2 U-Net conditioning interface;测试期 2–5 秒免微调,但离线数据与训练约 1M 四元组、20,000 GPU-hours,且没有对话/解释用户研究。
问题定义
现有 personalization 要么每主体测试期 fine-tune,要么免调但身份/文本平衡有限,接口也多局限于精确 caption。CAFE 试图把单参考图定制与聊天、模糊意图理解、文字解释合并。
方法概述
- Llama-2-13B-chat 冻结,只训练图像投影与 CLIP prediction projection。
- DINOv2-Giant 提取 identity patch;CLIP ViT-L/14@336 表示目标语义。
- Stable Diffusion 2 卷积 U-Net 移除原 text encoder,新增 cross-attention 同时注入两类 embedding。
- MLLM 输出解释 token 与 semantic token;ML loss + CLIP embedding MSE,$\lambda=0.2$。
- 无测试期 tuning、DiT、LoRA 或 flow matching。
数据、成本与结果
初始 ProFusion 生成 3M 样本耗 10,000 A100 GPU-hours;自动过滤后人筛 1,500 worker-hours,仅 93K。SID 自蒸馏取消后续人筛;最终约 1M 四元组、20,000 GPU-hours,其中 355K 人像。
DreamBench:
| 方法 | DINO ↑ | CLIP-I ↑ | CLIP-T ↑ |
|---|---|---|---|
| SuTI | 0.741 | 0.819 | 0.304 |
| Kosmos-G | 0.694 | 0.847 | 0.287 |
| CAFE | 0.715 | 0.827 | 0.294 |
CAFE 有竞争力但不全面领先。人脸 7 subjects × 23 prompts × 10 图,ID/CLIP-T 0.464/0.297,高于 ProFusion 0.432/0.293。
消融与成本边界
- 自蒸馏数据 D3:ID .465/T .291;D1∪D3:.464/.297,优于仅人筛数据 .441/.288。
- MSE 优于 negative cosine;大 CLIP 主要保文本,大 DINO 主要保身份。
- 仅 CLIP:ID .216/T .297;仅 DINO:.418/.234;两者:.464/.297。
- 推理称 5 秒,跳过 MLLM 约 2 秒;未给测试 GPU、steps、显存或延迟拆分。
身份、交互与编辑边界
- DINO/CLIP/face recognition 都是 identity proxy,无严格身份保证。
- 模糊意图、解释、多轮和编辑主要是可视化;缺对话成功率、用户研究、区域保持或编辑 benchmark。
- baseline 数值多取原论文,base model 与 prompt 接口不完全同构。
- 大规模合成数据可能继承 ProFusion/自蒸馏偏差。
相关页面
- 图像生成
- 扩散模型
- DreamBooth:per-subject full fine-tuning 对照。
- Custom Diffusion:per-subject K/V tuning 对照。
归属边界
本文是 amortized single-image personalization + conversational interface;附录编辑不构成通用 image-editing,也无 DiT/unified model 证据。已移除旧 unified entity/question 与 image-editing 主标签。
证据评估
B+:离线数据/成本和身份—文本消融透明;测试成本、对话人评与编辑证据不足,比较协议也不完全统一。