LLLMWIKI
ArticleResearch mapReading portalMetadata

Source note · Updated 2026-07-12

Customization Assistant可对话的单图免微调个性化生成

一句话结论

CAFE 用冻结 Llama-2-13B-chat 理解模糊/明确请求,以 CLIP global embedding 控语义、DINOv2-Giant patch embedding 保主体,并训练新的 SD2 U-Net conditioning interface;测试期 2–5 秒免微调,但离线数据与训练约 1M 四元组、20,000 GPU-hours,且没有对话/解释用户研究。

问题定义

现有 personalization 要么每主体测试期 fine-tune,要么免调但身份/文本平衡有限,接口也多局限于精确 caption。CAFE 试图把单参考图定制与聊天、模糊意图理解、文字解释合并。

方法概述

  • Llama-2-13B-chat 冻结,只训练图像投影与 CLIP prediction projection。
  • DINOv2-Giant 提取 identity patch;CLIP ViT-L/14@336 表示目标语义。
  • Stable Diffusion 2 卷积 U-Net 移除原 text encoder,新增 cross-attention 同时注入两类 embedding。
  • MLLM 输出解释 token 与 semantic token;ML loss + CLIP embedding MSE,$\lambda=0.2$。
  • 无测试期 tuning、DiT、LoRA 或 flow matching。

数据、成本与结果

初始 ProFusion 生成 3M 样本耗 10,000 A100 GPU-hours;自动过滤后人筛 1,500 worker-hours,仅 93K。SID 自蒸馏取消后续人筛;最终约 1M 四元组、20,000 GPU-hours,其中 355K 人像。

DreamBench:

方法DINO ↑CLIP-I ↑CLIP-T ↑
SuTI0.7410.8190.304
Kosmos-G0.6940.8470.287
CAFE0.7150.8270.294

CAFE 有竞争力但不全面领先。人脸 7 subjects × 23 prompts × 10 图,ID/CLIP-T 0.464/0.297,高于 ProFusion 0.432/0.293。

消融与成本边界

  • 自蒸馏数据 D3:ID .465/T .291;D1∪D3:.464/.297,优于仅人筛数据 .441/.288。
  • MSE 优于 negative cosine;大 CLIP 主要保文本,大 DINO 主要保身份。
  • 仅 CLIP:ID .216/T .297;仅 DINO:.418/.234;两者:.464/.297。
  • 推理称 5 秒,跳过 MLLM 约 2 秒;未给测试 GPU、steps、显存或延迟拆分。

身份、交互与编辑边界

  • DINO/CLIP/face recognition 都是 identity proxy,无严格身份保证。
  • 模糊意图、解释、多轮和编辑主要是可视化;缺对话成功率、用户研究、区域保持或编辑 benchmark。
  • baseline 数值多取原论文,base model 与 prompt 接口不完全同构。
  • 大规模合成数据可能继承 ProFusion/自蒸馏偏差。

相关页面

归属边界

本文是 amortized single-image personalization + conversational interface;附录编辑不构成通用 image-editing,也无 DiT/unified model 证据。已移除旧 unified entity/question 与 image-editing 主标签。

证据评估

B+:离线数据/成本和身份—文本消融透明;测试成本、对话人评与编辑证据不足,比较协议也不完全统一。