一句话结论
CosmicMan用6M高分辨率人体图、115M细粒度属性与HOLA attention对齐全量微调SD1.5/SDXL U-Net;CosmicMan-SDXL在2048图人像测试上FID 35.42、Accall 83.6领先,但它是文本驱动人物域专门化,不是指定身份personalization、DiT或统一生成编辑模型。
数据与许可边界
CosmicMan-HQ 1.0含6M人体图,平均1488×1255,70类标注问题、115M attributes,并附文本、bbox、keypoints、human parsing与质量元数据。来源包括LAION-5B、SHHQ、DeepFashion及Flickr/Unsplash/Pixabay等API。
Annotate Anyone以InstructBLIP起步,人工首轮标70问,后续只修低于85%准确率的长尾类别。论文称平均准确率56.0%→85.3%,人工量约为全人工的1%,但未披露绝对人工小时、标注人数或单位成本。
作者称数据经法律审查、人物匿名化、分步发布且仅限研究使用;这不等于完整开放商用许可,也未证明web人物同意、不可重识别或无记忆风险。
方法与主干
- CosmicMan-SD/SDXL分别基于SD1.5/SDXL latent diffusion U-Net,全量fine-tune U-Net。
- Dense caption按整体身体与服装区域离散分组,并与human parsing masks关联。
- HOLA在16× downsampling cross-attention上约束单属性响应和组平均响应与对应区域一致。
- HOLA只参与训练,不增加推理模块;2D pose编辑/3D重建是替换T2I-Adapter/Magic123底座后的下游实验。
成本
AdamW,lr 1e-5,weight decay 1e-2,batch 64;32×80GB A100训练约一周,约5,376 A100-hours(按一周近似)。另以500张极高质量图quality tuning约1000 iterations。成本未含数据抓取、32 CPU servers、VLM迭代和人工审核。
CM-SD/CM-SDXL推理约43.53/56.32 ms/f,与SD/SDXL 43.66/56.23接近。
主结果与人评
| 模型 | FID↓ | HPSv2↑ | CLIP↑ | Accall↑ |
|---|---|---|---|---|
| SD1.5 | 48.09 | 0.2659 | 30.43 | 74.6 |
| SDXL | 48.61 | 0.2647 | 30.78 | 78.1 |
| CosmicMan-SD | 36.78 | 0.2690 | 28.47 | 81.2 |
| CosmicMan-SDXL | 35.42 | 0.2698 | 27.31 | 83.6 |
CosmicMan在FID与细粒度语义准确率领先,但CLIP较低;不能概括为所有对齐指标最优。
100 prompts pairwise人评中,相对DeepFloyd-IF/SDXL/DALLE-3/MidJourney,图像质量偏好93.06/82.93/78.13/70.43%,文本对齐偏好85.38/90.25/88.56/81.68%。参与者人数、总票数、盲测与置信区间未披露。
消融
1M图使用alt-text/原始InstructBLIP/Annotate Anyone caption的FID为47.65/51.02/40.08,Accall 75.2/75.6/78.8;扩到6M为37.57/79.7。加入HOLA后36.78/81.2。主要收益来自数据与标注质量,HOLA是额外增量。
局限或疑问
- 不是参考图身份定制;无face-ID、memorization、demographic bias或deepfake安全评测。
- 只对人物域有效,不能代表开放域T2I。
- 商业模型比较的采样设置与训练数据未知,公平性有限。
- 下游编辑/3D能力来自外部管线,不是原生接口。
- 主干是U-Net,不支持DiT关联。
相关页面
证据评级
A-:数据、成本、主表、人评与消融丰富;许可/隐私、人评协议、跨API公平性和身份安全评测不足。