LLLMWIKI
正文研究地图阅读入口元数据

来源笔记 · 更新于 2026-07-12

CosmicMan面向人物的文本到图像基础模型

一句话结论

CosmicMan用6M高分辨率人体图、115M细粒度属性与HOLA attention对齐全量微调SD1.5/SDXL U-Net;CosmicMan-SDXL在2048图人像测试上FID 35.42、Accall 83.6领先,但它是文本驱动人物域专门化,不是指定身份personalization、DiT或统一生成编辑模型。

数据与许可边界

CosmicMan-HQ 1.0含6M人体图,平均1488×1255,70类标注问题、115M attributes,并附文本、bbox、keypoints、human parsing与质量元数据。来源包括LAION-5B、SHHQ、DeepFashion及Flickr/Unsplash/Pixabay等API。

Annotate Anyone以InstructBLIP起步,人工首轮标70问,后续只修低于85%准确率的长尾类别。论文称平均准确率56.0%→85.3%,人工量约为全人工的1%,但未披露绝对人工小时、标注人数或单位成本。

作者称数据经法律审查、人物匿名化、分步发布且仅限研究使用;这不等于完整开放商用许可,也未证明web人物同意、不可重识别或无记忆风险。

方法与主干

  • CosmicMan-SD/SDXL分别基于SD1.5/SDXL latent diffusion U-Net,全量fine-tune U-Net。
  • Dense caption按整体身体与服装区域离散分组,并与human parsing masks关联。
  • HOLA在16× downsampling cross-attention上约束单属性响应和组平均响应与对应区域一致。
  • HOLA只参与训练,不增加推理模块;2D pose编辑/3D重建是替换T2I-Adapter/Magic123底座后的下游实验。

成本

AdamW,lr 1e-5,weight decay 1e-2,batch 64;32×80GB A100训练约一周,约5,376 A100-hours(按一周近似)。另以500张极高质量图quality tuning约1000 iterations。成本未含数据抓取、32 CPU servers、VLM迭代和人工审核。

CM-SD/CM-SDXL推理约43.53/56.32 ms/f,与SD/SDXL 43.66/56.23接近。

主结果与人评

模型FID↓HPSv2↑CLIP↑Accall↑
SD1.548.090.265930.4374.6
SDXL48.610.264730.7878.1
CosmicMan-SD36.780.269028.4781.2
CosmicMan-SDXL35.420.269827.3183.6

CosmicMan在FID与细粒度语义准确率领先,但CLIP较低;不能概括为所有对齐指标最优。

100 prompts pairwise人评中,相对DeepFloyd-IF/SDXL/DALLE-3/MidJourney,图像质量偏好93.06/82.93/78.13/70.43%,文本对齐偏好85.38/90.25/88.56/81.68%。参与者人数、总票数、盲测与置信区间未披露。

消融

1M图使用alt-text/原始InstructBLIP/Annotate Anyone caption的FID为47.65/51.02/40.08,Accall 75.2/75.6/78.8;扩到6M为37.57/79.7。加入HOLA后36.78/81.2。主要收益来自数据与标注质量,HOLA是额外增量。

局限或疑问

  • 不是参考图身份定制;无face-ID、memorization、demographic bias或deepfake安全评测。
  • 只对人物域有效,不能代表开放域T2I。
  • 商业模型比较的采样设置与训练数据未知,公平性有限。
  • 下游编辑/3D能力来自外部管线,不是原生接口。
  • 主干是U-Net,不支持DiT关联。

相关页面

证据评级

A-:数据、成本、主表、人评与消融丰富;许可/隐私、人评协议、跨API公平性和身份安全评测不足。