证据矩阵 · 更新于 2026-07-16
图文检索(Image-Text Retrieval)40 篇证据矩阵
逐篇记录 40 篇核心论文的版本状态、任务、方法、评测、研究问题贡献与局限。
矩阵状态
- 对应 Topic:topics/image-text-retrieval
- 对应协议:docs/research-protocols/image-text-retrieval
- 审计日期:2026-07-16
- 语料性质:corpus-first 核心基线,不是冻结协议执行后的系统检索全集
- 完整性:40/40
reviewed;40/40 有本地 PDF、可检索全文、links.yaml 和独立 analysis.md
- 发表结构:36/40 正式主会或期刊(90%);1/40 workshop(2.5%);3/40 预印本(7.5%);二级来源 0/40
- 版本复核:2026-07-16 通过 ECCV、ICLR、NeurIPS Proceedings 与 CVF Open Access,将 UniIR、VLM2Vec、Multilingual Diversity、No Zero-Shot、MIEB 从旧预印本状态更新为正式版本
状态缩写:F = 正式主会/期刊,W = workshop,P = 预印本。RQ1 = 架构与成本,RQ2 = 评测可靠性,RQ3 = 任务扩展与泛化,RQ4 = 中等算力研究可行性。
A. 底座、训练目标与数据
| # | 来源与状态 | 任务 / 方法 | 关键数据或评测 | 对综述的证据贡献 | 主要局限或风险 |
|---|
| 1 | CLIP · F · 2021 | 大规模双编码器、图文对比学习 | 4 亿网页图文对;零样本分类与图文检索 | 奠定可离线索引的共享向量底座;支持 RQ1 | 全局相似度不保证细粒度关系;数据偏差与重叠难审计 |
| 2 | ALIGN · F · 2021 | 噪声监督双编码器扩展 | 十亿级图文对;Flickr30K、MS COCO | 证明简单双塔在大规模噪声数据上可扩展;支持 RQ1 | 规模、数据与方法贡献难完全分离;细粒度关系不是目标 |
| 3 | FILIP · F · 2022 | patch—token 后期交互 | Flickr30K、MS COCO 等 | 给出双塔与跨编码器之间的细粒度折中;支持 RQ1/RQ4 | 多向量匹配增加索引和查询成本,max 匹配可能走捷径 |
| 4 | ALBEF · F · 2021 | 先对齐再融合、动量蒸馏 | 图文检索及视觉语言任务 | 支持“召回 + 精排”的混合系统;支持 RQ1 | 跨编码器不适合全库逐项计算;训练目标与数据处理耦合 |
| 5 | BLIP · F · 2022 | 对比、匹配、生成多任务;caption 自举过滤 | COCO/Flickr30K 等视觉语言任务 | 说明数据过滤与多任务目标共同影响检索;支持 RQ1/RQ3 | 难把检索收益单独归因于某个模块或数据步骤 |
| 6 | CoCa · F · 2022 | 对比表示 + caption decoder | 图文检索、分类和生成任务 | 证明检索表示可与生成目标共享模型;支持 RQ1/RQ3 | 训练规模大;统一目标不等于每项任务都最优 |
| 7 | SigLIP · F · 2023 | pairwise sigmoid 图文损失 | 多规模图文预训练与下游检索 | 提供更易分布式扩展的训练配方;支持 RQ1/RQ4 | 未直接解决组合性、污染和跨域可靠性 |
| 8 | LAION-5B · F · 2022 | 开放大规模图文数据 | 58.5 亿图文对及语言子集 | 把数据规模、开放复现和过滤风险纳入研究变量;支持 RQ2/RQ3 | 链接失效、许可、安全和 CLIP 过滤循环偏差 |
| 9 | DataComp · F · 2023 | 固定模型/预算下比较数据策略 | 128 亿候选池、38 项下游评测 | 使过滤、去重、配比可在受控预算下比较;支持 RQ2/RQ4 | 固定训练框架限制外推;候选池本身仍有网页数据偏差 |
B. 组合性、负例与评测可靠性
| # | 来源与状态 | 任务 / 方法 | 关键数据或评测 | 对综述的证据贡献 | 主要局限或风险 |
|---|
| 10 | ARO · F · 2023 | 属性、关系、词序组合性诊断 | ARO 诊断集 | 反证“标准 Recall 高等于组合理解”;支持 RQ2 | 诊断任务较窄,不能替代真实用户检索评测 |
| 11 | Winoground · F · 2022 | 成对图文组合性探针 | 400 个人工成对例子 | 暴露模型对关系和词序的系统失败;支持 RQ2 | 样本小、人工构造,置信区间与域覆盖有限 |
| 12 | SugarCrepe · F · 2023 | 自然 hard negative 与文本捷径审计 | SugarCrepe | 证明 benchmark 可被文本分布捷径攻破;支持 RQ2 | 负例生成与筛选仍可能引入模型偏差 |
| 13 | No Zero-Shot Without Exponential Data · F · 2024 | 概念频率与预训练覆盖审计 | 4,029 个概念、27 项任务 | 把所谓零样本能力重新解释为数据覆盖变量;支持 RQ2/RQ3 | 预训练数据不可见时只能近似频率与重叠 |
| 14 | CoLA · F · 2023 | 对象—属性绑定的组合式文本找图 | CoLA benchmark | 显示标准图文分数不能替代绑定关系诊断;支持 RQ2 | 任务是受控诊断,真实场景外推待验证 |
| 15 | CIR Robustness · W · 2023 | CIR 视觉/文本扰动与理解诊断 | CIRR-C、FashionIQ-C、CIRR-D | 把鲁棒性和自然扰动纳入 CIR 评测;支持 RQ2/RQ3 | workshop 证据;扰动是否代表真实用户分布仍需验证 |
| 16 | PinPoint · F · 2026 | 多真值、显式负例、改写和多图查询 | 7,635 查询、329K 人工判断 | 为可靠 CIR 评测和 hard negative 研究提供强锚点;支持 RQ2/RQ4 | 消费图像域与构造流程可能限制专业领域外推 |
C. 组合式检索、关系建模与精排
| # | 来源与状态 | 任务 / 方法 | 关键数据或评测 | 对综述的证据贡献 | 主要局限或风险 |
|---|
| 17 | FashionIQ · F · 2021 | 参考图 + 自然语言反馈找图 | FashionIQ 服饰数据 | 定义可交互组合式检索接口;支持 RQ3 | 单一服饰域,数据与用户表达边界明显 |
| 18 | CIRR · F · 2021 | 开放域真实图像 CIR | CIRR | 把组合式检索扩展到真实世界图像;支持 RQ3 | 单一 ground truth 和相似候选可能造成评测歧义 |
| 19 | SEARLE / CIRCO · F · 2023 | 文本反演伪词;零样本 CIR | FashionIQ、CIRR、CIRCO 多真值 | 同时提供零样本方法和多真值评测修正;支持 RQ2/RQ3 | 伪词对 CLIP 文本空间依赖强,多真值仍难穷尽 |
| 20 | CLIP4CIR · F · 2022 | 轻量 combiner 融合图像与修改文本 | FashionIQ、CIRR | 是监督式 CIR 的清晰强基线;支持 RQ3/RQ4 | 依赖标注 triplet,跨域和开放词汇泛化有限 |
| 21 | Pic2Word · F · 2023 | 图像映射为 pseudo-word 的零样本 CIR | FashionIQ、CIRR 等 | 确立低标注、可迁移的组合表示路线;支持 RQ3/RQ4 | 单个伪词可能压缩掉属性、数量和布局信息 |
| 22 | MSRM · F · 2023 | 概率 embedding 与超图关系建模 | Flickr30K、MS COCO | 处理一对多语义和 batch 内高阶关系;支持 RQ1/RQ2 | 训练期 batch 关系不等于真实大库关系,复杂度较高 |
| 23 | ViLEM · F · 2023 | 文本错误生成、检测与纠正 | Flickr30K、MS COCO | 说明细粒度语义可通过辅助错误建模注入双塔;支持 RQ1/RQ2 | 生成负例质量和语言模型偏差会影响结论 |
| 24 | LinCIR · F · 2024 | 仅语言自遮蔽投影的零样本 CIR | CIRCO、GeneCIS、FashionIQ、CIRR | 提供低数据、训练时间可报告的可复现路线;支持 RQ3/RQ4 | 强 CLIP 底座与不同 benchmark 协议影响横向可比性 |
| 25 | KEDs · F · 2024 | 外部知识增强、双流伪词 | CIR benchmark | 针对全局伪词丢失属性的明确机制假设;支持 RQ3 | 外部数据库带来数据覆盖、泄漏和检索成本变量 |
| 26 | CPRD · F · 2024 | 跨编码器向双编码器的排序蒸馏 | 标准图文检索基准 | 证明 hard negative 相对排序比全分布模仿更关键;支持 RQ1/RQ4 | 教师成本和候选挖掘预算必须计入系统比较 |
| 27 | CoLLM · F · 2025 | LLM 生成组合式训练三元组 | MTCIR 3.4M 图像对、17.7M 修改文本 | 把 CIR 瓶颈扩展到训练数据规模与自然度;支持 RQ3 | 合成数据受生成模型偏差与训练数据重叠影响 |
| 28 | Generative ZS-CIR · F · 2025 | 生成伪目标图辅助零样本 CIR | 主流 CIR benchmark | 展示生成模型可作为检索表示桥梁;支持 RQ3 | 生成成本、伪目标错误和不可控先验可能抵消收益 |
D. 统一向量、多语言与跨任务泛化
| # | 来源与状态 | 任务 / 方法 | 关键数据或评测 | 对综述的证据贡献 | 主要局限或风险 |
|---|
| 29 | UniIR / M-BEIR · F · 2024 | 指令控制的通用多模态检索器 | M-BEIR 八类任务 | 把研究问题提升为“一个 embedding 是否理解任务意图”;支持 RQ3 | 平均分可能掩盖单任务退化,指令也可能成为格式捷径 |
| 30 | VLM2Vec / MMEB · F · 2025 | 将 VLM 对比训练成固定维向量 | MMEB 多类 embedding 任务 | 连接生成式 VLM 与通用向量;支持 RQ1/RQ3 | 模型推理和显存成本可能抵消单向量索引优势 |
| 31 | Multilingual Diversity · F · 2024 | 多语言数据翻译、过滤与配比 | ImageNet shifts、英文图文检索、DataComp | 说明语言多样性可能改善英语和域外表示;支持 RQ3 | 翻译与过滤效果难与语言多样性完全分离 |
| 32 | E5-V · P · 2024 | MLLM + prompt 的统一 embedding | 文本—图像、CIR、句子和图像任务 | 提供低多模态训练成本的统一表示假设;支持 RQ3/RQ4 | 预印本;训练成本口径与推理成本需同时核验 |
| 33 | MIEB · F · 2025 | 大规模图像/图文 embedding 评测 | 38 种语言、130 个任务、8 类能力 | 直接反证“单一平均分代表通用性”;支持 RQ2/RQ3 | 任务聚合权重和数据重叠仍可能影响排名 |
| 34 | SigLIP 2 · P · 2025 | captioning、自蒸馏、masked prediction、多语言去偏 | 检索、分类、定位和 dense features | 说明双塔配方仍是强且可扩展的基线;支持 RQ1/RQ3 | 预印本;强通用结果不能替代特定领域受控实验 |
E. 视觉文档、细粒度证据与效率
| # | 来源与状态 | 任务 / 方法 | 关键数据或评测 | 对综述的证据贡献 | 主要局限或风险 |
|---|
| 35 | ColPali · F · 2025 | 页面图像多向量 + 后期交互 | ViDoRe 视觉文档检索 | 证明布局、表格和图形可通过视觉页面表示参与检索;支持 RQ1/RQ3 | 索引膨胀、分辨率和领域边界必须与 OCR 基线同报 |
| 36 | FuseMix · F · 2024 | 冻结单模态特征上的跨模态 mixup | Flickr30K 等 | 给出单 GPU、低数据效率研究证据;支持 RQ1/RQ4 | 单数据集结果与冻结 encoder 限制外推 |
| 37 | MobileCLIP · F · 2024 | 蒸馏/强化数据的移动端图文模型 | 38 项评测与设备延迟 | 把准确率—延迟放入同一选择问题;支持 RQ1/RQ4 | 强教师和合成数据成本不能从部署模型指标中消失 |
| 38 | DCI · F · 2024 | 密集长描述与局部区域对齐诊断 | 7,805 图像、长描述、subcrop matching | 证明标准 benchmark 增益未必转化为局部证据能力;支持 RQ2/RQ3 | 数据规模有限,密集人工描述与普通查询分布不同 |
| 39 | VisRAG · F · 2025 | 页面图像检索 + 视觉生成器 | 多模态文档 RAG 数据 | 提供视觉页面绕过 OCR 链路的端到端证据;支持 RQ1/RQ3 | 高分辨率推理昂贵,RAG 端到端收益不等于检索单项收益 |
| 40 | MIRACL-VISION · P · 2025 | 18 语言视觉文档检索 benchmark | MIRACL-VISION、多语言 hard negatives | 提供“文字密集页面文本向量仍可能更强”的关键反证;支持 RQ2/RQ3 | 预印本;页面以文字为主,不能代表所有视觉密集文档 |
跨论文综合账本
| 当前判断 | 支持来源 | 反证 / 限定来源 | 证据状态 |
|---|
| 双编码器是大规模召回底座,但不是细粒度关系的完整答案 | CLIP、ALIGN、SigLIP、SigLIP 2 | ARO、Winoground、DCI、CoLA | 多个正式来源支持;机制结论较稳,适用域仍需分开报告 |
| “召回 + 局部交互/精排”是可解释的系统折中 | ALBEF、FILIP、CPRD、ColPali | MobileCLIP/FuseMix 说明简单高效路线在受限预算仍有竞争力 | 方向成立;必须统一候选预算、索引和延迟口径 |
| 组合式检索仍有研究空间,核心问题正转向评测和泛化 | FashionIQ、CIRR、SEARLE、LinCIR、CoLLM、Generative ZS-CIR | PinPoint、CIR Robustness 暴露多真值、改写和显式负例失败 | 活跃但不宜只做新融合模块;可靠性入口证据更强 |
| 统一多模态向量是趋势,但“通用”尚未被稳定证明 | UniIR、VLM2Vec、E5-V、SigLIP 2 | MIEB 显示没有单一方法统治所有任务 | UniIR、VLM2Vec、MIEB 已正式发表;结论仍受任务聚合与成本口径限制 |
| 视觉文档检索只应在视觉信息不可由文本完整表达时主张收益 | ColPali、VisRAG、DCI | MIRACL-VISION 显示文字密集页面中 OCR/文本可能更强 | 需要 OCR-only、text、image、hybrid 同条件比较 |
| 评测可靠性和数据审计本身是可持续研究问题 | DataComp、ARO、SugarCrepe、No Zero-Shot、PinPoint | 小型诊断集与合成负例可能不代表真实用户分布 | 多来源支持;下一步应建立真实查询与成本联合协议 |
未完成项
- 本矩阵只覆盖 Topic 已纳入的 40 篇,不证明外部来源已穷尽;
- 冻结检索协议首次执行后,新增候选必须先进入筛选日志,不能直接追加到矩阵;
- 每次更新须重新核验 E5-V、SigLIP 2、MIRACL-VISION 三篇预印本的正式版本状态;
- 进入
systematic_review 前,需补齐数据库返回数、去重数、E1—E7 排除分布及最终纳入流。
元数据
{
"id": "evidence-matrix-image-text-retrieval",
"type": "evidence_matrix",
"title": "图文检索(Image-Text Retrieval)40 篇证据矩阵",
"title_en": "Image-Text Retrieval 40-Paper Evidence Matrix",
"summary": "逐篇记录 40 篇核心论文的版本状态、任务、方法、评测、研究问题贡献与局限。",
"summary_en": "Paper-level evidence matrix covering version status, task, method, evaluation, research-question contribution, and limitations for 40 core papers.",
"updated": "2026-07-16"
}