LLLMWIKI
ArticleResearch mapReading portalMetadata

Evidence matrix · Updated 2026-07-16

Image-Text Retrieval 40-Paper Evidence Matrix

Paper-level evidence matrix covering version status, task, method, evaluation, research-question contribution, and limitations for 40 core papers.

矩阵状态

  • 对应 Topic:topics/image-text-retrieval
  • 对应协议:docs/research-protocols/image-text-retrieval
  • 审计日期:2026-07-16
  • 语料性质:corpus-first 核心基线,不是冻结协议执行后的系统检索全集
  • 完整性:40/40 reviewed;40/40 有本地 PDF、可检索全文、links.yaml 和独立 analysis.md
  • 发表结构:36/40 正式主会或期刊(90%);1/40 workshop(2.5%);3/40 预印本(7.5%);二级来源 0/40
  • 版本复核:2026-07-16 通过 ECCV、ICLR、NeurIPS Proceedings 与 CVF Open Access,将 UniIR、VLM2Vec、Multilingual Diversity、No Zero-Shot、MIEB 从旧预印本状态更新为正式版本

状态缩写:F = 正式主会/期刊,W = workshop,P = 预印本。RQ1 = 架构与成本,RQ2 = 评测可靠性,RQ3 = 任务扩展与泛化,RQ4 = 中等算力研究可行性。

A. 底座、训练目标与数据

#来源与状态任务 / 方法关键数据或评测对综述的证据贡献主要局限或风险
1CLIP · F · 2021大规模双编码器、图文对比学习4 亿网页图文对;零样本分类与图文检索奠定可离线索引的共享向量底座;支持 RQ1全局相似度不保证细粒度关系;数据偏差与重叠难审计
2ALIGN · F · 2021噪声监督双编码器扩展十亿级图文对;Flickr30K、MS COCO证明简单双塔在大规模噪声数据上可扩展;支持 RQ1规模、数据与方法贡献难完全分离;细粒度关系不是目标
3FILIP · F · 2022patch—token 后期交互Flickr30K、MS COCO 等给出双塔与跨编码器之间的细粒度折中;支持 RQ1/RQ4多向量匹配增加索引和查询成本,max 匹配可能走捷径
4ALBEF · F · 2021先对齐再融合、动量蒸馏图文检索及视觉语言任务支持“召回 + 精排”的混合系统;支持 RQ1跨编码器不适合全库逐项计算;训练目标与数据处理耦合
5BLIP · F · 2022对比、匹配、生成多任务;caption 自举过滤COCO/Flickr30K 等视觉语言任务说明数据过滤与多任务目标共同影响检索;支持 RQ1/RQ3难把检索收益单独归因于某个模块或数据步骤
6CoCa · F · 2022对比表示 + caption decoder图文检索、分类和生成任务证明检索表示可与生成目标共享模型;支持 RQ1/RQ3训练规模大;统一目标不等于每项任务都最优
7SigLIP · F · 2023pairwise sigmoid 图文损失多规模图文预训练与下游检索提供更易分布式扩展的训练配方;支持 RQ1/RQ4未直接解决组合性、污染和跨域可靠性
8LAION-5B · F · 2022开放大规模图文数据58.5 亿图文对及语言子集把数据规模、开放复现和过滤风险纳入研究变量;支持 RQ2/RQ3链接失效、许可、安全和 CLIP 过滤循环偏差
9DataComp · F · 2023固定模型/预算下比较数据策略128 亿候选池、38 项下游评测使过滤、去重、配比可在受控预算下比较;支持 RQ2/RQ4固定训练框架限制外推;候选池本身仍有网页数据偏差

B. 组合性、负例与评测可靠性

#来源与状态任务 / 方法关键数据或评测对综述的证据贡献主要局限或风险
10ARO · F · 2023属性、关系、词序组合性诊断ARO 诊断集反证“标准 Recall 高等于组合理解”;支持 RQ2诊断任务较窄,不能替代真实用户检索评测
11Winoground · F · 2022成对图文组合性探针400 个人工成对例子暴露模型对关系和词序的系统失败;支持 RQ2样本小、人工构造,置信区间与域覆盖有限
12SugarCrepe · F · 2023自然 hard negative 与文本捷径审计SugarCrepe证明 benchmark 可被文本分布捷径攻破;支持 RQ2负例生成与筛选仍可能引入模型偏差
13No Zero-Shot Without Exponential Data · F · 2024概念频率与预训练覆盖审计4,029 个概念、27 项任务把所谓零样本能力重新解释为数据覆盖变量;支持 RQ2/RQ3预训练数据不可见时只能近似频率与重叠
14CoLA · F · 2023对象—属性绑定的组合式文本找图CoLA benchmark显示标准图文分数不能替代绑定关系诊断;支持 RQ2任务是受控诊断,真实场景外推待验证
15CIR Robustness · W · 2023CIR 视觉/文本扰动与理解诊断CIRR-C、FashionIQ-C、CIRR-D把鲁棒性和自然扰动纳入 CIR 评测;支持 RQ2/RQ3workshop 证据;扰动是否代表真实用户分布仍需验证
16PinPoint · F · 2026多真值、显式负例、改写和多图查询7,635 查询、329K 人工判断为可靠 CIR 评测和 hard negative 研究提供强锚点;支持 RQ2/RQ4消费图像域与构造流程可能限制专业领域外推

C. 组合式检索、关系建模与精排

#来源与状态任务 / 方法关键数据或评测对综述的证据贡献主要局限或风险
17FashionIQ · F · 2021参考图 + 自然语言反馈找图FashionIQ 服饰数据定义可交互组合式检索接口;支持 RQ3单一服饰域,数据与用户表达边界明显
18CIRR · F · 2021开放域真实图像 CIRCIRR把组合式检索扩展到真实世界图像;支持 RQ3单一 ground truth 和相似候选可能造成评测歧义
19SEARLE / CIRCO · F · 2023文本反演伪词;零样本 CIRFashionIQ、CIRR、CIRCO 多真值同时提供零样本方法和多真值评测修正;支持 RQ2/RQ3伪词对 CLIP 文本空间依赖强,多真值仍难穷尽
20CLIP4CIR · F · 2022轻量 combiner 融合图像与修改文本FashionIQ、CIRR是监督式 CIR 的清晰强基线;支持 RQ3/RQ4依赖标注 triplet,跨域和开放词汇泛化有限
21Pic2Word · F · 2023图像映射为 pseudo-word 的零样本 CIRFashionIQ、CIRR 等确立低标注、可迁移的组合表示路线;支持 RQ3/RQ4单个伪词可能压缩掉属性、数量和布局信息
22MSRM · F · 2023概率 embedding 与超图关系建模Flickr30K、MS COCO处理一对多语义和 batch 内高阶关系;支持 RQ1/RQ2训练期 batch 关系不等于真实大库关系,复杂度较高
23ViLEM · F · 2023文本错误生成、检测与纠正Flickr30K、MS COCO说明细粒度语义可通过辅助错误建模注入双塔;支持 RQ1/RQ2生成负例质量和语言模型偏差会影响结论
24LinCIR · F · 2024仅语言自遮蔽投影的零样本 CIRCIRCO、GeneCIS、FashionIQ、CIRR提供低数据、训练时间可报告的可复现路线;支持 RQ3/RQ4强 CLIP 底座与不同 benchmark 协议影响横向可比性
25KEDs · F · 2024外部知识增强、双流伪词CIR benchmark针对全局伪词丢失属性的明确机制假设;支持 RQ3外部数据库带来数据覆盖、泄漏和检索成本变量
26CPRD · F · 2024跨编码器向双编码器的排序蒸馏标准图文检索基准证明 hard negative 相对排序比全分布模仿更关键;支持 RQ1/RQ4教师成本和候选挖掘预算必须计入系统比较
27CoLLM · F · 2025LLM 生成组合式训练三元组MTCIR 3.4M 图像对、17.7M 修改文本把 CIR 瓶颈扩展到训练数据规模与自然度;支持 RQ3合成数据受生成模型偏差与训练数据重叠影响
28Generative ZS-CIR · F · 2025生成伪目标图辅助零样本 CIR主流 CIR benchmark展示生成模型可作为检索表示桥梁;支持 RQ3生成成本、伪目标错误和不可控先验可能抵消收益

D. 统一向量、多语言与跨任务泛化

#来源与状态任务 / 方法关键数据或评测对综述的证据贡献主要局限或风险
29UniIR / M-BEIR · F · 2024指令控制的通用多模态检索器M-BEIR 八类任务把研究问题提升为“一个 embedding 是否理解任务意图”;支持 RQ3平均分可能掩盖单任务退化,指令也可能成为格式捷径
30VLM2Vec / MMEB · F · 2025将 VLM 对比训练成固定维向量MMEB 多类 embedding 任务连接生成式 VLM 与通用向量;支持 RQ1/RQ3模型推理和显存成本可能抵消单向量索引优势
31Multilingual Diversity · F · 2024多语言数据翻译、过滤与配比ImageNet shifts、英文图文检索、DataComp说明语言多样性可能改善英语和域外表示;支持 RQ3翻译与过滤效果难与语言多样性完全分离
32E5-V · P · 2024MLLM + prompt 的统一 embedding文本—图像、CIR、句子和图像任务提供低多模态训练成本的统一表示假设;支持 RQ3/RQ4预印本;训练成本口径与推理成本需同时核验
33MIEB · F · 2025大规模图像/图文 embedding 评测38 种语言、130 个任务、8 类能力直接反证“单一平均分代表通用性”;支持 RQ2/RQ3任务聚合权重和数据重叠仍可能影响排名
34SigLIP 2 · P · 2025captioning、自蒸馏、masked prediction、多语言去偏检索、分类、定位和 dense features说明双塔配方仍是强且可扩展的基线;支持 RQ1/RQ3预印本;强通用结果不能替代特定领域受控实验

E. 视觉文档、细粒度证据与效率

#来源与状态任务 / 方法关键数据或评测对综述的证据贡献主要局限或风险
35ColPali · F · 2025页面图像多向量 + 后期交互ViDoRe 视觉文档检索证明布局、表格和图形可通过视觉页面表示参与检索;支持 RQ1/RQ3索引膨胀、分辨率和领域边界必须与 OCR 基线同报
36FuseMix · F · 2024冻结单模态特征上的跨模态 mixupFlickr30K 等给出单 GPU、低数据效率研究证据;支持 RQ1/RQ4单数据集结果与冻结 encoder 限制外推
37MobileCLIP · F · 2024蒸馏/强化数据的移动端图文模型38 项评测与设备延迟把准确率—延迟放入同一选择问题;支持 RQ1/RQ4强教师和合成数据成本不能从部署模型指标中消失
38DCI · F · 2024密集长描述与局部区域对齐诊断7,805 图像、长描述、subcrop matching证明标准 benchmark 增益未必转化为局部证据能力;支持 RQ2/RQ3数据规模有限,密集人工描述与普通查询分布不同
39VisRAG · F · 2025页面图像检索 + 视觉生成器多模态文档 RAG 数据提供视觉页面绕过 OCR 链路的端到端证据;支持 RQ1/RQ3高分辨率推理昂贵,RAG 端到端收益不等于检索单项收益
40MIRACL-VISION · P · 202518 语言视觉文档检索 benchmarkMIRACL-VISION、多语言 hard negatives提供“文字密集页面文本向量仍可能更强”的关键反证;支持 RQ2/RQ3预印本;页面以文字为主,不能代表所有视觉密集文档

跨论文综合账本

当前判断支持来源反证 / 限定来源证据状态
双编码器是大规模召回底座,但不是细粒度关系的完整答案CLIP、ALIGN、SigLIP、SigLIP 2ARO、Winoground、DCI、CoLA多个正式来源支持;机制结论较稳,适用域仍需分开报告
“召回 + 局部交互/精排”是可解释的系统折中ALBEF、FILIP、CPRD、ColPaliMobileCLIP/FuseMix 说明简单高效路线在受限预算仍有竞争力方向成立;必须统一候选预算、索引和延迟口径
组合式检索仍有研究空间,核心问题正转向评测和泛化FashionIQ、CIRR、SEARLE、LinCIR、CoLLM、Generative ZS-CIRPinPoint、CIR Robustness 暴露多真值、改写和显式负例失败活跃但不宜只做新融合模块;可靠性入口证据更强
统一多模态向量是趋势,但“通用”尚未被稳定证明UniIR、VLM2Vec、E5-V、SigLIP 2MIEB 显示没有单一方法统治所有任务UniIR、VLM2Vec、MIEB 已正式发表;结论仍受任务聚合与成本口径限制
视觉文档检索只应在视觉信息不可由文本完整表达时主张收益ColPali、VisRAG、DCIMIRACL-VISION 显示文字密集页面中 OCR/文本可能更强需要 OCR-only、text、image、hybrid 同条件比较
评测可靠性和数据审计本身是可持续研究问题DataComp、ARO、SugarCrepe、No Zero-Shot、PinPoint小型诊断集与合成负例可能不代表真实用户分布多来源支持;下一步应建立真实查询与成本联合协议

未完成项

  • 本矩阵只覆盖 Topic 已纳入的 40 篇,不证明外部来源已穷尽;
  • 冻结检索协议首次执行后,新增候选必须先进入筛选日志,不能直接追加到矩阵;
  • 每次更新须重新核验 E5-V、SigLIP 2、MIRACL-VISION 三篇预印本的正式版本状态;
  • 进入 systematic_review 前,需补齐数据库返回数、去重数、E1—E7 排除分布及最终纳入流。