LLLMWIKI
ArticleResearch mapReading portalMetadata

Review protocol · Updated 2026-07-16

Image-Text Retrieval Review Protocol

Frozen research questions, databases, search strings, eligibility criteria, screening flow, and review-stage gates.

协议状态

  • Topic:topics/image-text-retrieval
  • 当前阶段:scoped_review
  • 协议版本:v1.0
  • 协议冻结日期:2026-07-16
  • 历史语料最后核验:2026-07-16
  • 冻结检索式首次完整执行:待执行
  • 时间窗口:2022-01-01 至协议冻结日 2026-07-16;允许纳入 2022 年前不可替代的奠基论文
  • 证据矩阵:docs/research-matrices/image-text-retrieval-evidence-matrix
  • 编译责任:每日自动任务只生成候选报告;Hermes 负责正式 ingest、全文核验、综合与阶段升级

scoped_review 在这里表示研究问题、范围、来源库、检索式和筛选规则已经冻结,不表示数据库检索已经穷尽。现有 40 篇是 2026-07-14 编译形成的 corpus-first 基线;当时没有保存完整候选导出与逐条排除日志,因此不能把 40 篇反向包装成 PRISMA 式系统检索结果。

研究问题与边界

主问题

在公开数据、中等算力和可复现预算下,哪些图文检索方法与评测协议能够同时兼顾大规模召回、细粒度或组合关系判断、跨语言/跨领域泛化和系统成本,并形成适合研究生连续验证的研究入口?

子问题

  1. 双编码器(dual encoder)、局部多向量/后期交互(late interaction)、跨编码器精排(cross-encoder reranking)及其混合系统,在准确率、索引大小、查询延迟和训练成本之间如何取舍?
  2. 标准 Recall@K 在多真值、难负例(hard negative)、组合性、预训练重叠和语言分布变化下是否仍能反映真实检索能力?
  3. 组合式图像检索(composed image retrieval, CIR)、统一多模态向量、视觉文档检索和多语言检索,分别在哪些任务边界内显示稳定增益?
  4. 在两到三年研究周期内,哪些问题可以用公开数据和可控算力形成连续实验;哪些结果只是更换底座、数据或评测造成的不可归因增益?

分析框架

  • 输入与任务:文本找图、图找文本、图像加修改文本找图、图文混合查询、视觉文档页面检索。
  • 方法:双编码器、细粒度对齐、多向量、跨编码器、组合表示、统一向量、数据/训练策略与评测方法。
  • 比较对象:同数据、同底座、同候选预算或同计算预算下的强基线;视觉文档任务还比较 OCR-only、text embedding、image-only 与 hybrid。
  • 结果:Recall@K、mAP、nDCG、组合性/鲁棒性准确率、证据页或局部区域命中、索引大小、吞吐、延迟、训练与推理资源。
  • 使用情境:公开或可审计数据,优先可复现代码;面向中等算力、小团队和研究生周期。

纳入范围

  • 直接研究文本—图像双向检索、跨模态检索、组合式图像检索、统一多模态向量或视觉文档页面检索;
  • 直接改变图文检索结论的数据构造、难负例、组合性、多真值、污染、跨语言/跨领域或效率研究;
  • 有可核验主论文全文,能够抽取任务、方法、数据/划分、指标和至少一项局限;
  • 2022—2026 的正式论文与高相关预印本;2022 年前仅保留定义任务、底座或关键 benchmark 的不可替代来源;
  • 正面结果、负面结果和反证均可纳入,不以榜单提升作为必要条件。

排除范围

  • 纯文本信息检索、纯图像近重复检索,或不包含图像—文本关系的单模态任务;
  • 纯图像生成/编辑、通用视觉问答或 RAG 系统,且没有独立图文检索任务、指标或可分离消融;
  • 仅有产品演示、博客、项目页、搜索摘要或二级解读,无法回到主论文原文;
  • 只更换 backbone、训练数据或私有模型并报告单点榜单增益,无法判断机制、成本或评测边界;
  • 重复版本、撤稿版本、无法取得可核验全文,或数据与指标不足以支持任何子问题的记录。

搜索策略

中英文关键词

  • 中文:图文检索、跨模态检索、文本找图、图找文本、组合式图像检索、多模态向量、视觉文档检索、双编码器、细粒度对齐、后期交互、难负例、组合性、多真值、多语言、评测可靠性、检索效率。
  • English: image-text retrieval, text-to-image retrieval, image-to-text retrieval, cross-modal retrieval, composed image retrieval, multimodal embedding, visual document retrieval, dual encoder, fine-grained alignment, late interaction, hard negative, compositionality, multiple positives, multilingual, benchmark reliability, retrieval efficiency.

冻结检索式

来源库完整检索式执行状态返回数
CVF Open Accesssite:openaccess.thecvf.com ("image-text retrieval" OR "text-to-image retrieval" OR "image-to-text retrieval" OR "composed image retrieval" OR "visual document retrieval") (benchmark OR evaluation OR "hard negative" OR compositionality OR multilingual OR efficiency OR reranking)待首次执行;2026-07-16 冻结
OpenReviewsite:openreview.net/forum ("image-text retrieval" OR "composed image retrieval" OR "multimodal embedding" OR "visual document retrieval") (retrieval OR benchmark OR evaluation OR reranking OR compositionality OR multilingual),限定 ICLR、NeurIPS、TMLR待首次执行;2026-07-16 冻结
arXiv cs.CV(cat:cs.CV) AND (all:"image-text retrieval" OR all:"text-image retrieval" OR all:"composed image retrieval" OR all:"visual document retrieval" OR all:"universal multimodal embedding") AND (all:benchmark OR all:evaluation OR all:"hard negative" OR all:compositionality OR all:multilingual OR all:efficiency OR all:reranking) AND submittedDate:[202201010000 TO 202607162359]待首次执行;2026-07-16 冻结
ACL Anthology / DBLP("cross-modal retrieval" OR "multimodal retrieval" OR "vision-language retrieval") AND (image OR visual) AND (benchmark OR evaluation OR multilingual OR efficiency);发布日期限定 2022-01-01 至 2026-07-16待首次执行;2026-07-16 冻结
本地语料Topic/source frontmatter 中匹配 image-text-retrievalvision-languageevaluationmultimodal,再按 DOI、arXiv ID、标题去重2026-07-16 已审计40 篇核心来源
引文追踪从 CLIP、FILIP、ALBEF、FashionIQ、CIRR、M-BEIR、ColPali、PinPoint 做前向/后向引文追踪待首次执行;只补不可替代机制、反证与 benchmark

首次执行时必须保存每个来源库的实际查询、时间戳、原始导出或结果快照和返回数;检索接口不支持完整布尔语法时,必须记录拆分后的实际子查询,不能只保留本表中的计划式。

纳入、排除与去重

纳入标准

  • I1 任务相关:直接回答至少一个子问题;
  • I2 原始证据:存在官方论文页或 arXiv 版本页及可核验全文;
  • I3 可抽取:能记录方法、数据/划分、指标、比较对象与局限;
  • I4 时间合规:位于 2022—2026,或被明确标为不可替代奠基来源;
  • I5 决策增量:补充方法机制、反证、成本、评测边界或研究入口,而非仅重复已有结论。

排除原因码

  • E1 主题外:不属于冻结任务边界;
  • E2 非原始/无全文:只有摘要、演示或二级来源;
  • E3 重复或被正式版取代:与已纳入记录为同一研究;
  • E4 证据不可归因:只报榜单微增,缺少必要设置、比较或机制;
  • E5 任务不可分离:通用 VLM/RAG 结果无法分离出图文检索证据;
  • E6 信息不足:数据、划分、指标或全文质量不足以进入核心语料;
  • E7 状态风险:撤稿、严重勘误或版本冲突尚未澄清。

去重与版本规则

  • 去重键:DOI → arXiv ID → 规范化标题;标题规范化时移除标点、副标题、大小写和 venue 后缀。
  • 正式会议/期刊版与预印本合并为同一 source note,正式版承担 venue 与结论状态,预印本保留版本历史链接。
  • 同一 benchmark 的数据论文与后续方法论文不因共享数据集而去重;只有研究对象、作者、摘要和版本链共同指向同一工作时才合并。
  • Workshop、预印本、撤稿/勘误和闭源技术报告必须单独标记,不与正式主会/期刊混算。

筛选与记录流程

  1. 保存来源库导出、查询、时间戳和返回数;
  2. 按 DOI、arXiv ID 和规范化标题去重;
  3. 标题/摘要初筛并记录 include / exclude / unclear 与原因码;
  4. include / unclear 做全文资格审查;
  5. 核验正式版本、venue、主链接、数据/指标和关键结论;
  6. 将最终纳入项写入 raw → source → topic/claim/question,并更新证据矩阵;
  7. 对可能改变推荐的反证做第二遍全文复核,最后才更新 Topic 判断。

每条记录至少保留:candidate_id、来源库、实际查询、发现日期、DOI/arXiv ID、版本状态、标题/摘要决定、全文决定、排除原因码、核验人/编译器和证据位置。

当前筛选流

历史 corpus-first 基线

阶段数量说明
历史初始发现不可重建2026-07-14 编译未保存所有数据库返回和被排除候选,不能伪造数量
Topic 已链接40当前 source_notes;标题级检查无重复
全文核验4040/40 有 PDF、可检索全文和独立 analysis.md
source 状态4040/40 为 reviewed
当前核心语料4036 篇正式主会/期刊、1 篇 workshop、3 篇预印本

冻结协议的前瞻检索

阶段数量说明
初始发现待执行尚未生成可复查的数据库导出
去重后待执行按 DOI → arXiv ID → 标题处理
标题/摘要初筛后待执行必须累计 E1—E7 排除原因
全文核验后待执行只有原文核验项可进入候选编译队列
新增核心语料0协议冻结本身不自动纳入新论文

现有 40 篇中,正式主会/期刊占 90%(36/40),workshop 占 2.5%(1/40),预印本占 7.5%(3/40),二级来源占 0%。2026-07-16 已通过 ECCV、ICLR、NeurIPS 与 CVF 官方页面修正 5 条过期 venue。历史排除理由分布不可重建;从首次前瞻检索起按 E1—E7 报告数量与比例。

证据矩阵与综合方法

逐篇矩阵见 docs/research-matrices/image-text-retrieval-evidence-matrix。每篇记录版本状态、任务/方法家族、关键数据或评测、对研究问题的贡献、最重要的局限和本地证据状态。

综合不按论文顺序复述,而按以下张力组织:

  1. 可扩展召回—细粒度交互;
  2. 单一正确答案—多真值/显式负例;
  3. 平均分—分任务、分语言和分领域退化;
  4. 视觉信息收益—OCR/文本基线;
  5. 方法质量—训练、索引和查询成本;
  6. 榜单增益—污染、数据覆盖和评测捷径。

若多篇论文使用不同数据、底座或候选预算,不做未经校准的数值合并或元分析,只进行结构化叙述综合,并明确不可比原因。

阶段升级门

  • 保持 scoped_review:协议已冻结,但外部检索、去重、排除日志或新增来源核验仍未完成。
  • 升级到 systematic_review:四类外部来源与引文追踪至少完成一轮;实际检索式、导出、日期、去重、筛选数和 E1—E7 排除分布可复查;最终来源完成版本和全文核验。
  • 升级到 decision_ready:在系统检索基础上重新审查综合结论、最强反证、Claims/Questions、A—D 研究入口、资源前提和止损条件;完成 Wiki/Viewer/浏览器发布门。

已知盲区与更新条件

  • 现有 40 篇来自定向编译,不代表 CVF、OpenReview、arXiv、ACL/DBLP 的穷尽覆盖;
  • SIGIR、MM、信息检索和文档检索社群可能存在未被 cs.CV 查询完整覆盖的工作;
  • 3 篇预印本(E5-V、SigLIP 2、MIRACL-VISION)的正式发表状态需要在每次更新时复核,不能长期沿用旧 venue;
  • 私有训练数据、闭源模型成本和 benchmark 污染通常无法完全审计;
  • 视觉文档、中文/多语言和专业图像的任务定义不同,不能直接用平均分合并;
  • 下一次更新触发:冻结协议首次完整执行、CVPR/ICCV/ECCV/NeurIPS/ICLR/SIGIR/MM 新论文、关键 benchmark、撤稿/勘误,或直接反驳当前“可靠性 + 成本优先”判断的新证据。