LLLMWIKI
正文研究地图阅读入口元数据

主题 · 更新于 2026-07-16

图文检索(Image-Text Retrieval)

研究用图像与文本互相检索、组合查询和统一多模态向量表示,重点关注可扩展性、细粒度对齐、数据分布与评测可靠性。

当前判断

图文检索(Image-Text Retrieval)

研究用图像与文本互相检索、组合查询和统一多模态向量表示,重点关注可扩展性、细粒度对齐、数据分布与评测可靠性。

40 来源笔记5 开放问题

阅读路径

  1. 问题明确任务与证据边界
  2. 方法比较方法族与结构选择
  3. 证据回到论文与可检索全文
  4. 开放问题记录仍待验证的张力

研究方法族地图

从问题定义走向可复核的系统能力

40 来源笔记
1问题明确任务与证据边界
2方法比较方法族与结构选择
3证据回到论文与可检索全文
4开放问题记录仍待验证的张力

三分钟摘要

图文检索研究两类基本方向:用文本找图(text-to-image retrieval, T2I)和用图找文本(image-to-text retrieval, I2T)。在更复杂的设置中,查询可以是“参考图像 + 修改文本”(composed image retrieval),目标也可以是图片、文本、网页或文档页面。本页用于判断这个方向的技术主线、公开数据/评测和适合研究生切入的难点。

  • 它是什么:把图像、文本或“图像 + 修改指令”映射到可比较的表示,再从候选库中找回最相关结果。
  • 现在做到哪里:双编码器已经是大规模召回底座,细粒度交互、组合式查询和统一多模态向量仍处于快速发展期。
  • 真正难点:标准 Recall@K 可能掩盖组合性失败、错误负例、预训练数据重叠、跨语言退化和高昂索引成本。
  • 研究判断:有限算力下,比“再训练一个更大的模型”更可行的是可靠评测、难负例、轻量精排与专业领域视觉证据检索。
  • 证据阶段:已冻结正式检索协议并完成40 篇证据矩阵,当前为 scoped_review;外部检索和排除日志尚未完成,不能声称系统覆盖。

任务或系统流程

一个可靠的图文检索系统如何把高召回、细粒度匹配与成本约束连接起来?

从查询到可复核结果的检索流程

第一阶段生成可离线索引的共享表示并召回候选,第二阶段只对少量候选做局部交互或精排,最后同时报告结果质量、证据位置和系统成本。

  1. 查询输入文本、图像,或参考图像加修改指令
  2. 共享表示双编码器独立计算向量,支持离线建库
  3. 候选召回近似最近邻索引保留高召回候选
  4. 局部交互多向量、late interaction 或跨编码器识别细粒度关系
  5. 可复核输出同时报 Recall、错误案例、延迟、吞吐与索引大小
图示依据CLIPFILIPALBEFColPali

查询经过图像与文本编码形成共享表示,向量索引召回候选,再由局部交互或跨编码器精排,最后输出结果、局部证据和质量成本指标。

当前综合判断

1. 双编码器已经是可扩展基线,但不是完整答案

CLIP 与 ALIGN 证明,图像编码器和文本编码器分别输出共享向量,再通过对比学习训练,可以在大规模图库中离线建索引,并在 Flickr30K、MS COCO 等标准任务上取得强结果(CLIPALIGN)。SigLIP 进一步把重点放到损失和训练通信成本,说明双塔路线仍然是工程底座,而不是已经被淘汰的旧方法(SigLIP)。

但双塔分数通常是全局语义相似度。它可以判断“狗在雪地里”大体相关,却不一定稳定区分对象—属性归属、词序、数量或空间关系。ARO、Winoground 与 SugarCrepe 的结果共同说明,标准 Recall 高不能直接解释为组合性理解(AROWinogroundSugarCrepe)。

2. 主流系统正在形成“召回 + 精排/多向量”的混合形态

ALBEF 采用先对齐再融合的结构:双塔做大范围对齐,cross-encoder 对候选做更细匹配;FILIP 则用 patch—token late interaction 在细粒度和预计算之间折中(ALBEFFILIP)。ColPali 把这一思路扩展到视觉文档,用页面图像的多向量表示和 late interaction 处理布局、表格与字体信息(ColPali)。

这形成一个清晰的系统分解:第一阶段追求高召回、低延迟、可压缩索引;第二阶段追求关系/局部对齐与可解释证据。研究价值往往在两阶段之间的负例、分数校准、索引成本和域外可靠性,而不是只把 backbone 换大。

3. 组合式查询是最明确的任务切口之一

FashionIQ 用自然语言反馈描述“保留什么、改变什么”;CIRR 将任务扩展到开放域真实图像;SEARLE 使用 pseudo-word 和 CLIP 共享空间做零样本 CIR,并用 CIRCO 的多真值标注缓解单一 ground truth 的问题(FashionIQCIRRSEARLE/CIRCO)。

这个方向比普通 caption retrieval 更接近交互式搜索,也有公开数据和可重复指标;但它仍受到目标多样性、合理负例、域偏移和用户满意度缺失的约束。小团队可以围绕一个明确域(例如商品、论文页面、体育战术图)做数据构造、难例和评测,而不必从零训练图文基础模型。

4. 数据分布和评测协议已经成为一等研究变量

LAION-5B 和 DataComp 让研究者可以讨论数据规模、过滤、去重、语言和计算预算;BLIP 说明 caption 自举/过滤也会改变监督质量(LAION-5BDataCompBLIP)。多语言多样性研究进一步指出,加入翻译后的非英语数据不仅影响多语任务,也可能改善英语检索和地域分布变化(Multilingual Diversity)。

同时,No Zero-Shot Without Exponential Data 通过概念频率分析提醒我们:下游概念可能已经出现在预训练数据中,所谓 zero-shot 结果需要做重叠/频率审计(No Zero-Shot Without Exponential Data)。因此,新的方法如果只在 Flickr30K/MS COCO 上报一个 Recall@K,而不报告数据重叠、长尾、语言和 hard-negative 对照,证据强度有限。

5. 统一多模态 embedding 是前沿,但“通用”仍待验证

UniIR 用 instruction 把八类检索任务合并到一个系统,并提出 M-BEIR;VLM2Vec 则把已有 VLM 训练成可处理图像、文本和组合指令的固定维向量模型(UniIR/M-BEIRVLM2Vec/MMEB)。这条路线有明显研究空间:任务意图建模、跨任务负例、域外泛化和向量索引效率。

但统一 benchmark 的平均分可能掩盖某一任务或语言退化;生成式 VLM 的显存和推理成本也可能抵消向量检索的优势。当前更稳妥的表述是“统一 embedding 是可研究的趋势”,而不是“已经找到通用检索器”。

近五年演化(2022—2026)

本轮新增核验了 20 篇 2022—2026 年的论文,与原有 20 篇基础、组合式检索、数据和评测论文合起来形成 40 篇专题主语料。结论不是“图文检索已经没有空间”,而是研究问题正在从“能不能把图和文对齐”转向“在什么任务、什么数据和什么成本约束下,表示真的可靠”。

2022—2026 年图文检索的研究问题发生了什么变化?

近五年问题重心的迁移

时间线不是按模型数量罗列论文,而是展示研究焦点如何从表示扩展到组合查询、统一向量、视觉文档与可靠性审计。

  1. 2022零样本组合式检索与细粒度对齐成为独立任务
  2. 2023数据筛选、训练配方与轻量双编码器进入系统化比较
  3. 2024统一多模态 embedding 与视觉文档多向量检索形成新系统路线
  4. 2025多语言、跨任务、显式负例与多真值评测暴露平均分盲点
  5. 2026研究价值转向可靠性、专业域证据与质量—成本边界
图示依据Pic2WordDataCompUniIR/M-BEIRMIEBPinPoint

2022 年组合式和细粒度检索兴起,2023 年训练效率与数据质量加强,2024 年统一多模态向量和视觉文档检索发展,2025 至 2026 年转向跨任务可靠性与成本验证。

方法家族与成熟阶段

方法家族的成熟度

当前阶段成熟底座

双编码器与训练配方

证据锚点

CLIP/ALIGN/SigLIP 之后,SigLIP 2、MobileCLIP、DCI、FuseMix 持续优化训练、蒸馏和效率。

研究机会

受控的语言/领域泛化、数据质量和成本曲线,而不是继续盲目更换 backbone。

当前阶段系统优化期

细粒度对齐与混合检索

证据锚点

FILIP、ALBEF、MSRM、CPRD、ColPali、VisRAG 已形成“召回 + 局部交互/精排”路线。

研究机会

验证 hard negative 是否有效,并量化候选预算、late interaction 索引成本与可解释证据。

当前阶段活跃发展期

组合式图像检索(CIR)

证据锚点

Pic2Word、LinCIR、KEDs、生成式 ZS-CIR、CoLLM 从 pseudo token、组合 embedding、伪目标图和 LLM 数据增强持续推进。

研究机会

多真值、自然 query、改写鲁棒性、多图组合与跨领域泛化。

当前阶段早期整合期

统一多模态 embedding

证据锚点

UniIR/M-BEIR、VLM2Vec、E5-V、MIEB 正把多个任务放入统一向量框架。

研究机会

分任务/分语言报告、平均分之外的退化、索引规模与 VLM 推理成本。

当前阶段评测建设期

数据与评测可靠性

证据锚点

ARO、Winoground、SugarCrepe、CoLA、CIR robustness、No Zero-Shot、PinPoint 已暴露错误负例、多真值、预训练重叠、paraphrase 与显式负例问题。

研究机会

建立能反映真实用户行为的指标、负例质量审计和可复核的数据污染记录。

当前阶段应用验证期

视觉文档与专业图像

证据锚点

ColPali、VisRAG、MIRACL-VISION、ViDoRe 显示应用快速增长,但跨数据集结论仍不统一。

研究机会

只在视觉信息无法由 OCR 完整表达的页面上证明收益,并同时报告 OCR、文本、视觉与混合检索成本。

各方法家族分别解决检索链路中的哪一类问题?

方法家族与系统位置

双编码器负责规模,局部交互和跨编码器负责精度,组合式与统一向量改变查询空间,数据与评测方法负责判断提升是否可信。

  1. 双编码器召回独立编码与离线索引,适合大规模候选库
  2. 局部多向量patch—token 匹配保留局部证据,代价是索引膨胀
  3. 跨编码器精排联合注意力提升关系判断,只适合少量候选
  4. 组合式查询把参考图像与修改文本合成为目标意图
  5. 统一多模态向量用指令统一不同查询和目标模态,但需分任务验收
  6. 数据与可靠性审计负例、多真值、语言分布和预训练重叠
图示依据CLIPALBEFSEARLE/CIRCOVLM2VecSugarCrepe

方法图以双编码器召回为底座,上接局部多向量与跨编码器精排,旁接组合式查询和统一多模态向量,并由数据评测可靠性贯穿所有分支。

方法家族比较表

方法家族核心机制适合解决的问题主要代价/风险
双编码器(dual encoder)图像、文本独立编码,共享空间对比学习大规模召回、离线索引、零样本迁移全局表示弱于细粒度关系;依赖数据规模
跨编码器(cross encoder)候选图文联合 cross-attention精排、局部匹配、关系判断每个候选都计算,延迟高
混合召回 + 精排双塔初筛,cross encoder/ITM 重排工业检索与准确率—效率折中系统复杂,需要校准候选数
Late interaction / 多向量patch/token 独立表示,查询时局部匹配细粒度对齐、文档布局、局部证据索引存储和打分成本更高
组合式检索(CIR)参考图 + 修改文本交互式商品/开放域图像搜索标注昂贵、多真值和域偏移
统一指令 embeddinginstruction 指定 query/target 模态与任务跨任务、跨模态、RAG/多模态搜索任务混合、成本、平均分掩盖退化
数据/评测方法过滤、去重、hard negative、反事实 benchmark解决噪声、长尾、捷径和污染需要完整审计,容易把错误负例当真值

拥挤方向与研究机会

如果你刚进入这个方向,先不要从模型名称或榜单分数开始。先判断自己拥有多少算力、数据和领域资源,再选择能被实验明确证伪的问题。

先看结论

先避开

只换模型、只刷一个分数

典型做法

只更换主干网络(backbone)、只报告前 K 个结果命中率(Recall@K)、只增加一个简单查询融合模块,或从零训练超大图文模型。

为什么不够

强模型已经把标准数据集分数抬得很高;单个数据集上的小幅提升,无法证明模型更懂图文关系,也可能来自数据重叠或调参。

怎样改成研究问题

同时检查错误案例、跨数据集稳定性、运行成本和数据污染,明确方法在哪些情况下有效、在哪些情况下失败。

四个研究入口怎么选

首选

检查模型是真的理解,还是在猜关键词

一句话

设计困难负例(hard negative)和可靠评测,识别模型是否理解对象、属性、数量、词序与空间关系。

适合你

刚入门、算力有限,希望先形成一个边界清晰且可连续迭代的问题。

第一步

冻结公开模型,在一个标准检索集和一个组合性诊断集上复现结果,再人工检查新增负例是否正确。

继续条件

问题在至少两个模型或两个数据集上稳定出现,而且负例质量通过人工抽样审计。

查看候选课题 A
次选

让检索系统在有限算力下又快又准

一句话

比较快速召回与精细重排的组合,研究准确率、查询速度和索引大小之间的取舍。

适合你

喜欢系统工程,愿意做完整实现、计时和资源测量,而不只是训练一个新模块。

第一步

固定同一个图文模型,比较单向量召回、局部交互和轻量精排三条流程。

继续条件

在相近成本下结果更好,或在相近结果下明显更快、更省存储。

查看候选课题 B
条件推荐

找出中文、多语言或跨领域为什么失效

一句话

不只看平均分,而是分别检查不同语言、长尾概念和领域变化造成的性能下降。

适合你

能稳定获得许可清晰、质量可检查的中文、多语言或专业领域数据。

第一步

先做中文/英文、领域内/领域外四组对照,固定图像模型,只改变数据或语言处理方式。

继续条件

数据量足够支撑分组比较,而且差异不能用翻译质量或样本重复简单解释。

查看候选课题 C
应用驱动

检索文字识别看不全的视觉证据

一句话

重点检索表格、图表、页面布局和局部区域,而不是默认视觉模型一定优于文字识别(OCR)。

适合你

拥有论文页面、实验截图、体育战术图等明确场景,并能完成少量人工标注。

第一步

先做 100—500 页小数据集,对比仅文字识别、仅图像和图文混合三类对照基线(baseline)。

继续条件

视觉或混合方法只在“视觉信息确实重要”的子集上稳定胜出,并且存储与查询成本可接受。

查看候选课题 D

对“能否作为研究生方向”的修订结论

图文检索可以作为研究生研究方向,但新手不应先问“换哪个模型”,而应先问“我能验证哪一种失败”。默认优先 A;偏系统工程时选择 B;只有在数据或专业场景稳定可得时,才优先考虑 C 或 D。所有路线都应同时报告检索结果、错误案例和资源成本,而不是只看一个榜单分数。

当前判断的置信度:中高。 方法家族、评测问题和候选入口由多篇 CVPR/ICLR/NeurIPS 论文及 arXiv 主文献交叉支持;“A 最适合当前资源条件”仍是结合你的算力、周期和兴趣做出的研究规划判断,不是论文直接证明的事实。最终选题前仍需用 1—2 周复现 pilot 检验数据、GPU 和导师资源。

本节术语速读

主干网络(backbone)
负责提取图像或文本特征的核心模型。
对照基线(baseline)
新方法必须公平比较的起点方案。
前 K 个结果命中率(Recall@K)
正确答案是否出现在最前面的 K 个结果中。
困难负例(hard negative)
看起来很像正确答案、但关键关系不符合的错误样本。
向量表示(embedding)
把图像或文本转换成可计算相似度的一组数字。
基准评测(benchmark)
用于统一比较方法的数据集、指标和实验规则。

反方证据、局限与可证伪条件

检查点 1:是否存在足以否定方向的证据

目前没有单一结果足以否定图文检索作为研究方向,但有四个会显著削弱结论的风险:标准 benchmark 可能与预训练数据重叠,组合式数据可能存在错误负例,平均 Recall 可能掩盖语言/领域退化,基础模型规模也可能让小改动难以形成稳定增益。上述风险不是附注,而是研究设计必须直接测量的变量。

检查点 2:最强反驳是什么

最强反驳是:双塔、跨编码器、late interaction 和统一 embedding 的主要范式已经成熟,真正的性能提升越来越依赖更大的数据、模型和算力;在标准数据集上做轻量结构改动,可能只是调参或评测过拟合。这个反驳使“换一个 backbone、报一个 Recall@K”不适合作为研究生课题主线。

检查点 3:如何让课题可证伪

可行的课题必须预先写出失败条件:在至少一个标准集、一个组合性诊断集和一个域外/中文集上同时评估;报告 hard negative 的有效性、数据重叠审计、Recall—延迟—索引大小曲线,并加入 text-only、image-only 和简单启发式基线。如果方法只能提升单一 benchmark 或只在更大模型上有效,就应把结论收窄为局部改进,而不是声称获得通用检索能力。

研究生可行的研究入口

前面的 A—D 卡片用于快速选择;本节保留四个候选课题的完整研究设计。第一次阅读可以只看卡片标题和推荐级别,确定兴趣后再展开研究问题、实验、资源与止损条件。

候选课题 A:组合性难负例与评测审计最推荐

展开研究设计收起研究设计
精确研究问题

反事实关系、属性、数量和词序负例,能否区分真正的图文组合性理解与文本/图像捷径?

核心假设

经过人工或规则质量审计的 hard negative 能显著降低“只看关键词/词频”的假提升;但它未必会提升所有开放域 Recall,因此必须把诊断准确率和标准检索分数分开报告。

与已有工作的差异

不把 ARO、Winoground、SugarCrepe 当作单一排行榜,而是构造一个跨数据集、带负例有效性审计和数据重叠记录的评测协议。

基线、数据和指标

CLIP/SigLIP 双塔、一个轻量 cross-encoder;Flickr30K 或 MS COCO + ARO/Winoground/SugarCrepe + 一个小型中文/领域外集;Recall@K、组合性准确率、text-only/image-only 基线、hard-negative 误标率和预训练重叠比例。

最小可行实验

冻结一个公开 CLIP 或 SigLIP,先为 500—2,000 个样本生成四类反事实负例,人工抽样审计,再比较原始 benchmark、增强 benchmark 和简单启发式模型。

3 个月计划

第 1 月复现双塔基线并建立样本/负例 schema;第 2 月完成负例生成、人工审计和 text-only 对照;第 3 月做跨模型、跨数据集误差分析,形成可复现实验包。

6—12 个月计划

扩展到中文或一个专业域,加入多真值和数据污染审计,比较冻结模型、轻量适配和精排模型,形成评测协议或方法论文。

资源、风险与备选

1 张 24GB 级 GPU 可做冻结/轻量训练;主要风险是负例本身错误或任务过于合成;若方法增益不稳定,就把贡献收窄为 benchmark audit、数据卡(data card)和失败模式分析。

投稿与硕士适配

适合优先考虑 SIGIR、ACM MM、CVPR/ICCV workshop,若视觉方法足够扎实再考虑主会;适合作为硕士论文,因为研究问题清晰、算力可控且容易形成连续实验。

候选课题 B:中等算力下的双塔召回与轻量精排推荐

展开研究设计收起研究设计
精确研究问题

在固定 GPU 和图库规模下,单向量双塔、late interaction、多向量表示和轻量 cross-encoder 的准确率—延迟—索引大小折中是什么?

核心假设

双塔负责高召回,局部交互只需要作用于少量候选;合理的候选数、向量压缩和分数校准,可能比更换更大的 backbone 更值得研究。

与已有工作的差异

把模型效果和系统代价放到同一受控表格,报告端到端 latency、内存、索引构建时间和候选数,而不是只比较 Recall@K。

基线、数据和指标

CLIP/SigLIP + FAISS 作为双塔基线,FILIP/ColPali 式 late interaction 和轻量 cross-encoder 作为增强;Flickr30K/MS COCO、CIRR 或 CIRCO、一个视觉文档子集;Recall@K、nDCG、P95 latency、索引大小、吞吐和训练显存。

最小可行实验

冻结图像/文本编码器,只训练投影层或精排头,扫候选数、向量维度、量化方式和精排深度,绘制质量—成本 Pareto 曲线。

3 个月计划

第 1 月统一数据、索引和计时协议;第 2 月实现双塔/late interaction/精排三条 pipeline;第 3 月做消融、跨图库规模测试和失败案例归因。

6—12 个月计划

加入域外图库或中文查询,研究动态候选预算、置信度校准和蒸馏/量化,形成可部署的混合检索系统论文。

资源、风险与备选

1—2 张 24GB 级 GPU 足以进行冻结 backbone 和轻量头训练;风险是工程比较多但学术新意不足;若方法贡献不够,可转向候选预算、校准或可解释证据的明确问题。

投稿与硕士适配

适合 SIGIR、ACM MM、WWW、信息检索或多模态系统方向 workshop;适合作为硕士论文,尤其适合有工程实现和系统评测兴趣的学生。

候选课题 C:中文/多语言与跨领域图文检索条件推荐

展开研究设计收起研究设计
精确研究问题

中文、低资源语言和地域/专业领域变化,究竟通过数据覆盖、翻译策略、对齐损失还是轻量适配影响检索泛化?

核心假设

增加语言和地域多样性可能改善某些跨域检索,但平均分提升不代表每种语言都受益;分语言、分领域和长尾分层是必要条件。

与已有工作的差异

将语言、地域、概念频率和域偏移作为实验因素,避免把“多语言模型在一个英文 benchmark 上的平均分”当成多语言泛化证据。

基线、数据和指标

CLIP/SigLIP、多语言文本编码器和翻译增强基线;公开多语言图文数据、中文网页/商品/文档子集和跨域测试集;按语言/地域/频率分层的 Recall@K、跨语言检索、域外性能、校准和失败率。

最小可行实验

选中文—英文两个语言、一个公开领域和一个外部领域,固定图像编码器,仅比较原始数据、翻译增强、语言平衡采样三种设置。

3 个月计划

第 1 月确定许可和语言分层;第 2 月完成数据质量、去重和 baseline;第 3 月完成跨语言/跨域误差矩阵与长尾分析。

6—12 个月计划

加入低资源语言、领域适配或多语言 hard negative,研究语言公平性、文化覆盖和成本受控的适配方法。

资源、风险与备选

1 张 24GB 级 GPU 可做 adapter/LoRA 或冻结编码器实验;风险是数据许可、标注质量和语言覆盖不足;若无法稳定构造数据,先转为公开数据的评测审计与数据卡研究。

投稿与硕士适配

适合 ACL/EMNLP(语言问题清晰时)、SIGIR、ACM MM;适合作为硕士论文,但前提是能获得稳定的中文/多语言数据和导师指导。

候选课题 D:视觉文档或专业图像的多向量检索应用驱动

展开研究设计收起研究设计
精确研究问题

页面布局、表格、图表和局部视觉证据是否能通过多向量/late interaction 提升专业文档检索,而不是只依靠 OCR 文本?

核心假设

在视觉信息确实重要的文档或专业图像中,多向量表示比纯文本/OCR 更能找回局部证据;但存储、分辨率和标注成本可能抵消收益。

与已有工作的差异

借鉴 ColPali/ViDoRe 的思路,把论文图表、实验截图或体育战术图限定为一个可解释小领域,并同时比较视觉、OCR 和混合检索。

基线、数据和指标

OCR/BM25、CLIP/SigLIP 单向量、ColPali 式多向量;ViDoRe 或许可清晰的 PDF 页面/专业图像集合;Recall@K、nDCG、证据页命中率、局部区域命中率、索引大小和查询延迟。

最小可行实验

先建立 100—500 页、每页 2—5 个 query 的小型多真值集合,固定渲染分辨率,对比 OCR-only、image-only 和 hybrid 三种系统。

3 个月计划

第 1 月确定领域和标注协议;第 2 月完成页面渲染、query/证据页标注和三条 baseline;第 3 月做局部证据、表格/图表和成本消融。

6—12 个月计划

加入领域适配、难例挖掘和可解释局部证据,扩大到跨来源测试,并验证真实用户任务或 RAG(检索增强生成)下游收益。

资源、风险与备选

1—2 张 24GB 级 GPU,主要成本在数据整理和标注;风险是领域过窄、数据许可或人工标注负担;若专业数据难获取,先使用公开视觉文档 benchmark,再把体育战术图作为后续扩展。

投稿与硕士适配

适合 SIGIR、ACM MM、文档分析/多模态应用 workshop;适合作为应用型硕士论文,但需要稳定领域合作或可公开的数据资产。

推荐排序与止损条件

  • 优先顺序:没有特定资源时先做 A;偏系统工程时做 B;已有稳定多语言数据或专业场景时再做 C / D。
  • 不要作为首个课题:从零训练十亿级模型、只换主干网络(backbone),或只在一个标准数据集上报告前 K 个结果命中率(Recall@K)。
  • 三个月止损信号:无法稳定复现对照基线(baseline);新增负例经常被人工判为错误;改进只出现在单一数据集或更大模型;或者查询速度与存储成本明显差于已有方案。
  • 调整方式:模型创新证据不足时,把课题收窄为评测审计、数据质量、失败模式或成本—质量取舍,不要继续堆叠模块。

证据基础

开放问题

相关页面