当前判断
图文检索(Image-Text Retrieval)
研究用图像与文本互相检索、组合查询和统一多模态向量表示,重点关注可扩展性、细粒度对齐、数据分布与评测可靠性。
阅读路径
- 问题明确任务与证据边界
- 方法比较方法族与结构选择
- 证据回到论文与可检索全文
- 开放问题记录仍待验证的张力
研究方法族地图
从问题定义走向可复核的系统能力
三分钟摘要
图文检索研究两类基本方向:用文本找图(text-to-image retrieval, T2I)和用图找文本(image-to-text retrieval, I2T)。在更复杂的设置中,查询可以是“参考图像 + 修改文本”(composed image retrieval),目标也可以是图片、文本、网页或文档页面。本页用于判断这个方向的技术主线、公开数据/评测和适合研究生切入的难点。
- 它是什么:把图像、文本或“图像 + 修改指令”映射到可比较的表示,再从候选库中找回最相关结果。
- 现在做到哪里:双编码器已经是大规模召回底座,细粒度交互、组合式查询和统一多模态向量仍处于快速发展期。
- 真正难点:标准 Recall@K 可能掩盖组合性失败、错误负例、预训练数据重叠、跨语言退化和高昂索引成本。
- 研究判断:有限算力下,比“再训练一个更大的模型”更可行的是可靠评测、难负例、轻量精排与专业领域视觉证据检索。
- 证据阶段:已冻结正式检索协议并完成40 篇证据矩阵,当前为
scoped_review;外部检索和排除日志尚未完成,不能声称系统覆盖。
任务或系统流程
一个可靠的图文检索系统如何把高召回、细粒度匹配与成本约束连接起来?
第一阶段生成可离线索引的共享表示并召回候选,第二阶段只对少量候选做局部交互或精排,最后同时报告结果质量、证据位置和系统成本。
- 查询输入文本、图像,或参考图像加修改指令
- 共享表示双编码器独立计算向量,支持离线建库
- 候选召回近似最近邻索引保留高召回候选
- 局部交互多向量、late interaction 或跨编码器识别细粒度关系
- 可复核输出同时报 Recall、错误案例、延迟、吞吐与索引大小
查询经过图像与文本编码形成共享表示,向量索引召回候选,再由局部交互或跨编码器精排,最后输出结果、局部证据和质量成本指标。
当前综合判断
1. 双编码器已经是可扩展基线,但不是完整答案
CLIP 与 ALIGN 证明,图像编码器和文本编码器分别输出共享向量,再通过对比学习训练,可以在大规模图库中离线建索引,并在 Flickr30K、MS COCO 等标准任务上取得强结果(CLIP、ALIGN)。SigLIP 进一步把重点放到损失和训练通信成本,说明双塔路线仍然是工程底座,而不是已经被淘汰的旧方法(SigLIP)。
但双塔分数通常是全局语义相似度。它可以判断“狗在雪地里”大体相关,却不一定稳定区分对象—属性归属、词序、数量或空间关系。ARO、Winoground 与 SugarCrepe 的结果共同说明,标准 Recall 高不能直接解释为组合性理解(ARO、Winoground、SugarCrepe)。
2. 主流系统正在形成“召回 + 精排/多向量”的混合形态
ALBEF 采用先对齐再融合的结构:双塔做大范围对齐,cross-encoder 对候选做更细匹配;FILIP 则用 patch—token late interaction 在细粒度和预计算之间折中(ALBEF、FILIP)。ColPali 把这一思路扩展到视觉文档,用页面图像的多向量表示和 late interaction 处理布局、表格与字体信息(ColPali)。
这形成一个清晰的系统分解:第一阶段追求高召回、低延迟、可压缩索引;第二阶段追求关系/局部对齐与可解释证据。研究价值往往在两阶段之间的负例、分数校准、索引成本和域外可靠性,而不是只把 backbone 换大。
3. 组合式查询是最明确的任务切口之一
FashionIQ 用自然语言反馈描述“保留什么、改变什么”;CIRR 将任务扩展到开放域真实图像;SEARLE 使用 pseudo-word 和 CLIP 共享空间做零样本 CIR,并用 CIRCO 的多真值标注缓解单一 ground truth 的问题(FashionIQ、CIRR、SEARLE/CIRCO)。
这个方向比普通 caption retrieval 更接近交互式搜索,也有公开数据和可重复指标;但它仍受到目标多样性、合理负例、域偏移和用户满意度缺失的约束。小团队可以围绕一个明确域(例如商品、论文页面、体育战术图)做数据构造、难例和评测,而不必从零训练图文基础模型。
4. 数据分布和评测协议已经成为一等研究变量
LAION-5B 和 DataComp 让研究者可以讨论数据规模、过滤、去重、语言和计算预算;BLIP 说明 caption 自举/过滤也会改变监督质量(LAION-5B、DataComp、BLIP)。多语言多样性研究进一步指出,加入翻译后的非英语数据不仅影响多语任务,也可能改善英语检索和地域分布变化(Multilingual Diversity)。
同时,No Zero-Shot Without Exponential Data 通过概念频率分析提醒我们:下游概念可能已经出现在预训练数据中,所谓 zero-shot 结果需要做重叠/频率审计(No Zero-Shot Without Exponential Data)。因此,新的方法如果只在 Flickr30K/MS COCO 上报一个 Recall@K,而不报告数据重叠、长尾、语言和 hard-negative 对照,证据强度有限。
5. 统一多模态 embedding 是前沿,但“通用”仍待验证
UniIR 用 instruction 把八类检索任务合并到一个系统,并提出 M-BEIR;VLM2Vec 则把已有 VLM 训练成可处理图像、文本和组合指令的固定维向量模型(UniIR/M-BEIR、VLM2Vec/MMEB)。这条路线有明显研究空间:任务意图建模、跨任务负例、域外泛化和向量索引效率。
但统一 benchmark 的平均分可能掩盖某一任务或语言退化;生成式 VLM 的显存和推理成本也可能抵消向量检索的优势。当前更稳妥的表述是“统一 embedding 是可研究的趋势”,而不是“已经找到通用检索器”。
近五年演化(2022—2026)
本轮新增核验了 20 篇 2022—2026 年的论文,与原有 20 篇基础、组合式检索、数据和评测论文合起来形成 40 篇专题主语料。结论不是“图文检索已经没有空间”,而是研究问题正在从“能不能把图和文对齐”转向“在什么任务、什么数据和什么成本约束下,表示真的可靠”。
2022—2026 年图文检索的研究问题发生了什么变化?
时间线不是按模型数量罗列论文,而是展示研究焦点如何从表示扩展到组合查询、统一向量、视觉文档与可靠性审计。
- 2022零样本组合式检索与细粒度对齐成为独立任务
- 2023数据筛选、训练配方与轻量双编码器进入系统化比较
- 2024统一多模态 embedding 与视觉文档多向量检索形成新系统路线
- 2025多语言、跨任务、显式负例与多真值评测暴露平均分盲点
- 2026研究价值转向可靠性、专业域证据与质量—成本边界
2022 年组合式和细粒度检索兴起,2023 年训练效率与数据质量加强,2024 年统一多模态向量和视觉文档检索发展,2025 至 2026 年转向跨任务可靠性与成本验证。
方法家族与成熟阶段
方法家族的成熟度
双编码器与训练配方
CLIP/ALIGN/SigLIP 之后,SigLIP 2、MobileCLIP、DCI、FuseMix 持续优化训练、蒸馏和效率。
受控的语言/领域泛化、数据质量和成本曲线,而不是继续盲目更换 backbone。
细粒度对齐与混合检索
FILIP、ALBEF、MSRM、CPRD、ColPali、VisRAG 已形成“召回 + 局部交互/精排”路线。
验证 hard negative 是否有效,并量化候选预算、late interaction 索引成本与可解释证据。
组合式图像检索(CIR)
Pic2Word、LinCIR、KEDs、生成式 ZS-CIR、CoLLM 从 pseudo token、组合 embedding、伪目标图和 LLM 数据增强持续推进。
多真值、自然 query、改写鲁棒性、多图组合与跨领域泛化。
统一多模态 embedding
UniIR/M-BEIR、VLM2Vec、E5-V、MIEB 正把多个任务放入统一向量框架。
分任务/分语言报告、平均分之外的退化、索引规模与 VLM 推理成本。
数据与评测可靠性
ARO、Winoground、SugarCrepe、CoLA、CIR robustness、No Zero-Shot、PinPoint 已暴露错误负例、多真值、预训练重叠、paraphrase 与显式负例问题。
建立能反映真实用户行为的指标、负例质量审计和可复核的数据污染记录。
视觉文档与专业图像
ColPali、VisRAG、MIRACL-VISION、ViDoRe 显示应用快速增长,但跨数据集结论仍不统一。
只在视觉信息无法由 OCR 完整表达的页面上证明收益,并同时报告 OCR、文本、视觉与混合检索成本。
各方法家族分别解决检索链路中的哪一类问题?
双编码器负责规模,局部交互和跨编码器负责精度,组合式与统一向量改变查询空间,数据与评测方法负责判断提升是否可信。
- 双编码器召回独立编码与离线索引,适合大规模候选库
- 局部多向量patch—token 匹配保留局部证据,代价是索引膨胀
- 跨编码器精排联合注意力提升关系判断,只适合少量候选
- 组合式查询把参考图像与修改文本合成为目标意图
- 统一多模态向量用指令统一不同查询和目标模态,但需分任务验收
- 数据与可靠性审计负例、多真值、语言分布和预训练重叠
方法图以双编码器召回为底座,上接局部多向量与跨编码器精排,旁接组合式查询和统一多模态向量,并由数据评测可靠性贯穿所有分支。
方法家族比较表
| 方法家族 | 核心机制 | 适合解决的问题 | 主要代价/风险 |
|---|---|---|---|
| 双编码器(dual encoder) | 图像、文本独立编码,共享空间对比学习 | 大规模召回、离线索引、零样本迁移 | 全局表示弱于细粒度关系;依赖数据规模 |
| 跨编码器(cross encoder) | 候选图文联合 cross-attention | 精排、局部匹配、关系判断 | 每个候选都计算,延迟高 |
| 混合召回 + 精排 | 双塔初筛,cross encoder/ITM 重排 | 工业检索与准确率—效率折中 | 系统复杂,需要校准候选数 |
| Late interaction / 多向量 | patch/token 独立表示,查询时局部匹配 | 细粒度对齐、文档布局、局部证据 | 索引存储和打分成本更高 |
| 组合式检索(CIR) | 参考图 + 修改文本 | 交互式商品/开放域图像搜索 | 标注昂贵、多真值和域偏移 |
| 统一指令 embedding | instruction 指定 query/target 模态与任务 | 跨任务、跨模态、RAG/多模态搜索 | 任务混合、成本、平均分掩盖退化 |
| 数据/评测方法 | 过滤、去重、hard negative、反事实 benchmark | 解决噪声、长尾、捷径和污染 | 需要完整审计,容易把错误负例当真值 |
拥挤方向与研究机会
如果你刚进入这个方向,先不要从模型名称或榜单分数开始。先判断自己拥有多少算力、数据和领域资源,再选择能被实验明确证伪的问题。
先看结论
推荐路线
按现有资源选择 A—D
先选 A,研究模型是真的理解图文关系,还是只靠关键词猜答案。
选 B,但必须同时证明结果质量、速度和存储成本的改进。
再考虑 C;没有可靠数据时,不要先做模型创新。
再考虑 D,并先确认表格、图表、布局等视觉信息确实不可被文字识别完整替代。
先避开
只换模型、只刷一个分数
只更换主干网络(backbone)、只报告前 K 个结果命中率(Recall@K)、只增加一个简单查询融合模块,或从零训练超大图文模型。
强模型已经把标准数据集分数抬得很高;单个数据集上的小幅提升,无法证明模型更懂图文关系,也可能来自数据重叠或调参。
同时检查错误案例、跨数据集稳定性、运行成本和数据污染,明确方法在哪些情况下有效、在哪些情况下失败。
四个研究入口怎么选
检查模型是真的理解,还是在猜关键词
设计困难负例(hard negative)和可靠评测,识别模型是否理解对象、属性、数量、词序与空间关系。
刚入门、算力有限,希望先形成一个边界清晰且可连续迭代的问题。
冻结公开模型,在一个标准检索集和一个组合性诊断集上复现结果,再人工检查新增负例是否正确。
问题在至少两个模型或两个数据集上稳定出现,而且负例质量通过人工抽样审计。
让检索系统在有限算力下又快又准
比较快速召回与精细重排的组合,研究准确率、查询速度和索引大小之间的取舍。
喜欢系统工程,愿意做完整实现、计时和资源测量,而不只是训练一个新模块。
固定同一个图文模型,比较单向量召回、局部交互和轻量精排三条流程。
在相近成本下结果更好,或在相近结果下明显更快、更省存储。
找出中文、多语言或跨领域为什么失效
不只看平均分,而是分别检查不同语言、长尾概念和领域变化造成的性能下降。
能稳定获得许可清晰、质量可检查的中文、多语言或专业领域数据。
先做中文/英文、领域内/领域外四组对照,固定图像模型,只改变数据或语言处理方式。
数据量足够支撑分组比较,而且差异不能用翻译质量或样本重复简单解释。
检索文字识别看不全的视觉证据
重点检索表格、图表、页面布局和局部区域,而不是默认视觉模型一定优于文字识别(OCR)。
拥有论文页面、实验截图、体育战术图等明确场景,并能完成少量人工标注。
先做 100—500 页小数据集,对比仅文字识别、仅图像和图文混合三类对照基线(baseline)。
视觉或混合方法只在“视觉信息确实重要”的子集上稳定胜出,并且存储与查询成本可接受。
对“能否作为研究生方向”的修订结论
图文检索可以作为研究生研究方向,但新手不应先问“换哪个模型”,而应先问“我能验证哪一种失败”。默认优先 A;偏系统工程时选择 B;只有在数据或专业场景稳定可得时,才优先考虑 C 或 D。所有路线都应同时报告检索结果、错误案例和资源成本,而不是只看一个榜单分数。
当前判断的置信度:中高。 方法家族、评测问题和候选入口由多篇 CVPR/ICLR/NeurIPS 论文及 arXiv 主文献交叉支持;“A 最适合当前资源条件”仍是结合你的算力、周期和兴趣做出的研究规划判断,不是论文直接证明的事实。最终选题前仍需用 1—2 周复现 pilot 检验数据、GPU 和导师资源。
本节术语速读
- 主干网络(backbone)
- 负责提取图像或文本特征的核心模型。
- 对照基线(baseline)
- 新方法必须公平比较的起点方案。
- 前 K 个结果命中率(Recall@K)
- 正确答案是否出现在最前面的 K 个结果中。
- 困难负例(hard negative)
- 看起来很像正确答案、但关键关系不符合的错误样本。
- 向量表示(embedding)
- 把图像或文本转换成可计算相似度的一组数字。
- 基准评测(benchmark)
- 用于统一比较方法的数据集、指标和实验规则。
反方证据、局限与可证伪条件
检查点 1:是否存在足以否定方向的证据
目前没有单一结果足以否定图文检索作为研究方向,但有四个会显著削弱结论的风险:标准 benchmark 可能与预训练数据重叠,组合式数据可能存在错误负例,平均 Recall 可能掩盖语言/领域退化,基础模型规模也可能让小改动难以形成稳定增益。上述风险不是附注,而是研究设计必须直接测量的变量。
检查点 2:最强反驳是什么
最强反驳是:双塔、跨编码器、late interaction 和统一 embedding 的主要范式已经成熟,真正的性能提升越来越依赖更大的数据、模型和算力;在标准数据集上做轻量结构改动,可能只是调参或评测过拟合。这个反驳使“换一个 backbone、报一个 Recall@K”不适合作为研究生课题主线。
检查点 3:如何让课题可证伪
可行的课题必须预先写出失败条件:在至少一个标准集、一个组合性诊断集和一个域外/中文集上同时评估;报告 hard negative 的有效性、数据重叠审计、Recall—延迟—索引大小曲线,并加入 text-only、image-only 和简单启发式基线。如果方法只能提升单一 benchmark 或只在更大模型上有效,就应把结论收窄为局部改进,而不是声称获得通用检索能力。
研究生可行的研究入口
前面的 A—D 卡片用于快速选择;本节保留四个候选课题的完整研究设计。第一次阅读可以只看卡片标题和推荐级别,确定兴趣后再展开研究问题、实验、资源与止损条件。
候选课题 A:组合性难负例与评测审计最推荐
展开研究设计收起研究设计
反事实关系、属性、数量和词序负例,能否区分真正的图文组合性理解与文本/图像捷径?
经过人工或规则质量审计的 hard negative 能显著降低“只看关键词/词频”的假提升;但它未必会提升所有开放域 Recall,因此必须把诊断准确率和标准检索分数分开报告。
不把 ARO、Winoground、SugarCrepe 当作单一排行榜,而是构造一个跨数据集、带负例有效性审计和数据重叠记录的评测协议。
CLIP/SigLIP 双塔、一个轻量 cross-encoder;Flickr30K 或 MS COCO + ARO/Winoground/SugarCrepe + 一个小型中文/领域外集;Recall@K、组合性准确率、text-only/image-only 基线、hard-negative 误标率和预训练重叠比例。
冻结一个公开 CLIP 或 SigLIP,先为 500—2,000 个样本生成四类反事实负例,人工抽样审计,再比较原始 benchmark、增强 benchmark 和简单启发式模型。
第 1 月复现双塔基线并建立样本/负例 schema;第 2 月完成负例生成、人工审计和 text-only 对照;第 3 月做跨模型、跨数据集误差分析,形成可复现实验包。
扩展到中文或一个专业域,加入多真值和数据污染审计,比较冻结模型、轻量适配和精排模型,形成评测协议或方法论文。
1 张 24GB 级 GPU 可做冻结/轻量训练;主要风险是负例本身错误或任务过于合成;若方法增益不稳定,就把贡献收窄为 benchmark audit、数据卡(data card)和失败模式分析。
适合优先考虑 SIGIR、ACM MM、CVPR/ICCV workshop,若视觉方法足够扎实再考虑主会;适合作为硕士论文,因为研究问题清晰、算力可控且容易形成连续实验。
候选课题 B:中等算力下的双塔召回与轻量精排推荐
展开研究设计收起研究设计
在固定 GPU 和图库规模下,单向量双塔、late interaction、多向量表示和轻量 cross-encoder 的准确率—延迟—索引大小折中是什么?
双塔负责高召回,局部交互只需要作用于少量候选;合理的候选数、向量压缩和分数校准,可能比更换更大的 backbone 更值得研究。
把模型效果和系统代价放到同一受控表格,报告端到端 latency、内存、索引构建时间和候选数,而不是只比较 Recall@K。
CLIP/SigLIP + FAISS 作为双塔基线,FILIP/ColPali 式 late interaction 和轻量 cross-encoder 作为增强;Flickr30K/MS COCO、CIRR 或 CIRCO、一个视觉文档子集;Recall@K、nDCG、P95 latency、索引大小、吞吐和训练显存。
冻结图像/文本编码器,只训练投影层或精排头,扫候选数、向量维度、量化方式和精排深度,绘制质量—成本 Pareto 曲线。
第 1 月统一数据、索引和计时协议;第 2 月实现双塔/late interaction/精排三条 pipeline;第 3 月做消融、跨图库规模测试和失败案例归因。
加入域外图库或中文查询,研究动态候选预算、置信度校准和蒸馏/量化,形成可部署的混合检索系统论文。
1—2 张 24GB 级 GPU 足以进行冻结 backbone 和轻量头训练;风险是工程比较多但学术新意不足;若方法贡献不够,可转向候选预算、校准或可解释证据的明确问题。
适合 SIGIR、ACM MM、WWW、信息检索或多模态系统方向 workshop;适合作为硕士论文,尤其适合有工程实现和系统评测兴趣的学生。
候选课题 C:中文/多语言与跨领域图文检索条件推荐
展开研究设计收起研究设计
中文、低资源语言和地域/专业领域变化,究竟通过数据覆盖、翻译策略、对齐损失还是轻量适配影响检索泛化?
增加语言和地域多样性可能改善某些跨域检索,但平均分提升不代表每种语言都受益;分语言、分领域和长尾分层是必要条件。
将语言、地域、概念频率和域偏移作为实验因素,避免把“多语言模型在一个英文 benchmark 上的平均分”当成多语言泛化证据。
CLIP/SigLIP、多语言文本编码器和翻译增强基线;公开多语言图文数据、中文网页/商品/文档子集和跨域测试集;按语言/地域/频率分层的 Recall@K、跨语言检索、域外性能、校准和失败率。
选中文—英文两个语言、一个公开领域和一个外部领域,固定图像编码器,仅比较原始数据、翻译增强、语言平衡采样三种设置。
第 1 月确定许可和语言分层;第 2 月完成数据质量、去重和 baseline;第 3 月完成跨语言/跨域误差矩阵与长尾分析。
加入低资源语言、领域适配或多语言 hard negative,研究语言公平性、文化覆盖和成本受控的适配方法。
1 张 24GB 级 GPU 可做 adapter/LoRA 或冻结编码器实验;风险是数据许可、标注质量和语言覆盖不足;若无法稳定构造数据,先转为公开数据的评测审计与数据卡研究。
适合 ACL/EMNLP(语言问题清晰时)、SIGIR、ACM MM;适合作为硕士论文,但前提是能获得稳定的中文/多语言数据和导师指导。
候选课题 D:视觉文档或专业图像的多向量检索应用驱动
展开研究设计收起研究设计
页面布局、表格、图表和局部视觉证据是否能通过多向量/late interaction 提升专业文档检索,而不是只依靠 OCR 文本?
在视觉信息确实重要的文档或专业图像中,多向量表示比纯文本/OCR 更能找回局部证据;但存储、分辨率和标注成本可能抵消收益。
借鉴 ColPali/ViDoRe 的思路,把论文图表、实验截图或体育战术图限定为一个可解释小领域,并同时比较视觉、OCR 和混合检索。
OCR/BM25、CLIP/SigLIP 单向量、ColPali 式多向量;ViDoRe 或许可清晰的 PDF 页面/专业图像集合;Recall@K、nDCG、证据页命中率、局部区域命中率、索引大小和查询延迟。
先建立 100—500 页、每页 2—5 个 query 的小型多真值集合,固定渲染分辨率,对比 OCR-only、image-only 和 hybrid 三种系统。
第 1 月确定领域和标注协议;第 2 月完成页面渲染、query/证据页标注和三条 baseline;第 3 月做局部证据、表格/图表和成本消融。
加入领域适配、难例挖掘和可解释局部证据,扩大到跨来源测试,并验证真实用户任务或 RAG(检索增强生成)下游收益。
1—2 张 24GB 级 GPU,主要成本在数据整理和标注;风险是领域过窄、数据许可或人工标注负担;若专业数据难获取,先使用公开视觉文档 benchmark,再把体育战术图作为后续扩展。
适合 SIGIR、ACM MM、文档分析/多模态应用 workshop;适合作为应用型硕士论文,但需要稳定领域合作或可公开的数据资产。
推荐排序与止损条件
- 优先顺序:没有特定资源时先做 A;偏系统工程时做 B;已有稳定多语言数据或专业场景时再做 C / D。
- 不要作为首个课题:从零训练十亿级模型、只换主干网络(backbone),或只在一个标准数据集上报告前 K 个结果命中率(Recall@K)。
- 三个月止损信号:无法稳定复现对照基线(baseline);新增负例经常被人工判为错误;改进只出现在单一数据集或更大模型;或者查询速度与存储成本明显差于已有方案。
- 调整方式:模型创新证据不足时,把课题收窄为评测审计、数据质量、失败模式或成本—质量取舍,不要继续堆叠模块。
证据基础
- 检索与筛选协议:图文检索检索与综合协议。
- 逐篇证据矩阵:40 篇证据矩阵;40/40 为
reviewed,均有 PDF、可检索全文和独立分析。 - 基础双塔:CLIP、ALIGN、SigLIP。
- 细粒度/混合架构:FILIP、ALBEF、ColPali。
- 数据与训练:BLIP、LAION-5B、DataComp、多语言多样性。
- 组合式检索:FashionIQ、CIRR、SEARLE/CIRCO。
- 组合性与可靠性:ARO、Winoground、SugarCrepe、No Zero-Shot Without Exponential Data。
- 统一 embedding:UniIR/M-BEIR、VLM2Vec/MMEB。
- 近五年双塔与效率:CLIP4CIR、Pic2Word、MSRM、VILEM、SigLIP 2、MobileCLIP、DCI、FuseMix。
- 近五年 CIR 与精排:LinCIR、KEDs、CPRD、CoLLM、Generative ZS-CIR。
- 近五年统一 embedding 与视觉文档:E5-V、MIEB、VisRAG、MIRACL-VISION。
- 近五年可靠性评测:CoLA、CIR Robustness、PinPoint。
开放问题
- 哪个子方向最适合在中等算力和两三年周期内形成连续研究
- 细粒度图文对齐如何兼顾索引效率
- 怎样构造既难又不错误的负例
- 统一向量模型是否真的跨任务、跨语言泛化
- 如何审计预训练重叠、概念频率与 benchmark 污染