协议状态
- Topic:topics/image-editing
- 当前阶段:
scoped_review - 协议冻结日期:2026-07-15
- 最后检索:2026-07-15 完成一次定向缺口扫描;详见 docs/research-monitoring/daily/2026-07-15-image-editing
- 时间窗口:2022—2026,另纳入不可替代的奠基论文
- 编译责任:自动任务可发现候选和生成草稿,Hermes 负责正式编译与阶段升级
研究问题与边界
主问题
在真实图像的指令式编辑(instruction-based image editing)中,哪些方法和评测协议能够在可控计算成本下,同时提高“该改变内容”的命中率与“未编辑内容”的保持性?
子问题
- 反演(inversion)、直接编辑、主体/示例编辑和统一生成—编辑模型分别在哪些输入与预算下占优?
- 现有指标能否把编辑命中、背景/身份保持、局部结构、文字与人评区分开?
- 少步或一步编辑的端到端收益,在计入反演、引导、解码、训练和失败重试后是否仍成立?
- 哪些问题适合中等算力、公开数据和两到三年研究周期,哪些方向已经过于拥挤或依赖不可得资源?
纳入范围
- 文本指令、参考图、主体、局部区域或结构条件驱动的 2D 图像编辑;
- 真实图像反演、编辑保持性、编辑数据与 benchmark、统一生成—编辑、少步/一步编辑;
- 会直接改变编辑结论的评测、数据污染、身份/版权与失败模式研究;
- 2022—2026 正式论文与高相关预印本,以及少量 2022 年前奠基来源。
排除范围
- 纯文本到图像生成、无源图保持要求的重生成;
- 仅讨论视频时间一致性且没有可迁移图像编辑证据的工作;
- 只提供产品演示、无法核验方法/数据/评测的页面;
- 只在不同底座或不同数据上报告单点提升、无法支撑机制比较的工作;
- 重复版本:同一论文优先保留正式会议/期刊版本,预印本作为补充链接。
搜索策略(已冻结并启动)
| 来源库 | 检索式 | 计划用途 |
|---|---|---|
| CVF Open Access | ("image editing" OR "instruction-based image editing" OR "text-guided image editing") AND (evaluation OR benchmark OR inversion OR consistency) | CVPR / ICCV / WACV 正式论文 |
| arXiv | all:(image editing) AND (instruction OR inversion OR benchmark OR evaluation OR consistency) AND submittedDate:[20220101 TO 20261231] | 最新预印本与正式版本线索 |
| OpenReview | image editing instruction inversion evaluation benchmark,限定 ICLR / NeurIPS / TMLR | 补充正式评审来源与版本核对 |
| 本地交叉年份目录 | image-editing、image-generation、evaluation-benchmark bucket | corpus-first 去重与缺口发现 |
| 引文追踪 | 从 InstructPix2Pix、Prompt-to-Prompt、Null-text Inversion、EditBench、AnyEdit 向前/向后追踪 | 奠基与关键反证补全 |
纳入、排除与去重
- 纳入标准:直接回答至少一个子问题;有可核验原文;方法、数据或评测足以抽取;对当前方法族、反证或研究入口有增量。
- 排除标准:主题外、重复、无原始证据、仅定性样例且无可核验设置、结论无法与图像编辑区分。
- 去重键:DOI → arXiv ID → 规范化标题;正式版本与预印本合并为同一 source note。
- 来源优先级:官方论文 PDF / CVF / OpenReview → arXiv → 项目页或官方代码;二级来源不能覆盖主文结论。
当前 corpus-first 基线
- Topic 已链接 32 篇 paper source notes;32/32 有本地 PDF、可检索全文和
analysis.md。 - 当前语料主要覆盖 2021—2025,其中 30 篇位于 2022—2025。
- 逐篇分析深度中位数约 8 KB,明显高于仅有摘要级核验的条目。
- 当前主要缺口不是“没有全文”,而是尚无可复现的检索日志、筛选流、排除理由和近 2026 缺口核验。
- 图像生成与视频编辑存在少量交叉来源;正式综合时必须区分图像编辑直接证据与跨任务背景。
筛选流
| 阶段 | 数量 | 说明 |
|---|---|---|
| 本地候选基线 | 32 | 当前 Topic source list |
| 外部初始发现 | 10 个优先候选 + 4 个后备 | 2026-07-15 定向缺口扫描;不是完整数据库导出,不作为 PRISMA 数量 |
| 去重后 | 10 个优先候选 | 已完成本地标题级去重;正式版/预印本合并仍待 Hermes 核验 |
| 标题/摘要初筛后 | 10 | 均直接对应方法、评测、成本或反证子问题 |
| 全文核验后 | 0(待编译) | 本轮只做官方元数据、摘要和少量正文片段核验,不把候选冒充全文深读 |
| 核心语料 | 现有 32 | 新候选尚未进入核心语料;目标仍为 25–40 篇高价值来源,不以凑数为目标 |
证据矩阵与综合方法
每篇核心论文抽取:任务接口、源图类型、方法家族、是否需要反演、训练数据、评测数据与划分、编辑/保持指标、端到端成本、消融、人评、失败模式、来源等级和对研究入口的影响。综合按“保持—改变、反演—直接编辑、专用—统一、质量—成本、自动指标—人评”五组张力组织。
阶段升级门
- 升级到
systematic_review:外部检索与去重完成;所有最终来源通过版本、venue 和原文核验;筛选数与排除理由可复查。 - 升级到
decision_ready:完成最强反驳、至少一个反证性 Claim、开放 Questions、A—D 研究入口和资源/止损审查;页面及 Viewer 通过完整质量门。
已知盲区与更新条件
- 2026 年正式会议论文尚未全部进入本地语料;本轮已确认 Inter-Edit、Kontinuous Kontext、ReasonEdit、HP-Edit、IF-Edit 等缺口,必须先核验官方 PDF 再编译。
- 2025—2026 新 benchmark 已把连续控制、复杂/隐式指令、多轮退化、人类偏好、指代表达和低负担空间交互带入评测;这些目前只是待验证候选维度。
- 闭源商业编辑模型训练数据与成本不可得,只能作为受限背景,不能承担因果结论。
- 中文、文字密集图和专业图像数据仍可能不足,应用驱动建议必须标注数据前提。
- 下一次更新触发:CVPR / ICCV / ECCV / NeurIPS / ICLR 新论文、关键 benchmark、撤稿/勘误,或直接否定当前保持—改变判断的新证据。