标签
#autoregressive
#benchmark
- 视频编辑理解实体
#benchmarking
- AIGV-Assessor:用大模型评测文本到视频生成感知质量来源笔记
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- AthletePose3D:高速竞技动作的 3D 姿态与运动学验证来源笔记
- AthleticsPose:真实田径动作的 3D 姿态与部署边界来源笔记
- Broadcast2Pitch:从非受控足球转播视频重建比赛状态来源笔记
- CIRR:用预训练视觉语言模型检索真实世界图像(Image Retrieval on Real-life Images)来源笔记
- COLA:组合式文本到图像检索基准(A Benchmark for Compositional Text-to-image Retrieval)来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- ConCon-Chi:个性化视觉语言的新含义与组合性基准来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- EvalCrafter:大视频生成模型的多维评测与人工偏好校准来源笔记
- FashionIQ:用自然语言反馈检索图像(A New Dataset Towards Retrieving Images by Natural Language Feedback)来源笔记
- FiVE-Bench:细粒度视频编辑评测基准来源笔记
- FineDiving Repository:FineDiving 仓库提供数据集与代码入口。来源笔记
- FineGym:体操视频的层级细粒度动作理解来源笔记
- FineSports:多人篮球的层级细粒度时空动作定位来源笔记
- FlashEval:用代表性 prompt 子集加速文本到图像模型评测来源笔记
- GANs Trained by a Two Time-Scale Update Rule:FID 的来源与边界来源笔记
- GlitchBench:大型多模态模型能否识别电子游戏故障来源笔记
- HallusionBench:视觉语言幻觉与视觉错觉诊断基准来源笔记
- Imagen Editor 与 EditBench:推进并评测文本引导图像修补来源笔记
- Improved Techniques for Training GANs:Inception Score 的来源与边界来源笔记
- LOGO:多人长视频的群体动作质量评估来源笔记
- LVBench:极长视频理解基准来源笔记
- M-BEIR 多模态检索评测(M-BEIR)实体
- MAPLM:地图与交通场景的真实世界多模态问答基准来源笔记
- MIEB:大规模图像 embedding 评测基准(Massive Image Embedding Benchmark)来源笔记
- MIRACL-VISION:大规模多语言视觉文档检索基准来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- MVBench:综合多模态视频理解基准来源笔记
- MultiSports:多人时空动作定位的数据锚点来源笔记
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- OpenCap:OpenCap 用智能手机视频估计人体运动学与动力学,降低实验室级运动捕捉门槛。来源笔记
- PinPoint:带显式负例、多图查询与改写测试的组合式图像检索评测来源笔记
- RefereeBench:多运动项目规则化视频裁判评测来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- STI-Bench:精确时空世界理解基准来源笔记
- ShuttleSet:人工标注的羽毛球单打 stroke-level 数据集来源笔记
- SoccerNet 2022 Challenges Results:足球视频理解挑战早期基线来源笔记
- SoccerNet 2023 Challenges Results:足球视频多任务挑战结果来源笔记
- SoccerNet Action Spotting:SoccerNet action spotting 是足球视频事件定位的核心公开任务入口。来源笔记
- SoccerNet-Tracking:足球多目标跟踪数据集与基准来源笔记
- SoccerNet-v2:广播足球内容、剪辑与回放理解基准来源笔记
- Sports-QA:复杂专业体育视频问答基准来源笔记
- SportsHHI:体育视频中的高层人—人交互检测基准来源笔记
- SportsMOT Dataset Page:SportsMOT 官方数据页记录数据下载、许可和基准说明。来源笔记
- SportsMOT:多运动场景的大规模球员多目标跟踪基准来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- TeamTrack:全场视角的多运动多目标跟踪数据集来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- VARS:SoccerNet-MVFoul 多视角犯规分类与裁判辅助来源笔记
- VBench:视频生成模型综合评测套件来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- Video-Bench:人类偏好对齐的视频生成评测来源笔记
- WEAR:户外健身的第一视角视频与四肢 IMU 数据集来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- 一张图胜过 77 个文本 token:在密集描述上评估 CLIP 类模型(A Picture is Worth More Than 77 Text Tokens)来源笔记
- 图文检索与组合性评测集(Image-Text Retrieval Benchmarks)实体
- 图文检索的主要瓶颈仍包括数据质量、分布与概念覆盖判断
- 数据集、评测指标与基准可靠性主题
- 文本—图像组合式检索的鲁棒性基准(Benchmarking Robustness of Text-Image Composed Retrieval)来源笔记
- 文本到图像生成的可验证与可复现人工评测来源笔记
- 标准图文检索分数不足以证明组合性理解判断
- 现有评测是否真的刻画了视频编辑理解能力问题
- 生成模型评测主题
- 组合式查询是图文检索中可落地且仍有缺口的研究切口判断
- 运动定义文字的人机感知差距能否成为可靠研究基准问题
- 通用 Vid-LLM 在视频剪辑元素识别、推理与功能判断上仍明显不足判断
- 通过形式化验证评测文本到视频模型的神经符号方法来源笔记
#classification
#conditioning
- AVID:用 Temporal MultiDiffusion 做任意长度视频修补来源笔记
- Attention Calibration for Disentangled Text-to-Image Personalization:解耦式个性化注意力校准来源笔记
- BBDM:以 Brownian Bridge 端点过程建模成对图像翻译来源笔记
- Blended Diffusion:在像素扩散过程中逐步混合文本编辑前景与原图背景来源笔记
- C3Net:CoDi U-Net 上的图像、文本与音频复合条件协调来源笔记
- CCEdit:以结构—外观解耦实现创意可控视频编辑来源笔记
- CONFORM:以对比式注意力优化提升文本生成忠实度来源笔记
- CoLLM:用于组合式图像检索的大语言模型来源笔记
- Concept Weaver:模板引导的多概念个性化融合来源笔记
- Condition-Aware Neural Network:以动态权重控制扩散 Transformer来源笔记
- Custom Diffusion:高效单概念学习与多概念组合来源笔记
- Customization Assistant:可对话的单图免微调个性化生成来源笔记
- DLT:以联合离散—连续 Transformer diffusion 做属性级布局生成来源笔记
- DiffusionCLIP:CLIP 引导的 diffusion U-Net 文本图像操控来源笔记
- FlowVid:把不完美光流作为软条件的视频编辑来源笔记
- GLIGEN:以冻结基础模型和门控适配器实现开放集合 grounded 生成来源笔记
- High-Fidelity Guided Image Synthesis:笔触约束下的 latent diffusion 测试时优化来源笔记
- Image-specific Prompt Learning:零目标图像的生成器域适配来源笔记
- KEDs:知识增强的双流零样本组合式图像检索(Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval)来源笔记
- LayoutDiffusion:面向离散 graphic layout 的专用腐化与免重训条件生成来源笔记
- LinCIR:仅用语言高效训练零样本组合式图像检索(Language-only Efficient Training of Zero-shot Composed Image Retrieval)来源笔记
- MotionEditor:参考姿态驱动的人体视频运动编辑来源笔记
- Paint by Example:以单张参考图控制局部语义编辑来源笔记
- Pic2Word:把图片映射成词,用于零样本组合式图像检索(Mapping Pictures to Words for Zero-shot Composed Image Retrieval)来源笔记
- Prompt Tuning Inversion:优化条件嵌入轨迹的真实图像编辑来源笔记
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance:语义区域自适应 CFG来源笔记
- Self-Guided Diffusion Models:用自监督伪标注替代人工 guidance来源笔记
- StreamingT2V:一致、动态、可扩展的长视频文本生成来源笔记
- 有效的条件式与组合式图像检索:结合 CLIP 特征(Effective Conditioned and Composed Image Retrieval Combining CLIP-Based Features)来源笔记
- 生成式零样本组合式图像检索(Generative Zero-Shot Composed Image Retrieval)来源笔记
#control
- A-STAR:测试时分离并保留 cross-attention来源笔记
- Adding Conditional Control to Text-to-Image Diffusion Models:冻结 U-Net 主干的空间条件侧支来源笔记
- AnyDoor:训练一次的零样本对象级图像定制来源笔记
- Attend-and-Excite:用 attention guidance 修复主体遗漏来源笔记
- BoxDiff:无训练的框约束扩散生成来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- Check, Locate, Rectify:训练免费文本到图像布局校准来源笔记
- DC-ControlNet:SDXL U-Net 上的元素内/元素间层次化多条件控制来源笔记
- DenseDiffusion:Stable Diffusion 的 training-free 区域文本 attention modulation来源笔记
- DynVideo-E:用动态 NeRF 编辑大运动与大视角人体视频来源笔记
- LayoutDiffusion:以对象框控制像素 U-Net 的 layout-to-image 生成来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- MultiDiffusion:用最小二乘融合多条去噪路径的 training-free 组合控制来源笔记
- Prompt-to-Prompt:用 cross-attention 控制文本驱动图像编辑来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- ReCo:以坐标 token 和开放区域文本控制图像生成来源笔记
- Reangle-A-Video:把单目视频重演为多视角同步视频来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- Shape-aware Text-driven Layered Video Editing:用 UV 变形突破 atlas 的固定形状来源笔记
- Towards Practical Plug-and-Play Diffusion Models:噪声分段外部 guidance 工程来源笔记
- 图像生成主题
- 图像编辑主题
- 视频生成主题
- 视频编辑主题
#dataset
#diffusion
- A Video is Worth 256 Bases:以时空 EM 低秩基改进零样本视频反演来源笔记
- A-STAR:测试时分离并保留 cross-attention来源笔记
- ACT-Diffusion:面向一步扩散模型的高效对抗一致性训练来源笔记
- AIDI:以加速定点迭代改进真实图像扩散反演来源笔记
- AVID:用 Temporal MultiDiffusion 做任意长度视频修补来源笔记
- Accelerating Diffusion Sampling with Optimized Time Steps:用优化时间步改善少步扩散采样来源笔记
- Accelerating Diffusion Transformer via Gradient-Optimized Cache:修正 DiT 缓存误差来源笔记
- Adding Conditional Control to Text-to-Image Diffusion Models:冻结 U-Net 主干的空间条件侧支来源笔记
- Align-A-Video:面向一致视频编辑的确定性奖励调优来源笔记
- All Are Worth Words:把 ViT 直接变成扩散模型主干来源笔记
- Analyzing and Improving the Training Dynamics of Diffusion Models:EDM2 的幅值保持训练与 Post-hoc EMA来源笔记
- Attend-and-Excite:用 attention guidance 修复主体遗漏来源笔记
- Attention Calibration for Disentangled Text-to-Image Personalization:解耦式个性化注意力校准来源笔记
- BBDM:以 Brownian Bridge 端点过程建模成对图像翻译来源笔记
- Blended Diffusion:在像素扩散过程中逐步混合文本编辑前景与原图背景来源笔记
- BoxDiff:无训练的框约束扩散生成来源笔记
- C3Net:CoDi U-Net 上的图像、文本与音频复合条件协调来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- CCEdit:以结构—外观解耦实现创意可控视频编辑来源笔记
- CONFORM:以对比式注意力优化提升文本生成忠实度来源笔记
- Check, Locate, Rectify:训练免费文本到图像布局校准来源笔记
- CoDi:条件扩散蒸馏实现 1–4 步图像条件生成来源笔记
- Come-Closer-Diffuse-Faster:用好初始化缩短条件扩散逆问题路径来源笔记
- CommonCanvas:Creative Commons 数据上的开放 T2I 扩散训练来源笔记
- Concept Weaver:模板引导的多概念个性化融合来源笔记
- Condition-Aware Neural Network:以动态权重控制扩散 Transformer来源笔记
- Contrastive Denoising Score:用自注意力对比正则保持编辑结构来源笔记
- CosmicMan:面向人物的文本到图像基础模型来源笔记
- Custom Diffusion:高效单概念学习与多概念组合来源笔记
- Customization Assistant:可对话的单图免微调个性化生成来源笔记
- DC-ControlNet:SDXL U-Net 上的元素内/元素间层次化多条件控制来源笔记
- DLT:以联合离散—连续 Transformer diffusion 做属性级布局生成来源笔记
- DeepCache:用高层特征缓存免费加速 U-Net 扩散模型来源笔记
- Denoising Diffusion Probabilistic Models:现代去噪扩散模型的关键基线来源笔记
- DenseDiffusion:Stable Diffusion 的 training-free 区域文本 attention modulation来源笔记
- DiT 与 Transformer 风格去噪器已成为主要可扩展生成主干之一判断
- DiffEditor:以区域采样与图像提示提升细粒度扩散编辑来源笔记
- Diffusion Autoencoders:用语义向量与随机细节码构造可解码扩散表示来源笔记
- Diffusion Models Without Attention:不用注意力也能做高分辨率扩散来源笔记
- DiffusionCLIP:CLIP 引导的 diffusion U-Net 文本图像操控来源笔记
- Distilling ODE Solvers of Diffusion Models into Smaller Steps:冻结去噪器的轻量求解器蒸馏来源笔记
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models:并行方向蒸馏扩散 ODE 求解器来源笔记
- DreamBooth:以少样本全模型微调实现主体驱动生成来源笔记
- EDICT:用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑来源笔记
- FADE:面向视频编辑的频率感知扩散模型分解来源笔记
- Fairy:用 anchor cross-frame attention 并行加速指令视频编辑来源笔记
- FateZero:融合注意力做零样本文本视频编辑来源笔记
- FlowVid:把不完美光流作为软条件的视频编辑来源笔记
- FramePainter:用视频扩散先验增强交互式图像编辑来源笔记
- FreeU:不重训的扩散 U-Net 特征重加权来源笔记
- High-Fidelity Guided Image Synthesis:笔触约束下的 latent diffusion 测试时优化来源笔记
- Imagic:以文本嵌入优化、模型微调和插值完成真实图像编辑来源笔记
- InstructPix2Pix:用合成监督建立自然语言图像编辑接口来源笔记
- Latent Diffusion Models:高分辨率图像合成的潜空间扩散框架来源笔记
- LayoutDiffusion:以对象框控制像素 U-Net 的 layout-to-image 生成来源笔记
- LayoutDiffusion:面向离散 graphic layout 的专用腐化与免重训条件生成来源笔记
- MotionEditor:参考姿态驱动的人体视频运动编辑来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- MotionStone:用 DiT 解耦运动强度调制的图像到视频生成来源笔记
- MultiDiffusion:用最小二乘融合多条去噪路径的 training-free 组合控制来源笔记
- NULL-Text Inversion:用 guided diffusion 编辑真实图像来源笔记
- OSV:高质量图像到视频生成一步就够来源笔记
- On Distillation of Guided Diffusion Models:把 CFG 与采样轨迹联合蒸馏到极少步来源笔记
- Paint by Example:以单张参考图控制局部语义编辑来源笔记
- Plug-and-Play Diffusion Features:用 U-Net 内部特征控制文本图像翻译来源笔记
- Post-Training Quantization on Diffusion Models:面向多 timestep 的 INT8 校准来源笔记
- Prompt Tuning Inversion:优化条件嵌入轨迹的真实图像编辑来源笔记
- Prompt-to-Prompt:用 cross-attention 控制文本驱动图像编辑来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- RAVE:随机噪声重排的快速一致视频编辑来源笔记
- Reangle-A-Video:把单目视频重演为多视角同步视频来源笔记
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance:语义区域自适应 CFG来源笔记
- SANA-Sprint:连续时间一致性与对抗蒸馏的一步线性 DiT来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- Scalable Diffusion Models with Transformers:DiT 把 Transformer 真正坐实为可扩展扩散主干来源笔记
- Score-Based Generative Modeling through Stochastic Differential Equations:分数模型的连续时间统一框架来源笔记
- Self-Guided Diffusion Models:用自监督伪标注替代人工 guidance来源笔记
- Specialist Diffusion:少样本艺术风格扩散微调工具箱来源笔记
- StableVideo:用 layered atlas 稳定扩散视频外观编辑来源笔记
- StreamingT2V:一致、动态、可扩展的长视频文本生成来源笔记
- Text Embedding Knows How to Quantize:用文本条件动态分配扩散激活位宽来源笔记
- Towards Practical Plug-and-Play Diffusion Models:噪声分段外部 guidance 工程来源笔记
- VidToMe:用跨帧 token merging 做零样本视频编辑来源笔记
- Video-P2P:用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑来源笔记
- VideoCrafter2:低质量视频与高质量图像协同训练的视频扩散模型来源笔记
- VideoDirector:借助文本到视频模型实现精确视频编辑来源笔记
- Wavelet Diffusion Models:在小波空间压缩少步扩散 GAN来源笔记
- 图像生成主题
- 图像编辑主题
- 扩散 Transformer实体
- 扩散效率工程主题
- 扩散模型主题
- 视频生成主题
- 视频编辑主题
#editing
- AIDI:以加速定点迭代改进真实图像扩散反演来源笔记
- Contrastive Denoising Score:用自注意力对比正则保持编辑结构来源笔记
- EDICT:用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑来源笔记
- Imagic:以文本嵌入优化、模型微调和插值完成真实图像编辑来源笔记
- Plug-and-Play Diffusion Features:用 U-Net 内部特征控制文本图像翻译来源笔记
- Shape-aware Text-driven Layered Video Editing:用 UV 变形突破 atlas 的固定形状来源笔记
- VIVE3D:多帧个性化 EG3D 的视角无关人脸视频编辑来源笔记
- Video-P2P:用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑来源笔记
#efficiency
- ACT-Diffusion:面向一步扩散模型的高效对抗一致性训练来源笔记
- Accelerating Diffusion Sampling with Optimized Time Steps:用优化时间步改善少步扩散采样来源笔记
- Accelerating Diffusion Transformer via Gradient-Optimized Cache:修正 DiT 缓存误差来源笔记
- Analyzing and Improving the Training Dynamics of Diffusion Models:EDM2 的幅值保持训练与 Post-hoc EMA来源笔记
- CoDi:条件扩散蒸馏实现 1–4 步图像条件生成来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- Come-Closer-Diffuse-Faster:用好初始化缩短条件扩散逆问题路径来源笔记
- DeepCache:用高层特征缓存免费加速 U-Net 扩散模型来源笔记
- Distilling ODE Solvers of Diffusion Models into Smaller Steps:冻结去噪器的轻量求解器蒸馏来源笔记
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models:并行方向蒸馏扩散 ODE 求解器来源笔记
- E5-V:使用多模态大语言模型的通用 embedding(Universal Embeddings with Multimodal Large Language Models)来源笔记
- Fairy:用 anchor cross-frame attention 并行加速指令视频编辑来源笔记
- FreeU:不重训的扩散 U-Net 特征重加权来源笔记
- LinCIR:仅用语言高效训练零样本组合式图像检索(Language-only Efficient Training of Zero-shot Composed Image Retrieval)来源笔记
- MobileCLIP:通过多模态强化训练得到快速图文模型(Fast Image-Text Models through Multi-Modal Reinforced Training)来源笔记
- OSV:高质量图像到视频生成一步就够来源笔记
- On Distillation of Guided Diffusion Models:把 CFG 与采样轨迹联合蒸馏到极少步来源笔记
- Post-Training Quantization on Diffusion Models:面向多 timestep 的 INT8 校准来源笔记
- RAVE:随机噪声重排的快速一致视频编辑来源笔记
- SANA-Sprint:连续时间一致性与对抗蒸馏的一步线性 DiT来源笔记
- SigLIP 2:具有更强语义理解、定位与 dense features 的多语言视觉语言编码器来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- SkateFormer:用四类骨架—时间分区实现高效联合注意力来源笔记
- Specialist Diffusion:少样本艺术风格扩散微调工具箱来源笔记
- Text Embedding Knows How to Quantize:用文本条件动态分配扩散激活位宽来源笔记
- VidToMe:用跨帧 token merging 做零样本视频编辑来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- VisRAG:面向多模态文档的视觉检索增强生成(Vision-based Retrieval-augmented Generation on Multi-modality Documents)来源笔记
- Wavelet Diffusion Models:在小波空间压缩少步扩散 GAN来源笔记
- 单 GPU 上的数据高效多模态融合(Data-Efficient Multimodal Fusion on a Single GPU)来源笔记
- 如何让 Cross Encoder 成为高效图文检索的好教师?(How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?)来源笔记
- 扩散效率工程主题
#evaluation
- AIGV-Assessor:用大模型评测文本到视频生成感知质量来源笔记
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- CLIPScore:基于 CLIP 的无参考图文评测来源笔记
- COLA:组合式文本到图像检索基准(A Benchmark for Compositional Text-to-image Retrieval)来源笔记
- ConCon-Chi:个性化视觉语言的新含义与组合性基准来源笔记
- EvalCrafter:大视频生成模型的多维评测与人工偏好校准来源笔记
- FiVE-Bench:细粒度视频编辑评测基准来源笔记
- FineCausal:可解释细粒度动作质量评估来源笔记
- FineDiving:程序感知的细粒度动作质量评估来源笔记
- FlashEval:用代表性 prompt 子集加速文本到图像模型评测来源笔记
- GANs Trained by a Two Time-Scale Update Rule:FID 的来源与边界来源笔记
- GlitchBench:大型多模态模型能否识别电子游戏故障来源笔记
- HallusionBench:视觉语言幻觉与视觉错觉诊断基准来源笔记
- Imagen Editor 与 EditBench:推进并评测文本引导图像修补来源笔记
- Improved Techniques for Training GANs:Inception Score 的来源与边界来源笔记
- LOGO:多人长视频的群体动作质量评估来源笔记
- LVBench:极长视频理解基准来源笔记
- M-BEIR 多模态检索评测(M-BEIR)实体
- MAPLM:地图与交通场景的真实世界多模态问答基准来源笔记
- MIEB:大规模图像 embedding 评测基准(Massive Image Embedding Benchmark)来源笔记
- MIRACL-VISION:大规模多语言视觉文档检索基准来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- MVBench:综合多模态视频理解基准来源笔记
- NIST AI RMF:NIST AI RMF 提供 AI 风险管理框架。来源笔记
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- PinPoint:带显式负例、多图查询与改写测试的组合式图像检索评测来源笔记
- RefereeBench:多运动项目规则化视频裁判评测来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- SportsCap:单目体育 3D 运动捕捉与细粒度属性理解来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- Temporal Parsing Transformer:无步骤标签的有序部件 AQA来源笔记
- Towards Active Learning for Action Spotting:足球事件定位的低标注路线来源笔记
- VBench:视频生成模型综合评测套件来源笔记
- Video-Bench:人类偏好对齐的视频生成评测来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- 一张图胜过 77 个文本 token:在密集描述上评估 CLIP 类模型(A Picture is Worth More Than 77 Text Tokens)来源笔记
- 图像生成主题
- 图文检索与组合性评测集(Image-Text Retrieval Benchmarks)实体
- 图文检索(Image-Text Retrieval)主题
- 如何审计图文检索中的预训练重叠、概念频率与 benchmark 污染?问题
- 怎样构造既难又不错误的图文检索负例?问题
- 数据集、评测指标与基准可靠性主题
- 文本—图像组合式检索的鲁棒性基准(Benchmarking Robustness of Text-Image Composed Retrieval)来源笔记
- 文本到图像生成的可验证与可复现人工评测来源笔记
- 标准图文检索分数不足以证明组合性理解判断
- 生成模型评测主题
- 视频编辑理解实体
- 通过形式化验证评测文本到视频模型的神经符号方法来源笔记
#image-editing
- AIDI:以加速定点迭代改进真实图像扩散反演来源笔记
- AnyDoor:训练一次的零样本对象级图像定制来源笔记
- AnyEdit:面向任意创意的统一高质量图像编辑来源笔记
- BBDM:以 Brownian Bridge 端点过程建模成对图像翻译来源笔记
- Blended Diffusion:在像素扩散过程中逐步混合文本编辑前景与原图背景来源笔记
- Contrastive Denoising Score:用自注意力对比正则保持编辑结构来源笔记
- DIVE:用 DINO 做主体驱动视频编辑来源笔记
- DiffEditor:以区域采样与图像提示提升细粒度扩散编辑来源笔记
- DiffusionCLIP:CLIP 引导的 diffusion U-Net 文本图像操控来源笔记
- DreamOmni:统一图像生成与编辑来源笔记
- EDICT:用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑来源笔记
- FireEdit:基于区域感知视觉语言模型的细粒度指令图像编辑来源笔记
- FramePainter:用视频扩散先验增强交互式图像编辑来源笔记
- Imagen Editor 与 EditBench:推进并评测文本引导图像修补来源笔记
- Imagic:以文本嵌入优化、模型微调和插值完成真实图像编辑来源笔记
- InsightEdit:迈向更强指令跟随的图像编辑来源笔记
- InstructPix2Pix:用合成监督建立自然语言图像编辑接口来源笔记
- NULL-Text Inversion:用 guided diffusion 编辑真实图像来源笔记
- Paint by Example:以单张参考图控制局部语义编辑来源笔记
- Pathways on the Image Manifold:通过视频生成做图像编辑来源笔记
- Pix2Video:利用图像扩散进行视频编辑来源笔记
- Plug-and-Play Diffusion Features:用 U-Net 内部特征控制文本图像翻译来源笔记
- Prompt Tuning Inversion:优化条件嵌入轨迹的真实图像编辑来源笔记
- Prompt-to-Prompt:用 cross-attention 控制文本驱动图像编辑来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- SwiftEdit:基于一步扩散的极速文本引导图像编辑来源笔记
- UniReal:通过学习真实世界动态实现通用图像生成与编辑来源笔记
- 图像生成与编辑统一建模实体
- 图像编辑主题
- 图像编辑的进步主要来自数据扩展还是架构升级问题
- 统一图像模型与专用或模块化流水线如何分工问题
- 统一图像模型已显示多任务与工作流优势,整体性能优势仍待验证判断
#image-generation
- A-STAR:测试时分离并保留 cross-attention来源笔记
- ACT-Diffusion:面向一步扩散模型的高效对抗一致性训练来源笔记
- Accelerating Diffusion Sampling with Optimized Time Steps:用优化时间步改善少步扩散采样来源笔记
- Accelerating Diffusion Transformer via Gradient-Optimized Cache:修正 DiT 缓存误差来源笔记
- Adding Conditional Control to Text-to-Image Diffusion Models:冻结 U-Net 主干的空间条件侧支来源笔记
- All Are Worth Words:把 ViT 直接变成扩散模型主干来源笔记
- Analyzing and Improving the Training Dynamics of Diffusion Models:EDM2 的幅值保持训练与 Post-hoc EMA来源笔记
- AnyDoor:训练一次的零样本对象级图像定制来源笔记
- AnyEdit:面向任意创意的统一高质量图像编辑来源笔记
- Attend-and-Excite:用 attention guidance 修复主体遗漏来源笔记
- Attention Calibration for Disentangled Text-to-Image Personalization:解耦式个性化注意力校准来源笔记
- Auto-Encoding Variational Bayes:变分自编码器与重参数化来源笔记
- BoxDiff:无训练的框约束扩散生成来源笔记
- C3Net:CoDi U-Net 上的图像、文本与音频复合条件协调来源笔记
- CONFORM:以对比式注意力优化提升文本生成忠实度来源笔记
- Check, Locate, Rectify:训练免费文本到图像布局校准来源笔记
- CoDi:条件扩散蒸馏实现 1–4 步图像条件生成来源笔记
- Come-Closer-Diffuse-Faster:用好初始化缩短条件扩散逆问题路径来源笔记
- CommonCanvas:Creative Commons 数据上的开放 T2I 扩散训练来源笔记
- Concept Weaver:模板引导的多概念个性化融合来源笔记
- Condition-Aware Neural Network:以动态权重控制扩散 Transformer来源笔记
- CosmicMan:面向人物的文本到图像基础模型来源笔记
- Custom Diffusion:高效单概念学习与多概念组合来源笔记
- Customization Assistant:可对话的单图免微调个性化生成来源笔记
- DC-ControlNet:SDXL U-Net 上的元素内/元素间层次化多条件控制来源笔记
- DLT:以联合离散—连续 Transformer diffusion 做属性级布局生成来源笔记
- DeepCache:用高层特征缓存免费加速 U-Net 扩散模型来源笔记
- Denoising Diffusion Probabilistic Models:现代去噪扩散模型的关键基线来源笔记
- DenseDiffusion:Stable Diffusion 的 training-free 区域文本 attention modulation来源笔记
- Diffusion Autoencoders:用语义向量与随机细节码构造可解码扩散表示来源笔记
- Diffusion Models Without Attention:不用注意力也能做高分辨率扩散来源笔记
- Distilling ODE Solvers of Diffusion Models into Smaller Steps:冻结去噪器的轻量求解器蒸馏来源笔记
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models:并行方向蒸馏扩散 ODE 求解器来源笔记
- Domain Expansion of Image Generators:图像生成器的领域扩展来源笔记
- DreamBooth:以少样本全模型微调实现主体驱动生成来源笔记
- DreamOmni:统一图像生成与编辑来源笔记
- D²iT:用于高精度图像生成的动态扩散 Transformer来源笔记
- Encapsulated Composition:组合式文本到图像/视频模型高质量视频合成来源笔记
- FireEdit:基于区域感知视觉语言模型的细粒度指令图像编辑来源笔记
- FlashEval:用代表性 prompt 子集加速文本到图像模型评测来源笔记
- FreeU:不重训的扩散 U-Net 特征重加权来源笔记
- GLIGEN:以冻结基础模型和门控适配器实现开放集合 grounded 生成来源笔记
- Generative Adversarial Nets:生成对抗网络来源笔记
- Glow:可逆 1×1 卷积的生成流模型来源笔记
- High-Fidelity Guided Image Synthesis:笔触约束下的 latent diffusion 测试时优化来源笔记
- Image-specific Prompt Learning:零目标图像的生成器域适配来源笔记
- InsightEdit:迈向更强指令跟随的图像编辑来源笔记
- Latent Diffusion Models:高分辨率图像合成的潜空间扩散框架来源笔记
- LayoutDiffusion:以对象框控制像素 U-Net 的 layout-to-image 生成来源笔记
- LayoutDiffusion:面向离散 graphic layout 的专用腐化与免重训条件生成来源笔记
- MultiDiffusion:用最小二乘融合多条去噪路径的 training-free 组合控制来源笔记
- OmniGen:统一图像生成来源笔记
- On Distillation of Guided Diffusion Models:把 CFG 与采样轨迹联合蒸馏到极少步来源笔记
- Pathways on the Image Manifold:通过视频生成做图像编辑来源笔记
- Pixel Recurrent Neural Networks:像素级自回归图像建模来源笔记
- Post-Training Quantization on Diffusion Models:面向多 timestep 的 INT8 校准来源笔记
- ReCo:以坐标 token 和开放区域文本控制图像生成来源笔记
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance:语义区域自适应 CFG来源笔记
- SANA-Sprint:连续时间一致性与对抗蒸馏的一步线性 DiT来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- Scalable Diffusion Models with Transformers:DiT 把 Transformer 真正坐实为可扩展扩散主干来源笔记
- Score-Based Generative Modeling through Stochastic Differential Equations:分数模型的连续时间统一框架来源笔记
- Self-Guided Diffusion Models:用自监督伪标注替代人工 guidance来源笔记
- Specialist Diffusion:少样本艺术风格扩散微调工具箱来源笔记
- SwiftEdit:基于一步扩散的极速文本引导图像编辑来源笔记
- Text Embedding Knows How to Quantize:用文本条件动态分配扩散激活位宽来源笔记
- Towards Practical Plug-and-Play Diffusion Models:噪声分段外部 guidance 工程来源笔记
- UniReal:通过学习真实世界动态实现通用图像生成与编辑来源笔记
- Wavelet Diffusion Models:在小波空间压缩少步扩散 GAN来源笔记
- 图像生成主题
- 图像生成与编辑统一建模实体
- 图像编辑的进步主要来自数据扩展还是架构升级问题
- 扩散效率工程主题
- 扩散模型主题
- 文本到图像生成的可验证与可复现人工评测来源笔记
- 统一图像模型与专用或模块化流水线如何分工问题
- 统一图像模型已显示多任务与工作流优势,整体性能优势仍待验证判断
- 视觉生成模型基础主题
#method
#model
#multimodal
- ALBEF:先对齐再融合(Align before Fuse)来源笔记
- ALIGN:用噪声文本监督扩展视觉与视觉语言表示学习(Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision)来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- BLIP:用自举式图文预训练统一视觉语言理解与生成(Bootstrapping Language-Image Pre-training)来源笔记
- CIRR:用预训练视觉语言模型检索真实世界图像(Image Retrieval on Real-life Images)来源笔记
- CLIP 系列模型(CLIP Family)实体
- CLIP:用自然语言监督学习可迁移视觉表示来源笔记
- CoCa:对比式图像描述器作为图文基础模型(Contrastive Captioners are Image-Text Foundation Models)来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- Event2Tracking:用长时多模态上下文重建多智能体足球轨迹来源笔记
- FILIP:细粒度交互式语言-图像预训练(Fine-grained Interactive Language-Image Pre-Training)来源笔记
- FashionIQ:用自然语言反馈检索图像(A New Dataset Towards Retrieving Images by Natural Language Feedback)来源笔记
- LAION-5B:用于下一代图文模型的开放大规模数据集(An open large-scale dataset for training next generation image-text models)来源笔记
- M-BEIR 多模态检索评测(M-BEIR)实体
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- WEAR:户外健身的第一视角视频与四肢 IMU 数据集来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- 双塔负责可扩展召回,细粒度模块负责精排与关系匹配判断
- 图文对齐、视觉语言模型与多模态表示基础主题
- 图文检索哪个子方向最适合中等算力的研究生项目?问题
- 图文检索的主要瓶颈仍包括数据质量、分布与概念覆盖判断
- 图文检索(Image-Text Retrieval)主题
- 多语言多样性改善视觉语言表示(Multilingual Diversity Improves Vision-Language Representations)来源笔记
- 如何审计图文检索中的预训练重叠、概念频率与 benchmark 污染?问题
- 怎样构造既难又不错误的图文检索负例?问题
- 标准图文检索分数不足以证明组合性理解判断
- 生成模型评测主题
- 组合式查询是图文检索中可落地且仍有缺口的研究切口判断
- 细粒度图文对齐如何兼顾索引效率?问题
- 统一多模态向量是否真的能跨任务、跨语言泛化?问题
- 统一多模态向量需要同时验证任务意图、跨域泛化与检索成本判断
- 视觉语言主题
- 运动定义文字的人机感知差距能否成为可靠研究基准问题
#near-cvpr-2025
- A ConvNet for the 2020s:ConvNeXt 与现代卷积主干来源笔记
- A Video is Worth 256 Bases:以时空 EM 低秩基改进零样本视频反演来源笔记
- A-STAR:测试时分离并保留 cross-attention来源笔记
- ACT-Diffusion:面向一步扩散模型的高效对抗一致性训练来源笔记
- AI Driven Soccer Analysis:单主场足球 2D 映射原型来源笔记
- AIDI:以加速定点迭代改进真实图像扩散反演来源笔记
- AIGV-Assessor:用大模型评测文本到视频生成感知质量来源笔记
- ALBEF:先对齐再融合(Align before Fuse)来源笔记
- ALIGN:用噪声文本监督扩展视觉与视觉语言表示学习(Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision)来源笔记
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- AVID:用 Temporal MultiDiffusion 做任意长度视频修补来源笔记
- Accelerating Diffusion Sampling with Optimized Time Steps:用优化时间步改善少步扩散采样来源笔记
- Accelerating Diffusion Transformer via Gradient-Optimized Cache:修正 DiT 缓存误差来源笔记
- Adding Conditional Control to Text-to-Image Diffusion Models:冻结 U-Net 主干的空间条件侧支来源笔记
- Align-A-Video:面向一致视频编辑的确定性奖励调优来源笔记
- All Are Worth Words:把 ViT 直接变成扩散模型主干来源笔记
- Analyzing and Improving the Training Dynamics of Diffusion Models:EDM2 的幅值保持训练与 Post-hoc EMA来源笔记
- AnyDoor:训练一次的零样本对象级图像定制来源笔记
- AnyEdit:面向任意创意的统一高质量图像编辑来源笔记
- AthletePose3D:高速竞技动作的 3D 姿态与运动学验证来源笔记
- AthleticsPose:真实田径动作的 3D 姿态与部署边界来源笔记
- Attend-and-Excite:用 attention guidance 修复主体遗漏来源笔记
- Attention Calibration for Disentangled Text-to-Image Personalization:解耦式个性化注意力校准来源笔记
- Auto-Encoding Variational Bayes:变分自编码器与重参数化来源笔记
- Automated Offside Detection:基于双固定广角相机的时空越位检测原型来源笔记
- BBDM:以 Brownian Bridge 端点过程建模成对图像翻译来源笔记
- BLIP:用自举式图文预训练统一视觉语言理解与生成(Bootstrapping Language-Image Pre-training)来源笔记
- BST:面向羽毛球击球类型识别的骨架动作 Transformer来源笔记
- BadmintonDB:面向球员级比赛分析与预测的羽毛球数据集来源笔记
- Blended Diffusion:在像素扩散过程中逐步混合文本编辑前景与原图背景来源笔记
- BlockGCN:保留骨架拓扑并轻量建模多种关节关系来源笔记
- BoxDiff:无训练的框约束扩散生成来源笔记
- Broadcast2Pitch:从非受控足球转播视频重建比赛状态来源笔记
- C3Net:CoDi U-Net 上的图像、文本与音频复合条件协调来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- CCEdit:以结构—外观解耦实现创意可控视频编辑来源笔记
- CIRR:用预训练视觉语言模型检索真实世界图像(Image Retrieval on Real-life Images)来源笔记
- CLIP 系列模型(CLIP Family)实体
- CLIPScore:基于 CLIP 的无参考图文评测来源笔记
- CLIP:用自然语言监督学习可迁移视觉表示来源笔记
- COLA:组合式文本到图像检索基准(A Benchmark for Compositional Text-to-image Retrieval)来源笔记
- CONFORM:以对比式注意力优化提升文本生成忠实度来源笔记
- Catapult Athlete Monitoring:Catapult athlete monitoring 页面展示运动员负荷、训练监测和多模态数据产品。来源笔记
- Check, Locate, Rectify:训练免费文本到图像布局校准来源笔记
- CoCa:对比式图像描述器作为图文基础模型(Contrastive Captioners are Image-Text Foundation Models)来源笔记
- CoDi:条件扩散蒸馏实现 1–4 步图像条件生成来源笔记
- CoLLM:用于组合式图像检索的大语言模型来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- Come-Closer-Diffuse-Faster:用好初始化缩短条件扩散逆问题路径来源笔记
- CommonCanvas:Creative Commons 数据上的开放 T2I 扩散训练来源笔记
- ConCon-Chi:个性化视觉语言的新含义与组合性基准来源笔记
- Concept Weaver:模板引导的多概念个性化融合来源笔记
- Condition-Aware Neural Network:以动态权重控制扩散 Transformer来源笔记
- Contrastive Denoising Score:用自注意力对比正则保持编辑结构来源笔记
- CosmicMan:面向人物的文本到图像基础模型来源笔记
- Custom Diffusion:高效单概念学习与多概念组合来源笔记
- Customization Assistant:可对话的单图免微调个性化生成来源笔记
- DC-ControlNet:SDXL U-Net 上的元素内/元素间层次化多条件控制来源笔记
- DETR:把目标检测改写成 Transformer set prediction来源笔记
- DIVE:用 DINO 做主体驱动视频编辑来源笔记
- DLT:以联合离散—连续 Transformer diffusion 做属性级布局生成来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- Deep Residual Learning for Image Recognition:ResNet 与残差学习来源笔记
- DeepCache:用高层特征缓存免费加速 U-Net 扩散模型来源笔记
- DeepLabCut:DeepLabCut 是少量标注即可训练的无标记关键点追踪工具。来源笔记
- Denoising Diffusion Probabilistic Models:现代去噪扩散模型的关键基线来源笔记
- DenseDiffusion:Stable Diffusion 的 training-free 区域文本 attention modulation来源笔记
- DiT 与 Transformer 风格去噪器已成为主要可扩展生成主干之一判断
- DiffEditor:以区域采样与图像提示提升细粒度扩散编辑来源笔记
- Diffusion Autoencoders:用语义向量与随机细节码构造可解码扩散表示来源笔记
- Diffusion Models Without Attention:不用注意力也能做高分辨率扩散来源笔记
- DiffusionCLIP:CLIP 引导的 diffusion U-Net 文本图像操控来源笔记
- Distilling ODE Solvers of Diffusion Models into Smaller Steps:冻结去噪器的轻量求解器蒸馏来源笔记
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models:并行方向蒸馏扩散 ODE 求解器来源笔记
- Domain Expansion of Image Generators:图像生成器的领域扩展来源笔记
- DreamBooth:以少样本全模型微调实现主体驱动生成来源笔记
- DreamOmni:统一图像生成与编辑来源笔记
- DynVideo-E:用动态 NeRF 编辑大运动与大视角人体视频来源笔记
- D²iT:用于高精度图像生成的动态扩散 Transformer来源笔记
- E5-V:使用多模态大语言模型的通用 embedding(Universal Embeddings with Multimodal Large Language Models)来源笔记
- EDICT:用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑来源笔记
- Encapsulated Composition:组合式文本到图像/视频模型高质量视频合成来源笔记
- EvalCrafter:大视频生成模型的多维评测与人工偏好校准来源笔记
- Event2Tracking:用长时多模态上下文重建多智能体足球轨迹来源笔记
- FADE:面向视频编辑的频率感知扩散模型分解来源笔记
- FILIP:细粒度交互式语言-图像预训练(Fine-grained Interactive Language-Image Pre-Training)来源笔记
- Fairy:用 anchor cross-frame attention 并行加速指令视频编辑来源笔记
- FashionIQ:用自然语言反馈检索图像(A New Dataset Towards Retrieving Images by Natural Language Feedback)来源笔记
- Faster R-CNN:共享特征的区域提议网络来源笔记
- FateZero:融合注意力做零样本文本视频编辑来源笔记
- FiVE-Bench:细粒度视频编辑评测基准来源笔记
- FineCausal:可解释细粒度动作质量评估来源笔记
- FineDiving Repository:FineDiving 仓库提供数据集与代码入口。来源笔记
- FineDiving:程序感知的细粒度动作质量评估来源笔记
- FineGym:体操视频的层级细粒度动作理解来源笔记
- FineSports:多人篮球的层级细粒度时空动作定位来源笔记
- FireEdit:基于区域感知视觉语言模型的细粒度指令图像编辑来源笔记
- FlashEval:用代表性 prompt 子集加速文本到图像模型评测来源笔记
- FlowVid:把不完美光流作为软条件的视频编辑来源笔记
- FramePainter:用视频扩散先验增强交互式图像编辑来源笔记
- FreeU:不重训的扩散 U-Net 特征重加权来源笔记
- Fully Convolutional Networks for Semantic Segmentation:全卷积语义分割来源笔记
- GANs Trained by a Two Time-Scale Update Rule:FID 的来源与边界来源笔记
- GLIGEN:以冻结基础模型和门控适配器实现开放集合 grounded 生成来源笔记
- Generative Adversarial Nets:生成对抗网络来源笔记
- GlitchBench:大型多模态模型能否识别电子游戏故障来源笔记
- Glow:可逆 1×1 卷积的生成流模型来源笔记
- HallusionBench:视觉语言幻觉与视觉错觉诊断基准来源笔记
- High-Fidelity Guided Image Synthesis:笔触约束下的 latent diffusion 测试时优化来源笔记
- HomeCourt:HomeCourt 代表手机相机驱动的消费级训练反馈应用。来源笔记
- Human-in-the-loop Adaptation:团队运动示例检索的人机适配来源笔记
- Image-specific Prompt Learning:零目标图像的生成器域适配来源笔记
- ImageNet Classification with Deep Convolutional Neural Networks:AlexNet 与深度视觉转折来源笔记
- Imagen Editor 与 EditBench:推进并评测文本引导图像修补来源笔记
- Imagic:以文本嵌入优化、模型微调和插值完成真实图像编辑来源笔记
- Improved Techniques for Training GANs:Inception Score 的来源与边界来源笔记
- InsViE-1M:通过精细数据构造实现 instruction-based 视频编辑来源笔记
- InsightEdit:迈向更强指令跟随的图像编辑来源笔记
- InstructPix2Pix:用合成监督建立自然语言图像编辑接口来源笔记
- KEDs:知识增强的双流零样本组合式图像检索(Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval)来源笔记
- KINEXON Player Tracking:KINEXON player tracking 页面展示 UWB/GPS/LPS 球员追踪系统。来源笔记
- LAION-5B:用于下一代图文模型的开放大规模数据集(An open large-scale dataset for training next generation image-text models)来源笔记
- LLM Wiki入口
- LOGO:多人长视频的群体动作质量评估来源笔记
- LVBench:极长视频理解基准来源笔记
- Latent Diffusion Models:高分辨率图像合成的潜空间扩散框架来源笔记
- LayoutDiffusion:以对象框控制像素 U-Net 的 layout-to-image 生成来源笔记
- LayoutDiffusion:面向离散 graphic layout 的专用腐化与免重训条件生成来源笔记
- LinCIR:仅用语言高效训练零样本组合式图像检索(Language-only Efficient Training of Zero-shot Composed Image Retrieval)来源笔记
- LinGen:面向高分辨率分钟级文本到视频生成的线性复杂度框架来源笔记
- M-BEIR 多模态检索评测(M-BEIR)实体
- MAPLM:地图与交通场景的真实世界多模态问答基准来源笔记
- MIEB:大规模图像 embedding 评测基准(Massive Image Embedding Benchmark)来源笔记
- MIRACL-VISION:大规模多语言视觉文档检索基准来源笔记
- MMAction2:MMAction2 是 OpenMMLab 视频理解工具箱,支持动作识别、检测和骨架动作等任务。来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- MMPose / RTMPose:MMPose 提供 2D/3D 姿态估计工具链,RTMPose 强调实时部署。来源笔记
- MVBench:综合多模态视频理解基准来源笔记
- Mask R-CNN:实例分割与 RoIAlign来源笔记
- MaskINT:关键帧扩散编辑与非自回归结构插帧的视频编辑来源笔记
- MediaPipe Pose:MediaPipe Pose / BlazePose 提供移动端友好的 3D landmarks 姿态估计。来源笔记
- MobileCLIP:通过多模态强化训练得到快速图文模型(Fast Image-Text Models through Multi-Modal Reinforced Training)来源笔记
- MonoTrack:单目羽毛球击球分割与 3D 轨迹重建来源笔记
- MotionEditor:参考姿态驱动的人体视频运动编辑来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- MotionStone:用 DiT 解耦运动强度调制的图像到视频生成来源笔记
- MultiDiffusion:用最小二乘融合多条去噪路径的 training-free 组合控制来源笔记
- MultiSenseBadminton:面向羽毛球表现评估的多传感器生物力学数据集来源笔记
- MultiSports:多人时空动作定位的数据锚点来源笔记
- NFL Hawk-Eye First Down:AP 报道 NFL 引入基于 Hawk-Eye 的首攻测量技术。来源笔记
- NIST AI RMF:NIST AI RMF 提供 AI 风险管理框架。来源笔记
- NULL-Text Inversion:用 guided diffusion 编辑真实图像来源笔记
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- OSV:高质量图像到视频生成一步就够来源笔记
- OmniGen:统一图像生成来源笔记
- On Distillation of Guided Diffusion Models:把 CFG 与采样轨迹联合蒸馏到极少步来源笔记
- OpenCap:OpenCap 用智能手机视频估计人体运动学与动力学,降低实验室级运动捕捉门槛。来源笔记
- OpenPose:OpenPose 是早期多人 2D 关键点检测工具。来源笔记
- Paint by Example:以单张参考图控制局部语义编辑来源笔记
- PathCRF:从球员轨迹推断结构化控球路径与足球事件来源笔记
- Pathways on the Image Manifold:通过视频生成做图像编辑来源笔记
- Pic2Word:把图片映射成词,用于零样本组合式图像检索(Mapping Pictures to Words for Zero-shot Composed Image Retrieval)来源笔记
- PinPoint:带显式负例、多图查询与改写测试的组合式图像检索评测来源笔记
- Pix2Video:利用图像扩散进行视频编辑来源笔记
- Pixel Recurrent Neural Networks:像素级自回归图像建模来源笔记
- Plug-and-Play Diffusion Features:用 U-Net 内部特征控制文本图像翻译来源笔记
- Post-Training Quantization on Diffusion Models:面向多 timestep 的 INT8 校准来源笔记
- Premier League Semi-Automated Offside:Reuters 报道英超启用半自动越位技术。来源笔记
- Prompt Tuning Inversion:优化条件嵌入轨迹的真实图像编辑来源笔记
- Prompt-to-Prompt:用 cross-attention 控制文本驱动图像编辑来源笔记
- ProtoGCN:用运动原型重构放大相似骨架动作的局部差异来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- Quo Vadis, Action Recognition?:I3D、Kinetics 与 3D 视频预训练来源笔记
- RAVE:随机噪声重排的快速一致视频编辑来源笔记
- ReCo:以坐标 token 和开放区域文本控制图像生成来源笔记
- Reangle-A-Video:把单目视频重演为多视角同步视频来源笔记
- RefereeBench:多运动项目规则化视频裁判评测来源笔记
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance:语义区域自适应 CFG来源笔记
- SANA-Sprint:连续时间一致性与对抗蒸馏的一步线性 DiT来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- ST-GCN:骨架动作识别的时空图卷积基线来源笔记
- STI-Bench:精确时空世界理解基准来源笔记
- Scalable Diffusion Models with Transformers:DiT 把 Transformer 真正坐实为可扩展扩散主干来源笔记
- Score-Based Generative Modeling through Stochastic Differential Equations:分数模型的连续时间统一框架来源笔记
- Second Spectrum / Genius Sports:Genius Sports 收购 Second Spectrum 的公告展示了光学追踪、联赛数据和媒体可视化的商业链路。来源笔记
- Segment Anything:把分割做成可提示的视觉基础模型来源笔记
- Self-Guided Diffusion Models:用自监督伪标注替代人工 guidance来源笔记
- Shape-aware Text-driven Layered Video Editing:用 UV 变形突破 atlas 的固定形状来源笔记
- ShuttleSet:人工标注的羽毛球单打 stroke-level 数据集来源笔记
- SigLIP 2:具有更强语义理解、定位与 dense features 的多语言视觉语言编码器来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- SkateFormer:用四类骨架—时间分区实现高效联合注意力来源笔记
- SketchVideo:基于草图的视频生成与编辑来源笔记
- SoccerNet 2022 Challenges Results:足球视频理解挑战早期基线来源笔记
- SoccerNet 2023 Challenges Results:足球视频多任务挑战结果来源笔记
- SoccerNet 2023 Tracking Challenge MOT4MOT:球员跟踪团队报告来源笔记
- SoccerNet Action Spotting:SoccerNet action spotting 是足球视频事件定位的核心公开任务入口。来源笔记
- SoccerNet-GSR:足球比赛状态重建锚点来源笔记
- SoccerNet-Tracking:足球多目标跟踪数据集与基准来源笔记
- SoccerNet-v2 Camera Calibration:足球场标定与球员定位来源笔记
- SoccerNet-v2:广播足球内容、剪辑与回放理解基准来源笔记
- Specialist Diffusion:少样本艺术风格扩散微调工具箱来源笔记
- SportMamba:面向团队运动的非线性多目标跟踪来源笔记
- Sports-QA:复杂专业体育视频问答基准来源笔记
- SportsCap:单目体育 3D 运动捕捉与细粒度属性理解来源笔记
- SportsHHI:体育视频中的高层人—人交互检测基准来源笔记
- SportsMOT实体
- SportsMOT Dataset Page:SportsMOT 官方数据页记录数据下载、许可和基准说明。来源笔记
- SportsMOT:多运动场景的大规模球员多目标跟踪基准来源笔记
- StableVideo:用 layered atlas 稳定扩散视频外观编辑来源笔记
- StreamingT2V:一致、动态、可扩展的长视频文本生成来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- SwiftEdit:基于一步扩散的极速文本引导图像编辑来源笔记
- Swin Transformer:移位窗口与层级视觉 Transformer来源笔记
- TacticAI:足球角球战术预测、检索与条件生成来源笔记
- TeamTrack:全场视角的多运动多目标跟踪数据集来源笔记
- TemPose:面向羽毛球细粒度动作识别的骨架 Transformer来源笔记
- Temporal Parsing Transformer:无步骤标签的有序部件 AQA来源笔记
- Text Embedding Knows How to Quantize:用文本条件动态分配扩散激活位宽来源笔记
- TimeSformer:用于视频理解的分解式时空注意力来源笔记
- Tora:面向视频生成的轨迹导向扩散 Transformer来源笔记
- Towards Active Learning for Action Spotting:足球事件定位的低标注路线来源笔记
- Towards Practical Plug-and-Play Diffusion Models:噪声分段外部 guidance 工程来源笔记
- Towards Structured Analysis:广播羽毛球视频的结构化分析早期系统来源笔记
- Towards Universal Soccer Video Understanding:足球专用多任务视觉编码器来源笔记
- TrackMAE:用轨迹遮挡与预测学习运动敏感的视频表征来源笔记
- TrackNetV2:高效羽毛球高速小目标 2D 追踪来源笔记
- TrackNetV3:增强羽毛球 shuttle tracking 的数据增强与轨迹校正来源笔记
- TrackNetV4:用运动注意力图增强快速体育小目标追踪来源笔记
- TrackNet:体育高速小目标追踪网络来源笔记
- TranSPORTmer:多智能体体育轨迹理解的统一 Transformer 框架来源笔记
- Tune-A-Video:单样本调优图像扩散模型做文本到视频生成来源笔记
- Two-Stream Convolutional Networks for Action Recognition:RGB 与光流双流视频表示来源笔记
- U-Net:编码器—解码器与跳跃连接的医学图像分割来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- UniReal:通过学习真实世界动态实现通用图像生成与编辑来源笔记
- VARS:SoccerNet-MVFoul 多视角犯规分类与裁判辅助来源笔记
- VBench:视频生成模型综合评测套件来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- VEU-Bench:通用 Vid-LLM 的视频剪辑元素理解基准来源笔记
- VIVE3D:多帧个性化 EG3D 的视角无关人脸视频编辑来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- ViLEM:图文检索的视觉—语言错误建模(Visual-Language Error Modeling for Image-Text Retrieval)来源笔记
- VidToMe:用跨帧 token merging 做零样本视频编辑来源笔记
- Video-Bench:人类偏好对齐的视频生成评测来源笔记
- Video-P2P:用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- VideoCrafter2:低质量视频与高质量图像协同训练的视频扩散模型来源笔记
- VideoDirector:借助文本到视频模型实现精确视频编辑来源笔记
- VideoMAE:数据高效的视频掩码自编码预训练来源笔记
- VisRAG:面向多模态文档的视觉检索增强生成(Vision-based Retrieval-augmented Generation on Multi-modality Documents)来源笔记
- Vision Transformer:把图像切成 token 的通用视觉主干来源笔记
- WEAR:户外健身的第一视角视频与四肢 IMU 数据集来源笔记
- Wavelet Diffusion Models:在小波空间压缩少步扩散 GAN来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- X-VARS:可解释足球视频助理裁判系统来源笔记
- 一张图胜过 77 个文本 token:在密集描述上评估 CLIP 类模型(A Picture is Worth More Than 77 Text Tokens)来源笔记
- 体育 AI 研究路线图主题
- 体育 AI 视频理解主题
- 体育姿态估计与跟踪综述:方法、数据、挑战与路线图来源笔记
- 分类、检测、分割、姿态与跟踪主题
- 单 GPU 上的数据高效多模态融合(Data-Efficient Multimodal Fusion on a Single GPU)来源笔记
- 双塔负责可扩展召回,细粒度模块负责精排与关系匹配判断
- 图像生成主题
- 图像生成与编辑统一建模实体
- 图像编辑主题
- 图像编辑的进步主要来自数据扩展还是架构升级问题
- 图像表示与视觉主干网络主题
- 图文对齐、视觉语言模型与多模态表示基础主题
- 图文检索与组合性评测集(Image-Text Retrieval Benchmarks)实体
- 图文检索哪个子方向最适合中等算力的研究生项目?问题
- 图文检索的主要瓶颈仍包括数据质量、分布与概念覆盖判断
- 图文检索(Image-Text Retrieval)主题
- 多语言多样性改善视觉语言表示(Multilingual Diversity Improves Vision-Language Representations)来源笔记
- 多边语义关系建模用于图文检索(Multilateral Semantic Relations Modeling for Image Text Retrieval)来源笔记
- 如何审计图文检索中的预训练重叠、概念频率与 benchmark 污染?问题
- 如何让 Cross Encoder 成为高效图文检索的好教师?(How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?)来源笔记
- 怎样构造既难又不错误的图文检索负例?问题
- 扩散 Transformer实体
- 扩散效率工程主题
- 扩散模型主题
- 数据集、评测指标与基准可靠性主题
- 文本—图像组合式检索的鲁棒性基准(Benchmarking Robustness of Text-Image Composed Retrieval)来源笔记
- 文本到图像生成的可验证与可复现人工评测来源笔记
- 有效的条件式与组合式图像检索:结合 CLIP 特征(Effective Conditioned and Composed Image Retrieval Combining CLIP-Based Features)来源笔记
- 标准图文检索分数不足以证明组合性理解判断
- 现有评测是否真的刻画了视频编辑理解能力问题
- 生成式零样本组合式图像检索(Generative Zero-Shot Composed Image Retrieval)来源笔记
- 生成模型评测主题
- 索引入口
- 组合式查询是图文检索中可落地且仍有缺口的研究切口判断
- 细粒度图文对齐如何兼顾索引效率?问题
- 统一图像模型与专用或模块化流水线如何分工问题
- 统一图像模型已显示多任务与工作流优势,整体性能优势仍待验证判断
- 统一多模态向量是否真的能跨任务、跨语言泛化?问题
- 统一多模态向量需要同时验证任务意图、跨域泛化与检索成本判断
- 羽毛球挥拍动作纠正 demo 应如何定义问题
- 视觉生成模型基础主题
- 视觉语言主题
- 视频理解主题
- 视频生成主题
- 视频编辑主题
- 视频编辑理解实体
- 视频表示、运动信息与时序建模主题
- 计算机视觉概览与发展脉络主题
- 运动定义文字的人机感知差距能否成为可靠研究基准问题
- 通用 Vid-LLM 在视频剪辑元素识别、推理与功能判断上仍明显不足判断
- 通过多模态大模型实现语言驱动视频修补来源笔记
- 通过形式化验证评测文本到视频模型的神经符号方法来源笔记
#needs-verification
#object-detection
#open-claim
#primary-source
- A ConvNet for the 2020s:ConvNeXt 与现代卷积主干来源笔记
- A Video is Worth 256 Bases:以时空 EM 低秩基改进零样本视频反演来源笔记
- A-STAR:测试时分离并保留 cross-attention来源笔记
- ACT-Diffusion:面向一步扩散模型的高效对抗一致性训练来源笔记
- AI Driven Soccer Analysis:单主场足球 2D 映射原型来源笔记
- AIDI:以加速定点迭代改进真实图像扩散反演来源笔记
- AIGV-Assessor:用大模型评测文本到视频生成感知质量来源笔记
- ALBEF:先对齐再融合(Align before Fuse)来源笔记
- ALIGN:用噪声文本监督扩展视觉与视觉语言表示学习(Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision)来源笔记
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- AVID:用 Temporal MultiDiffusion 做任意长度视频修补来源笔记
- Accelerating Diffusion Sampling with Optimized Time Steps:用优化时间步改善少步扩散采样来源笔记
- Accelerating Diffusion Transformer via Gradient-Optimized Cache:修正 DiT 缓存误差来源笔记
- Adding Conditional Control to Text-to-Image Diffusion Models:冻结 U-Net 主干的空间条件侧支来源笔记
- Align-A-Video:面向一致视频编辑的确定性奖励调优来源笔记
- All Are Worth Words:把 ViT 直接变成扩散模型主干来源笔记
- Analyzing and Improving the Training Dynamics of Diffusion Models:EDM2 的幅值保持训练与 Post-hoc EMA来源笔记
- AnyDoor:训练一次的零样本对象级图像定制来源笔记
- AnyEdit:面向任意创意的统一高质量图像编辑来源笔记
- AthletePose3D:高速竞技动作的 3D 姿态与运动学验证来源笔记
- AthleticsPose:真实田径动作的 3D 姿态与部署边界来源笔记
- Attend-and-Excite:用 attention guidance 修复主体遗漏来源笔记
- Attention Calibration for Disentangled Text-to-Image Personalization:解耦式个性化注意力校准来源笔记
- Auto-Encoding Variational Bayes:变分自编码器与重参数化来源笔记
- Automated Offside Detection:基于双固定广角相机的时空越位检测原型来源笔记
- BBDM:以 Brownian Bridge 端点过程建模成对图像翻译来源笔记
- BLIP:用自举式图文预训练统一视觉语言理解与生成(Bootstrapping Language-Image Pre-training)来源笔记
- BST:面向羽毛球击球类型识别的骨架动作 Transformer来源笔记
- BadmintonDB:面向球员级比赛分析与预测的羽毛球数据集来源笔记
- Blended Diffusion:在像素扩散过程中逐步混合文本编辑前景与原图背景来源笔记
- BlockGCN:保留骨架拓扑并轻量建模多种关节关系来源笔记
- BoxDiff:无训练的框约束扩散生成来源笔记
- Broadcast2Pitch:从非受控足球转播视频重建比赛状态来源笔记
- C3Net:CoDi U-Net 上的图像、文本与音频复合条件协调来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- CCEdit:以结构—外观解耦实现创意可控视频编辑来源笔记
- CIRR:用预训练视觉语言模型检索真实世界图像(Image Retrieval on Real-life Images)来源笔记
- CLIPScore:基于 CLIP 的无参考图文评测来源笔记
- CLIP:用自然语言监督学习可迁移视觉表示来源笔记
- COLA:组合式文本到图像检索基准(A Benchmark for Compositional Text-to-image Retrieval)来源笔记
- CONFORM:以对比式注意力优化提升文本生成忠实度来源笔记
- Check, Locate, Rectify:训练免费文本到图像布局校准来源笔记
- CoCa:对比式图像描述器作为图文基础模型(Contrastive Captioners are Image-Text Foundation Models)来源笔记
- CoDi:条件扩散蒸馏实现 1–4 步图像条件生成来源笔记
- CoLLM:用于组合式图像检索的大语言模型来源笔记
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- Come-Closer-Diffuse-Faster:用好初始化缩短条件扩散逆问题路径来源笔记
- CommonCanvas:Creative Commons 数据上的开放 T2I 扩散训练来源笔记
- ConCon-Chi:个性化视觉语言的新含义与组合性基准来源笔记
- Concept Weaver:模板引导的多概念个性化融合来源笔记
- Condition-Aware Neural Network:以动态权重控制扩散 Transformer来源笔记
- Contrastive Denoising Score:用自注意力对比正则保持编辑结构来源笔记
- CosmicMan:面向人物的文本到图像基础模型来源笔记
- Custom Diffusion:高效单概念学习与多概念组合来源笔记
- Customization Assistant:可对话的单图免微调个性化生成来源笔记
- DC-ControlNet:SDXL U-Net 上的元素内/元素间层次化多条件控制来源笔记
- DETR:把目标检测改写成 Transformer set prediction来源笔记
- DIVE:用 DINO 做主体驱动视频编辑来源笔记
- DLT:以联合离散—连续 Transformer diffusion 做属性级布局生成来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- Deep Residual Learning for Image Recognition:ResNet 与残差学习来源笔记
- DeepCache:用高层特征缓存免费加速 U-Net 扩散模型来源笔记
- Denoising Diffusion Probabilistic Models:现代去噪扩散模型的关键基线来源笔记
- DenseDiffusion:Stable Diffusion 的 training-free 区域文本 attention modulation来源笔记
- DiffEditor:以区域采样与图像提示提升细粒度扩散编辑来源笔记
- Diffusion Autoencoders:用语义向量与随机细节码构造可解码扩散表示来源笔记
- Diffusion Models Without Attention:不用注意力也能做高分辨率扩散来源笔记
- DiffusionCLIP:CLIP 引导的 diffusion U-Net 文本图像操控来源笔记
- Distilling ODE Solvers of Diffusion Models into Smaller Steps:冻结去噪器的轻量求解器蒸馏来源笔记
- Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models:并行方向蒸馏扩散 ODE 求解器来源笔记
- Domain Expansion of Image Generators:图像生成器的领域扩展来源笔记
- DreamBooth:以少样本全模型微调实现主体驱动生成来源笔记
- DreamOmni:统一图像生成与编辑来源笔记
- DynVideo-E:用动态 NeRF 编辑大运动与大视角人体视频来源笔记
- D²iT:用于高精度图像生成的动态扩散 Transformer来源笔记
- E5-V:使用多模态大语言模型的通用 embedding(Universal Embeddings with Multimodal Large Language Models)来源笔记
- EDICT:用双轨耦合变换实现可逆 diffusion sampler 与真实图像编辑来源笔记
- Encapsulated Composition:组合式文本到图像/视频模型高质量视频合成来源笔记
- EvalCrafter:大视频生成模型的多维评测与人工偏好校准来源笔记
- Event2Tracking:用长时多模态上下文重建多智能体足球轨迹来源笔记
- FADE:面向视频编辑的频率感知扩散模型分解来源笔记
- FILIP:细粒度交互式语言-图像预训练(Fine-grained Interactive Language-Image Pre-Training)来源笔记
- Fairy:用 anchor cross-frame attention 并行加速指令视频编辑来源笔记
- FashionIQ:用自然语言反馈检索图像(A New Dataset Towards Retrieving Images by Natural Language Feedback)来源笔记
- Faster R-CNN:共享特征的区域提议网络来源笔记
- FateZero:融合注意力做零样本文本视频编辑来源笔记
- FiVE-Bench:细粒度视频编辑评测基准来源笔记
- FineCausal:可解释细粒度动作质量评估来源笔记
- FineDiving:程序感知的细粒度动作质量评估来源笔记
- FineGym:体操视频的层级细粒度动作理解来源笔记
- FineSports:多人篮球的层级细粒度时空动作定位来源笔记
- FireEdit:基于区域感知视觉语言模型的细粒度指令图像编辑来源笔记
- FlashEval:用代表性 prompt 子集加速文本到图像模型评测来源笔记
- FlowVid:把不完美光流作为软条件的视频编辑来源笔记
- FramePainter:用视频扩散先验增强交互式图像编辑来源笔记
- FreeU:不重训的扩散 U-Net 特征重加权来源笔记
- Fully Convolutional Networks for Semantic Segmentation:全卷积语义分割来源笔记
- GANs Trained by a Two Time-Scale Update Rule:FID 的来源与边界来源笔记
- GLIGEN:以冻结基础模型和门控适配器实现开放集合 grounded 生成来源笔记
- Generative Adversarial Nets:生成对抗网络来源笔记
- GlitchBench:大型多模态模型能否识别电子游戏故障来源笔记
- Glow:可逆 1×1 卷积的生成流模型来源笔记
- HallusionBench:视觉语言幻觉与视觉错觉诊断基准来源笔记
- High-Fidelity Guided Image Synthesis:笔触约束下的 latent diffusion 测试时优化来源笔记
- Human-in-the-loop Adaptation:团队运动示例检索的人机适配来源笔记
- Image-specific Prompt Learning:零目标图像的生成器域适配来源笔记
- ImageNet Classification with Deep Convolutional Neural Networks:AlexNet 与深度视觉转折来源笔记
- Imagen Editor 与 EditBench:推进并评测文本引导图像修补来源笔记
- Imagic:以文本嵌入优化、模型微调和插值完成真实图像编辑来源笔记
- Improved Techniques for Training GANs:Inception Score 的来源与边界来源笔记
- InsViE-1M:通过精细数据构造实现 instruction-based 视频编辑来源笔记
- InsightEdit:迈向更强指令跟随的图像编辑来源笔记
- InstructPix2Pix:用合成监督建立自然语言图像编辑接口来源笔记
- KEDs:知识增强的双流零样本组合式图像检索(Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval)来源笔记
- LAION-5B:用于下一代图文模型的开放大规模数据集(An open large-scale dataset for training next generation image-text models)来源笔记
- LOGO:多人长视频的群体动作质量评估来源笔记
- LVBench:极长视频理解基准来源笔记
- Latent Diffusion Models:高分辨率图像合成的潜空间扩散框架来源笔记
- LayoutDiffusion:以对象框控制像素 U-Net 的 layout-to-image 生成来源笔记
- LayoutDiffusion:面向离散 graphic layout 的专用腐化与免重训条件生成来源笔记
- LinCIR:仅用语言高效训练零样本组合式图像检索(Language-only Efficient Training of Zero-shot Composed Image Retrieval)来源笔记
- LinGen:面向高分辨率分钟级文本到视频生成的线性复杂度框架来源笔记
- MAPLM:地图与交通场景的真实世界多模态问答基准来源笔记
- MIEB:大规模图像 embedding 评测基准(Massive Image Embedding Benchmark)来源笔记
- MIRACL-VISION:大规模多语言视觉文档检索基准来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- MVBench:综合多模态视频理解基准来源笔记
- Mask R-CNN:实例分割与 RoIAlign来源笔记
- MaskINT:关键帧扩散编辑与非自回归结构插帧的视频编辑来源笔记
- MobileCLIP:通过多模态强化训练得到快速图文模型(Fast Image-Text Models through Multi-Modal Reinforced Training)来源笔记
- MonoTrack:单目羽毛球击球分割与 3D 轨迹重建来源笔记
- MotionEditor:参考姿态驱动的人体视频运动编辑来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- MotionStone:用 DiT 解耦运动强度调制的图像到视频生成来源笔记
- MultiDiffusion:用最小二乘融合多条去噪路径的 training-free 组合控制来源笔记
- MultiSenseBadminton:面向羽毛球表现评估的多传感器生物力学数据集来源笔记
- MultiSports:多人时空动作定位的数据锚点来源笔记
- NULL-Text Inversion:用 guided diffusion 编辑真实图像来源笔记
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- OSV:高质量图像到视频生成一步就够来源笔记
- OmniGen:统一图像生成来源笔记
- On Distillation of Guided Diffusion Models:把 CFG 与采样轨迹联合蒸馏到极少步来源笔记
- OpenCap:OpenCap 用智能手机视频估计人体运动学与动力学,降低实验室级运动捕捉门槛。来源笔记
- Paint by Example:以单张参考图控制局部语义编辑来源笔记
- PathCRF:从球员轨迹推断结构化控球路径与足球事件来源笔记
- Pathways on the Image Manifold:通过视频生成做图像编辑来源笔记
- Pic2Word:把图片映射成词,用于零样本组合式图像检索(Mapping Pictures to Words for Zero-shot Composed Image Retrieval)来源笔记
- PinPoint:带显式负例、多图查询与改写测试的组合式图像检索评测来源笔记
- Pix2Video:利用图像扩散进行视频编辑来源笔记
- Pixel Recurrent Neural Networks:像素级自回归图像建模来源笔记
- Plug-and-Play Diffusion Features:用 U-Net 内部特征控制文本图像翻译来源笔记
- Post-Training Quantization on Diffusion Models:面向多 timestep 的 INT8 校准来源笔记
- Prompt Tuning Inversion:优化条件嵌入轨迹的真实图像编辑来源笔记
- Prompt-to-Prompt:用 cross-attention 控制文本驱动图像编辑来源笔记
- ProtoGCN:用运动原型重构放大相似骨架动作的局部差异来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- Quo Vadis, Action Recognition?:I3D、Kinetics 与 3D 视频预训练来源笔记
- RAVE:随机噪声重排的快速一致视频编辑来源笔记
- ReCo:以坐标 token 和开放区域文本控制图像生成来源笔记
- Reangle-A-Video:把单目视频重演为多视角同步视频来源笔记
- RefereeBench:多运动项目规则化视频裁判评测来源笔记
- Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance:语义区域自适应 CFG来源笔记
- SANA-Sprint:连续时间一致性与对抗蒸馏的一步线性 DiT来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- SLD:LLM 驱动的闭环扩散生成纠错来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- ST-GCN:骨架动作识别的时空图卷积基线来源笔记
- STI-Bench:精确时空世界理解基准来源笔记
- Scalable Diffusion Models with Transformers:DiT 把 Transformer 真正坐实为可扩展扩散主干来源笔记
- Score-Based Generative Modeling through Stochastic Differential Equations:分数模型的连续时间统一框架来源笔记
- Segment Anything:把分割做成可提示的视觉基础模型来源笔记
- Self-Guided Diffusion Models:用自监督伪标注替代人工 guidance来源笔记
- Shape-aware Text-driven Layered Video Editing:用 UV 变形突破 atlas 的固定形状来源笔记
- ShuttleSet:人工标注的羽毛球单打 stroke-level 数据集来源笔记
- SigLIP 2:具有更强语义理解、定位与 dense features 的多语言视觉语言编码器来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- SkateFormer:用四类骨架—时间分区实现高效联合注意力来源笔记
- SketchVideo:基于草图的视频生成与编辑来源笔记
- SoccerNet 2022 Challenges Results:足球视频理解挑战早期基线来源笔记
- SoccerNet 2023 Challenges Results:足球视频多任务挑战结果来源笔记
- SoccerNet 2023 Tracking Challenge MOT4MOT:球员跟踪团队报告来源笔记
- SoccerNet-GSR:足球比赛状态重建锚点来源笔记
- SoccerNet-Tracking:足球多目标跟踪数据集与基准来源笔记
- SoccerNet-v2 Camera Calibration:足球场标定与球员定位来源笔记
- SoccerNet-v2:广播足球内容、剪辑与回放理解基准来源笔记
- Specialist Diffusion:少样本艺术风格扩散微调工具箱来源笔记
- SportMamba:面向团队运动的非线性多目标跟踪来源笔记
- Sports-QA:复杂专业体育视频问答基准来源笔记
- SportsCap:单目体育 3D 运动捕捉与细粒度属性理解来源笔记
- SportsHHI:体育视频中的高层人—人交互检测基准来源笔记
- SportsMOT:多运动场景的大规模球员多目标跟踪基准来源笔记
- StableVideo:用 layered atlas 稳定扩散视频外观编辑来源笔记
- StreamingT2V:一致、动态、可扩展的长视频文本生成来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- SwiftEdit:基于一步扩散的极速文本引导图像编辑来源笔记
- Swin Transformer:移位窗口与层级视觉 Transformer来源笔记
- TacticAI:足球角球战术预测、检索与条件生成来源笔记
- TeamTrack:全场视角的多运动多目标跟踪数据集来源笔记
- TemPose:面向羽毛球细粒度动作识别的骨架 Transformer来源笔记
- Temporal Parsing Transformer:无步骤标签的有序部件 AQA来源笔记
- Text Embedding Knows How to Quantize:用文本条件动态分配扩散激活位宽来源笔记
- TimeSformer:用于视频理解的分解式时空注意力来源笔记
- Tora:面向视频生成的轨迹导向扩散 Transformer来源笔记
- Towards Active Learning for Action Spotting:足球事件定位的低标注路线来源笔记
- Towards Practical Plug-and-Play Diffusion Models:噪声分段外部 guidance 工程来源笔记
- Towards Structured Analysis:广播羽毛球视频的结构化分析早期系统来源笔记
- Towards Universal Soccer Video Understanding:足球专用多任务视觉编码器来源笔记
- TrackMAE:用轨迹遮挡与预测学习运动敏感的视频表征来源笔记
- TrackNetV2:高效羽毛球高速小目标 2D 追踪来源笔记
- TrackNetV3:增强羽毛球 shuttle tracking 的数据增强与轨迹校正来源笔记
- TrackNetV4:用运动注意力图增强快速体育小目标追踪来源笔记
- TrackNet:体育高速小目标追踪网络来源笔记
- TranSPORTmer:多智能体体育轨迹理解的统一 Transformer 框架来源笔记
- Tune-A-Video:单样本调优图像扩散模型做文本到视频生成来源笔记
- Two-Stream Convolutional Networks for Action Recognition:RGB 与光流双流视频表示来源笔记
- U-Net:编码器—解码器与跳跃连接的医学图像分割来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- UniReal:通过学习真实世界动态实现通用图像生成与编辑来源笔记
- VARS:SoccerNet-MVFoul 多视角犯规分类与裁判辅助来源笔记
- VBench:视频生成模型综合评测套件来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- VEU-Bench:通用 Vid-LLM 的视频剪辑元素理解基准来源笔记
- VIVE3D:多帧个性化 EG3D 的视角无关人脸视频编辑来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- ViLEM:图文检索的视觉—语言错误建模(Visual-Language Error Modeling for Image-Text Retrieval)来源笔记
- VidToMe:用跨帧 token merging 做零样本视频编辑来源笔记
- Video-Bench:人类偏好对齐的视频生成评测来源笔记
- Video-P2P:用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- VideoCrafter2:低质量视频与高质量图像协同训练的视频扩散模型来源笔记
- VideoDirector:借助文本到视频模型实现精确视频编辑来源笔记
- VideoMAE:数据高效的视频掩码自编码预训练来源笔记
- VisRAG:面向多模态文档的视觉检索增强生成(Vision-based Retrieval-augmented Generation on Multi-modality Documents)来源笔记
- Vision Transformer:把图像切成 token 的通用视觉主干来源笔记
- WEAR:户外健身的第一视角视频与四肢 IMU 数据集来源笔记
- Wavelet Diffusion Models:在小波空间压缩少步扩散 GAN来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- X-VARS:可解释足球视频助理裁判系统来源笔记
- 一张图胜过 77 个文本 token:在密集描述上评估 CLIP 类模型(A Picture is Worth More Than 77 Text Tokens)来源笔记
- 单 GPU 上的数据高效多模态融合(Data-Efficient Multimodal Fusion on a Single GPU)来源笔记
- 多语言多样性改善视觉语言表示(Multilingual Diversity Improves Vision-Language Representations)来源笔记
- 多边语义关系建模用于图文检索(Multilateral Semantic Relations Modeling for Image Text Retrieval)来源笔记
- 如何让 Cross Encoder 成为高效图文检索的好教师?(How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?)来源笔记
- 文本—图像组合式检索的鲁棒性基准(Benchmarking Robustness of Text-Image Composed Retrieval)来源笔记
- 文本到图像生成的可验证与可复现人工评测来源笔记
- 有效的条件式与组合式图像检索:结合 CLIP 特征(Effective Conditioned and Composed Image Retrieval Combining CLIP-Based Features)来源笔记
- 生成式零样本组合式图像检索(Generative Zero-Shot Composed Image Retrieval)来源笔记
- 通过多模态大模型实现语言驱动视频修补来源笔记
- 通过形式化验证评测文本到视频模型的神经符号方法来源笔记
#reasoning
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- Automated Offside Detection:基于双固定广角相机的时空越位检测原型来源笔记
- COLA:组合式文本到图像检索基准(A Benchmark for Compositional Text-to-image Retrieval)来源笔记
- CoLLM:用于组合式图像检索的大语言模型来源笔记
- FineCausal:可解释细粒度动作质量评估来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- PathCRF:从球员轨迹推断结构化控球路径与足球事件来源笔记
- PinPoint:带显式负例、多图查询与改写测试的组合式图像检索评测来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- ST-GCN:骨架动作识别的时空图卷积基线来源笔记
- TacticAI:足球角球战术预测、检索与条件生成来源笔记
- Temporal Parsing Transformer:无步骤标签的有序部件 AQA来源笔记
- TimeSformer:用于视频理解的分解式时空注意力来源笔记
- Towards Universal Soccer Video Understanding:足球专用多任务视觉编码器来源笔记
- TranSPORTmer:多智能体体育轨迹理解的统一 Transformer 框架来源笔记
- VARS:SoccerNet-MVFoul 多视角犯规分类与裁判辅助来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- ViLEM:图文检索的视觉—语言错误建模(Visual-Language Error Modeling for Image-Text Retrieval)来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- X-VARS:可解释足球视频助理裁判系统来源笔记
- 体育 AI 研究路线图主题
- 体育 AI 视频理解主题
- 视频理解主题
#representation-learning
- A ConvNet for the 2020s:ConvNeXt 与现代卷积主干来源笔记
- ALBEF:先对齐再融合(Align before Fuse)来源笔记
- ALIGN:用噪声文本监督扩展视觉与视觉语言表示学习(Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision)来源笔记
- Auto-Encoding Variational Bayes:变分自编码器与重参数化来源笔记
- BLIP:用自举式图文预训练统一视觉语言理解与生成(Bootstrapping Language-Image Pre-training)来源笔记
- BST:面向羽毛球击球类型识别的骨架动作 Transformer来源笔记
- BadmintonDB:面向球员级比赛分析与预测的羽毛球数据集来源笔记
- BlockGCN:保留骨架拓扑并轻量建模多种关节关系来源笔记
- CLIP 系列模型(CLIP Family)实体
- CLIP:用自然语言监督学习可迁移视觉表示来源笔记
- CoCa:对比式图像描述器作为图文基础模型(Contrastive Captioners are Image-Text Foundation Models)来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- DETR:把目标检测改写成 Transformer set prediction来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- Deep Residual Learning for Image Recognition:ResNet 与残差学习来源笔记
- Diffusion Autoencoders:用语义向量与随机细节码构造可解码扩散表示来源笔记
- Domain Expansion of Image Generators:图像生成器的领域扩展来源笔记
- E5-V:使用多模态大语言模型的通用 embedding(Universal Embeddings with Multimodal Large Language Models)来源笔记
- FILIP:细粒度交互式语言-图像预训练(Fine-grained Interactive Language-Image Pre-Training)来源笔记
- Faster R-CNN:共享特征的区域提议网络来源笔记
- Fully Convolutional Networks for Semantic Segmentation:全卷积语义分割来源笔记
- ImageNet Classification with Deep Convolutional Neural Networks:AlexNet 与深度视觉转折来源笔记
- KEDs:知识增强的双流零样本组合式图像检索(Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval)来源笔记
- LAION-5B:用于下一代图文模型的开放大规模数据集(An open large-scale dataset for training next generation image-text models)来源笔记
- MobileCLIP:通过多模态强化训练得到快速图文模型(Fast Image-Text Models through Multi-Modal Reinforced Training)来源笔记
- MultiSenseBadminton:面向羽毛球表现评估的多传感器生物力学数据集来源笔记
- Pic2Word:把图片映射成词,用于零样本组合式图像检索(Mapping Pictures to Words for Zero-shot Composed Image Retrieval)来源笔记
- ProtoGCN:用运动原型重构放大相似骨架动作的局部差异来源笔记
- Quo Vadis, Action Recognition?:I3D、Kinetics 与 3D 视频预训练来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- Segment Anything:把分割做成可提示的视觉基础模型来源笔记
- SigLIP 2:具有更强语义理解、定位与 dense features 的多语言视觉语言编码器来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- SkateFormer:用四类骨架—时间分区实现高效联合注意力来源笔记
- SportsCap:单目体育 3D 运动捕捉与细粒度属性理解来源笔记
- Swin Transformer:移位窗口与层级视觉 Transformer来源笔记
- TemPose:面向羽毛球细粒度动作识别的骨架 Transformer来源笔记
- TrackMAE:用轨迹遮挡与预测学习运动敏感的视频表征来源笔记
- Two-Stream Convolutional Networks for Action Recognition:RGB 与光流双流视频表示来源笔记
- U-Net:编码器—解码器与跳跃连接的医学图像分割来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- ViLEM:图文检索的视觉—语言错误建模(Visual-Language Error Modeling for Image-Text Retrieval)来源笔记
- VideoMAE:数据高效的视频掩码自编码预训练来源笔记
- VisRAG:面向多模态文档的视觉检索增强生成(Vision-based Retrieval-augmented Generation on Multi-modality Documents)来源笔记
- Vision Transformer:把图像切成 token 的通用视觉主干来源笔记
- 单 GPU 上的数据高效多模态融合(Data-Efficient Multimodal Fusion on a Single GPU)来源笔记
- 双塔负责可扩展召回,细粒度模块负责精排与关系匹配判断
- 图像表示与视觉主干网络主题
- 图文对齐、视觉语言模型与多模态表示基础主题
- 图文检索(Image-Text Retrieval)主题
- 多语言多样性改善视觉语言表示(Multilingual Diversity Improves Vision-Language Representations)来源笔记
- 多边语义关系建模用于图文检索(Multilateral Semantic Relations Modeling for Image Text Retrieval)来源笔记
- 如何让 Cross Encoder 成为高效图文检索的好教师?(How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?)来源笔记
- 有效的条件式与组合式图像检索:结合 CLIP 特征(Effective Conditioned and Composed Image Retrieval Combining CLIP-Based Features)来源笔记
- 生成式零样本组合式图像检索(Generative Zero-Shot Composed Image Retrieval)来源笔记
- 细粒度图文对齐如何兼顾索引效率?问题
- 统一多模态向量是否真的能跨任务、跨语言泛化?问题
- 统一多模态向量需要同时验证任务意图、跨域泛化与检索成本判断
- 羽毛球挥拍动作纠正 demo 应如何定义问题
- 视觉生成模型基础主题
- 视频表示、运动信息与时序建模主题
- 计算机视觉概览与发展脉络主题
#secondary-source
- Catapult Athlete Monitoring:Catapult athlete monitoring 页面展示运动员负荷、训练监测和多模态数据产品。来源笔记
- DeepLabCut:DeepLabCut 是少量标注即可训练的无标记关键点追踪工具。来源笔记
- FineDiving Repository:FineDiving 仓库提供数据集与代码入口。来源笔记
- HomeCourt:HomeCourt 代表手机相机驱动的消费级训练反馈应用。来源笔记
- KINEXON Player Tracking:KINEXON player tracking 页面展示 UWB/GPS/LPS 球员追踪系统。来源笔记
- MMAction2:MMAction2 是 OpenMMLab 视频理解工具箱,支持动作识别、检测和骨架动作等任务。来源笔记
- MMPose / RTMPose:MMPose 提供 2D/3D 姿态估计工具链,RTMPose 强调实时部署。来源笔记
- MediaPipe Pose:MediaPipe Pose / BlazePose 提供移动端友好的 3D landmarks 姿态估计。来源笔记
- NFL Hawk-Eye First Down:AP 报道 NFL 引入基于 Hawk-Eye 的首攻测量技术。来源笔记
- NIST AI RMF:NIST AI RMF 提供 AI 风险管理框架。来源笔记
- OpenPose:OpenPose 是早期多人 2D 关键点检测工具。来源笔记
- Premier League Semi-Automated Offside:Reuters 报道英超启用半自动越位技术。来源笔记
- Second Spectrum / Genius Sports:Genius Sports 收购 Second Spectrum 的公告展示了光学追踪、联赛数据和媒体可视化的商业链路。来源笔记
- SoccerNet Action Spotting:SoccerNet action spotting 是足球视频事件定位的核心公开任务入口。来源笔记
- SportsMOT Dataset Page:SportsMOT 官方数据页记录数据下载、许可和基准说明。来源笔记
- 体育姿态估计与跟踪综述:方法、数据、挑战与路线图来源笔记
#segmentation
#survey-needed
#tracking
- AI Driven Soccer Analysis:单主场足球 2D 映射原型来源笔记
- BST:面向羽毛球击球类型识别的骨架动作 Transformer来源笔记
- Broadcast2Pitch:从非受控足球转播视频重建比赛状态来源笔记
- Event2Tracking:用长时多模态上下文重建多智能体足球轨迹来源笔记
- KINEXON Player Tracking:KINEXON player tracking 页面展示 UWB/GPS/LPS 球员追踪系统。来源笔记
- MonoTrack:单目羽毛球击球分割与 3D 轨迹重建来源笔记
- PathCRF:从球员轨迹推断结构化控球路径与足球事件来源笔记
- Second Spectrum / Genius Sports:Genius Sports 收购 Second Spectrum 的公告展示了光学追踪、联赛数据和媒体可视化的商业链路。来源笔记
- SoccerNet 2023 Tracking Challenge MOT4MOT:球员跟踪团队报告来源笔记
- SoccerNet-GSR:足球比赛状态重建锚点来源笔记
- SoccerNet-Tracking:足球多目标跟踪数据集与基准来源笔记
- SoccerNet-v2 Camera Calibration:足球场标定与球员定位来源笔记
- SportMamba:面向团队运动的非线性多目标跟踪来源笔记
- SportsMOT实体
- SportsMOT Dataset Page:SportsMOT 官方数据页记录数据下载、许可和基准说明。来源笔记
- SportsMOT:多运动场景的大规模球员多目标跟踪基准来源笔记
- TeamTrack:全场视角的多运动多目标跟踪数据集来源笔记
- Towards Structured Analysis:广播羽毛球视频的结构化分析早期系统来源笔记
- TrackMAE:用轨迹遮挡与预测学习运动敏感的视频表征来源笔记
- TrackNetV2:高效羽毛球高速小目标 2D 追踪来源笔记
- TrackNetV3:增强羽毛球 shuttle tracking 的数据增强与轨迹校正来源笔记
- TrackNetV4:用运动注意力图增强快速体育小目标追踪来源笔记
- TrackNet:体育高速小目标追踪网络来源笔记
- TranSPORTmer:多智能体体育轨迹理解的统一 Transformer 框架来源笔记
- 体育 AI 研究路线图主题
- 体育 AI 视频理解主题
- 体育姿态估计与跟踪综述:方法、数据、挑战与路线图来源笔记
#video-editing
- A Video is Worth 256 Bases:以时空 EM 低秩基改进零样本视频反演来源笔记
- AVID:用 Temporal MultiDiffusion 做任意长度视频修补来源笔记
- Align-A-Video:面向一致视频编辑的确定性奖励调优来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- CCEdit:以结构—外观解耦实现创意可控视频编辑来源笔记
- DIVE:用 DINO 做主体驱动视频编辑来源笔记
- DynVideo-E:用动态 NeRF 编辑大运动与大视角人体视频来源笔记
- FADE:面向视频编辑的频率感知扩散模型分解来源笔记
- Fairy:用 anchor cross-frame attention 并行加速指令视频编辑来源笔记
- FateZero:融合注意力做零样本文本视频编辑来源笔记
- FiVE-Bench:细粒度视频编辑评测基准来源笔记
- FlowVid:把不完美光流作为软条件的视频编辑来源笔记
- InsViE-1M:通过精细数据构造实现 instruction-based 视频编辑来源笔记
- MaskINT:关键帧扩散编辑与非自回归结构插帧的视频编辑来源笔记
- MotionEditor:参考姿态驱动的人体视频运动编辑来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- Pix2Video:利用图像扩散进行视频编辑来源笔记
- QK-Edit:在 MM-DiT 中重构图像与视频编辑的 attention 注入来源笔记
- RAVE:随机噪声重排的快速一致视频编辑来源笔记
- Shape-aware Text-driven Layered Video Editing:用 UV 变形突破 atlas 的固定形状来源笔记
- SketchVideo:基于草图的视频生成与编辑来源笔记
- StableVideo:用 layered atlas 稳定扩散视频外观编辑来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- VEU-Bench:通用 Vid-LLM 的视频剪辑元素理解基准来源笔记
- VIVE3D:多帧个性化 EG3D 的视角无关人脸视频编辑来源笔记
- VidToMe:用跨帧 token merging 做零样本视频编辑来源笔记
- Video-P2P:用 shared-null inversion 与解耦 guidance 做 attention-control 视频编辑来源笔记
- VideoDirector:借助文本到视频模型实现精确视频编辑来源笔记
- 现有评测是否真的刻画了视频编辑理解能力问题
- 视频编辑主题
- 视频编辑理解实体
- 通用 Vid-LLM 在视频剪辑元素识别、推理与功能判断上仍明显不足判断
- 通过多模态大模型实现语言驱动视频修补来源笔记
#video-generation
- AIGV-Assessor:用大模型评测文本到视频生成感知质量来源笔记
- CAMEL:面向文本驱动视频编辑的因果运动增强来源笔记
- Encapsulated Composition:组合式文本到图像/视频模型高质量视频合成来源笔记
- EvalCrafter:大视频生成模型的多维评测与人工偏好校准来源笔记
- FramePainter:用视频扩散先验增强交互式图像编辑来源笔记
- InsViE-1M:通过精细数据构造实现 instruction-based 视频编辑来源笔记
- LinGen:面向高分辨率分钟级文本到视频生成的线性复杂度框架来源笔记
- MaskINT:关键帧扩散编辑与非自回归结构插帧的视频编辑来源笔记
- MotionFollower:通过 score-guided diffusion 编辑视频运动来源笔记
- MotionStone:用 DiT 解耦运动强度调制的图像到视频生成来源笔记
- OSV:高质量图像到视频生成一步就够来源笔记
- Pix2Video:利用图像扩散进行视频编辑来源笔记
- Reangle-A-Video:把单目视频重演为多视角同步视频来源笔记
- SketchVideo:基于草图的视频生成与编辑来源笔记
- StreamingT2V:一致、动态、可扩展的长视频文本生成来源笔记
- Tora:面向视频生成的轨迹导向扩散 Transformer来源笔记
- Tune-A-Video:单样本调优图像扩散模型做文本到视频生成来源笔记
- VBench:视频生成模型综合评测套件来源笔记
- Video-Bench:人类偏好对齐的视频生成评测来源笔记
- VideoCrafter2:低质量视频与高质量图像协同训练的视频扩散模型来源笔记
- 视频生成主题
- 通过形式化验证评测文本到视频模型的神经符号方法来源笔记
#video-representation
#video-understanding
- AI Driven Soccer Analysis:单主场足球 2D 映射原型来源笔记
- ANetQA:未裁剪视频细粒度组合推理基准来源笔记
- AthletePose3D:高速竞技动作的 3D 姿态与运动学验证来源笔记
- AthleticsPose:真实田径动作的 3D 姿态与部署边界来源笔记
- Automated Offside Detection:基于双固定广角相机的时空越位检测原型来源笔记
- BST:面向羽毛球击球类型识别的骨架动作 Transformer来源笔记
- BadmintonDB:面向球员级比赛分析与预测的羽毛球数据集来源笔记
- BlockGCN:保留骨架拓扑并轻量建模多种关节关系来源笔记
- Broadcast2Pitch:从非受控足球转播视频重建比赛状态来源笔记
- Catapult Athlete Monitoring:Catapult athlete monitoring 页面展示运动员负荷、训练监测和多模态数据产品。来源笔记
- DeepLabCut:DeepLabCut 是少量标注即可训练的无标记关键点追踪工具。来源笔记
- Event2Tracking:用长时多模态上下文重建多智能体足球轨迹来源笔记
- FineCausal:可解释细粒度动作质量评估来源笔记
- FineDiving Repository:FineDiving 仓库提供数据集与代码入口。来源笔记
- FineDiving:程序感知的细粒度动作质量评估来源笔记
- FineGym:体操视频的层级细粒度动作理解来源笔记
- FineSports:多人篮球的层级细粒度时空动作定位来源笔记
- GlitchBench:大型多模态模型能否识别电子游戏故障来源笔记
- HomeCourt:HomeCourt 代表手机相机驱动的消费级训练反馈应用。来源笔记
- Human-in-the-loop Adaptation:团队运动示例检索的人机适配来源笔记
- LOGO:多人长视频的群体动作质量评估来源笔记
- LVBench:极长视频理解基准来源笔记
- MMAction2:MMAction2 是 OpenMMLab 视频理解工具箱,支持动作识别、检测和骨架动作等任务。来源笔记
- MMPose / RTMPose:MMPose 提供 2D/3D 姿态估计工具链,RTMPose 强调实时部署。来源笔记
- MVBench:综合多模态视频理解基准来源笔记
- MediaPipe Pose:MediaPipe Pose / BlazePose 提供移动端友好的 3D landmarks 姿态估计。来源笔记
- MonoTrack:单目羽毛球击球分割与 3D 轨迹重建来源笔记
- MultiSenseBadminton:面向羽毛球表现评估的多传感器生物力学数据集来源笔记
- MultiSports:多人时空动作定位的数据锚点来源笔记
- NFL Hawk-Eye First Down:AP 报道 NFL 引入基于 Hawk-Eye 的首攻测量技术。来源笔记
- OpenCap:OpenCap 用智能手机视频估计人体运动学与动力学,降低实验室级运动捕捉门槛。来源笔记
- OpenPose:OpenPose 是早期多人 2D 关键点检测工具。来源笔记
- PathCRF:从球员轨迹推断结构化控球路径与足球事件来源笔记
- Premier League Semi-Automated Offside:Reuters 报道英超启用半自动越位技术。来源笔记
- ProtoGCN:用运动原型重构放大相似骨架动作的局部差异来源笔记
- Quo Vadis, Action Recognition?:I3D、Kinetics 与 3D 视频预训练来源笔记
- RefereeBench:多运动项目规则化视频裁判评测来源笔记
- SOK-Bench:结合开放世界知识的情境视频推理基准来源笔记
- ST-GCN:骨架动作识别的时空图卷积基线来源笔记
- STI-Bench:精确时空世界理解基准来源笔记
- ShuttleSet:人工标注的羽毛球单打 stroke-level 数据集来源笔记
- SkateFormer:用四类骨架—时间分区实现高效联合注意力来源笔记
- SoccerNet 2022 Challenges Results:足球视频理解挑战早期基线来源笔记
- SoccerNet 2023 Challenges Results:足球视频多任务挑战结果来源笔记
- SoccerNet 2023 Tracking Challenge MOT4MOT:球员跟踪团队报告来源笔记
- SoccerNet Action Spotting:SoccerNet action spotting 是足球视频事件定位的核心公开任务入口。来源笔记
- SoccerNet-GSR:足球比赛状态重建锚点来源笔记
- SoccerNet-Tracking:足球多目标跟踪数据集与基准来源笔记
- SoccerNet-v2 Camera Calibration:足球场标定与球员定位来源笔记
- SoccerNet-v2:广播足球内容、剪辑与回放理解基准来源笔记
- Sports-QA:复杂专业体育视频问答基准来源笔记
- SportsCap:单目体育 3D 运动捕捉与细粒度属性理解来源笔记
- SportsHHI:体育视频中的高层人—人交互检测基准来源笔记
- TacticAI:足球角球战术预测、检索与条件生成来源笔记
- TemPose:面向羽毛球细粒度动作识别的骨架 Transformer来源笔记
- Temporal Parsing Transformer:无步骤标签的有序部件 AQA来源笔记
- TimeSformer:用于视频理解的分解式时空注意力来源笔记
- Towards Active Learning for Action Spotting:足球事件定位的低标注路线来源笔记
- Towards Structured Analysis:广播羽毛球视频的结构化分析早期系统来源笔记
- Towards Universal Soccer Video Understanding:足球专用多任务视觉编码器来源笔记
- TrackMAE:用轨迹遮挡与预测学习运动敏感的视频表征来源笔记
- TrackNetV2:高效羽毛球高速小目标 2D 追踪来源笔记
- TrackNetV3:增强羽毛球 shuttle tracking 的数据增强与轨迹校正来源笔记
- TrackNetV4:用运动注意力图增强快速体育小目标追踪来源笔记
- TrackNet:体育高速小目标追踪网络来源笔记
- Two-Stream Convolutional Networks for Action Recognition:RGB 与光流双流视频表示来源笔记
- VARS:SoccerNet-MVFoul 多视角犯规分类与裁判辅助来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- VideoMAE:数据高效的视频掩码自编码预训练来源笔记
- WEAR:户外健身的第一视角视频与四肢 IMU 数据集来源笔记
- X-VARS:可解释足球视频助理裁判系统来源笔记
- 体育 AI 研究路线图主题
- 体育 AI 视频理解主题
- 体育姿态估计与跟踪综述:方法、数据、挑战与路线图来源笔记
- 羽毛球挥拍动作纠正 demo 应如何定义问题
- 视频理解主题
- 视频表示、运动信息与时序建模主题
- 运动定义文字的人机感知差距能否成为可靠研究基准问题
- 通过多模态大模型实现语言驱动视频修补来源笔记
#vision
#vision-foundations
#vision-language
- ALBEF:先对齐再融合(Align before Fuse)来源笔记
- ALIGN:用噪声文本监督扩展视觉与视觉语言表示学习(Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision)来源笔记
- ARO:视觉语言模型何时像词袋,以及如何改进(When and why vision-language models behave like bags-of-words)来源笔记
- BLIP:用自举式图文预训练统一视觉语言理解与生成(Bootstrapping Language-Image Pre-training)来源笔记
- CIRR:用预训练视觉语言模型检索真实世界图像(Image Retrieval on Real-life Images)来源笔记
- CLIP 系列模型(CLIP Family)实体
- CLIPScore:基于 CLIP 的无参考图文评测来源笔记
- CLIP:用自然语言监督学习可迁移视觉表示来源笔记
- CoCa:对比式图像描述器作为图文基础模型(Contrastive Captioners are Image-Text Foundation Models)来源笔记
- CoLLM:用于组合式图像检索的大语言模型来源笔记
- ColPali 与视觉文档检索(ColPali)实体
- ColPali:用视觉语言模型做高效文档检索(Efficient Document Retrieval with Vision Language Models)来源笔记
- ConCon-Chi:个性化视觉语言的新含义与组合性基准来源笔记
- DataComp:寻找下一代多模态数据集(In search of the next generation of multimodal datasets)来源笔记
- E5-V:使用多模态大语言模型的通用 embedding(Universal Embeddings with Multimodal Large Language Models)来源笔记
- FILIP:细粒度交互式语言-图像预训练(Fine-grained Interactive Language-Image Pre-Training)来源笔记
- FashionIQ:用自然语言反馈检索图像(A New Dataset Towards Retrieving Images by Natural Language Feedback)来源笔记
- FineSports:多人篮球的层级细粒度时空动作定位来源笔记
- HallusionBench:视觉语言幻觉与视觉错觉诊断基准来源笔记
- Human-in-the-loop Adaptation:团队运动示例检索的人机适配来源笔记
- KEDs:知识增强的双流零样本组合式图像检索(Knowledge-Enhanced Dual-stream Zero-shot Composed Image Retrieval)来源笔记
- LAION-5B:用于下一代图文模型的开放大规模数据集(An open large-scale dataset for training next generation image-text models)来源笔记
- LinCIR:仅用语言高效训练零样本组合式图像检索(Language-only Efficient Training of Zero-shot Composed Image Retrieval)来源笔记
- MAPLM:地图与交通场景的真实世界多模态问答基准来源笔记
- MIEB:大规模图像 embedding 评测基准(Massive Image Embedding Benchmark)来源笔记
- MIRACL-VISION:大规模多语言视觉文档检索基准来源笔记
- MMMU:跨学科专家级多模态理解与推理基准来源笔记
- MobileCLIP:通过多模态强化训练得到快速图文模型(Fast Image-Text Models through Multi-Modal Reinforced Training)来源笔记
- No Zero-Shot Without Exponential Data:预训练概念频率决定多模态模型性能来源笔记
- Pic2Word:把图片映射成词,用于零样本组合式图像检索(Mapping Pictures to Words for Zero-shot Composed Image Retrieval)来源笔记
- SEARLE:用文本反演做零样本组合式图像检索(Zero-Shot Composed Image Retrieval with Textual Inversion)来源笔记
- STI-Bench:精确时空世界理解基准来源笔记
- SigLIP 2:具有更强语义理解、定位与 dense features 的多语言视觉语言编码器来源笔记
- SigLIP:语言-图像预训练的 Sigmoid 损失(Sigmoid Loss for Language Image Pre-Training)来源笔记
- Sports-QA:复杂专业体育视频问答基准来源笔记
- SugarCrepe:修复可被捷径攻破的视觉语言组合性基准(Fixing Hackable Benchmarks)来源笔记
- UniIR:训练和评测通用多模态信息检索器(Training and Benchmarking Universal Multimodal Information Retrievers)来源笔记
- VEGGIE:统一指令视频编辑、grounding 与 reasoning segmentation来源笔记
- VLM2Vec:把视觉语言模型训练成通用多模态向量模型(Training Vision-Language Models for Massive Multimodal Embedding Tasks)来源笔记
- ViLEM:图文检索的视觉—语言错误建模(Visual-Language Error Modeling for Image-Text Retrieval)来源笔记
- VideoAuto-R1(arXiv;CVPR 2026 accepted claim pending proceedings):按需推理的视频理解框架来源笔记
- VisRAG:面向多模态文档的视觉检索增强生成(Vision-based Retrieval-augmented Generation on Multi-modality Documents)来源笔记
- Winoground:探测视觉语言组合性(Probing Vision and Language Models for Visio-Linguistic Compositionality)来源笔记
- X-VARS:可解释足球视频助理裁判系统来源笔记
- 一张图胜过 77 个文本 token:在密集描述上评估 CLIP 类模型(A Picture is Worth More Than 77 Text Tokens)来源笔记
- 单 GPU 上的数据高效多模态融合(Data-Efficient Multimodal Fusion on a Single GPU)来源笔记
- 双塔负责可扩展召回,细粒度模块负责精排与关系匹配判断
- 图文对齐、视觉语言模型与多模态表示基础主题
- 图文检索哪个子方向最适合中等算力的研究生项目?问题
- 图文检索的主要瓶颈仍包括数据质量、分布与概念覆盖判断
- 图文检索(Image-Text Retrieval)主题
- 多语言多样性改善视觉语言表示(Multilingual Diversity Improves Vision-Language Representations)来源笔记
- 多边语义关系建模用于图文检索(Multilateral Semantic Relations Modeling for Image Text Retrieval)来源笔记
- 如何审计图文检索中的预训练重叠、概念频率与 benchmark 污染?问题
- 如何让 Cross Encoder 成为高效图文检索的好教师?(How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?)来源笔记
- 怎样构造既难又不错误的图文检索负例?问题
- 有效的条件式与组合式图像检索:结合 CLIP 特征(Effective Conditioned and Composed Image Retrieval Combining CLIP-Based Features)来源笔记
- 标准图文检索分数不足以证明组合性理解判断
- 生成式零样本组合式图像检索(Generative Zero-Shot Composed Image Retrieval)来源笔记
- 组合式查询是图文检索中可落地且仍有缺口的研究切口判断
- 细粒度图文对齐如何兼顾索引效率?问题
- 统一多模态向量是否真的能跨任务、跨语言泛化?问题
- 统一多模态向量需要同时验证任务意图、跨域泛化与检索成本判断
- 视觉语言主题
- 运动定义文字的人机感知差距能否成为可靠研究基准问题
- 通过多模态大模型实现语言驱动视频修补来源笔记