LLLMWIKI
ArticleResearch mapReading portalMetadata

Topic · Updated 2026-07-14

Visual Representations and Backbones

比较 CNN、U-Net、ViT、层级 Transformer、GCN 与状态空间模型怎样编码局部、全局、多尺度和时序信息,以及怎样按任务与预算选主干。

Foundation

Visual Representations and Backbones

比较 CNN、U-Net、ViT、层级 Transformer、GCN 与状态空间模型怎样编码局部、全局、多尺度和时序信息,以及怎样按任务与预算选主干。

25 Source notes2 Open questions

Learning path

  1. DefinitionClarify what it is
  2. MechanismFollow the information flow
  3. EvolutionLocate landmark papers
  4. ResearchContinue into active topics

Concept map

From intuition to research connections

25 Source notes
1DefinitionClarify what it is
2MechanismFollow the information flow
3EvolutionLocate landmark papers
4ResearchContinue into active topics

一句话定义

视觉主干网络(vision backbone)把图像、视频、关键点或潜变量编码为可复用表示;分类头、检测头、分割解码器、跟踪关联、生成过程或多模态模块再使用这些表示完成任务。

主干不是整套模型,也没有脱离任务与硬件的“绝对最好”。局部纹理、全局关系、多尺度细节、长时序、显存和延迟会推动不同架构取舍。

一张图看懂原理

为什么同一个主干可以被多个任务复用?

主干位于输入与任务头之间

主干负责把原始输入变成层级或 token 表示;任务头只读取需要的层和尺度。生成模型中的去噪器也可视为任务专用主干,但还接收时间和条件。

  1. 输入与切分像素、patch、帧、关键点或 latent token
  2. 主干编码通过卷积、注意力、图传播或状态更新形成表示
  3. 多尺度/时序特征兼顾语义抽象、空间细节与时间关系
  4. 任务适配分类、框、mask、轨迹、条件去噪或跨模态对齐
Diagram evidenceResNetViTU-Net

图像、视频或结构化输入先被主干编码成多尺度特征,再由分类、检测、分割、跟踪、生成或多模态头使用。

前置概念与术语

  • 感受野(receptive field):某个特征能受多大输入区域影响。
  • 下采样(downsampling):降低空间尺寸以扩大语义范围和节省计算,也可能损失小目标与边界。
  • 多尺度特征(multi-scale features):同时保留不同分辨率的表示,常用于检测、分割和生成。
  • patch / token:把图像区域映射为向量后按序列处理。
  • 自注意力(self-attention):按内容动态汇聚 token;全局注意力计算通常随 token 数平方增长。
  • 跳跃连接(skip connection):跨层直接传递特征;残差相加与 U-Net 拼接是两种不同用法。
  • 归一化(normalization):控制激活尺度;BatchNorm、LayerNorm 等适用协议不同。
  • 预训练表示:先从大数据学习的特征,其迁移能力取决于数据、目标和域匹配。
  • FLOPs、显存与延迟:理论运算、峰值内存和真实时间不是同一个效率指标。

历史演化

视觉主干为什么没有收敛为单一架构?

从卷积层级到多种表示家族并存

每次演化都在重新平衡可训练深度、空间细节、全局关系和计算。后来的架构通常继承前一代机制,而非完全清零。

  1. 2012 · 深卷积表示AlexNet 用大数据与 GPU 证明端到端层级特征
  2. 2015–2016 · 残差与多尺度ResNet 解决深度优化,U-Net 用对称跳连恢复空间细节
  3. 2020–2021 · 视觉 tokenViT 建立全局 token 表示,Swin 引入层级和局部窗口
  4. 2022 · 架构再平衡ConvNeXt 证明现代卷积仍能与 Transformer 竞争
  5. 当前 · 任务化主干GCN、DiT、视频 Transformer 与 SSM 按结构、生成和长序列需求分化
Diagram evidenceAlexNetResNetU-NetSwinConvNeXt

时间线从 AlexNet、ResNet 和 U-Net,发展到 ViT、Swin、ConvNeXt,再到图网络、DiT 与状态空间主干并存。

核心机制

  • CNN / ConvNeXt:共享局部卷积核,天然编码局部性和平移结构;层级下采样适合多尺度任务。
  • 残差网络:让 block 学相对恒等映射的增量,改善深层优化;残差机制也被 Transformer 和生成模型继承。
  • U-Net:编码器抽象语义,解码器恢复分辨率,同尺度跳连保留细节;适合分割和条件去噪。
  • ViT / Swin:把图像转为 token;ViT 强调全局注意力与数据规模,Swin 用窗口和层级结构适配高分辨率密集任务。
  • GCN / Skeleton Transformer:按人体关节或其他非规则结构传播信息;输入拓扑与关键点质量是能力前提。
  • SSM / Mamba 类主干:用状态更新或扫描降低长序列成本;效率需要真实硬件验证。

主要方法分支

面对一个视觉任务,先问什么才能缩小主干选择?

按输入结构和瓶颈选择主干

先判断输出是否要求精细空间、长时间或结构化拓扑,再看数据与部署预算。模型流行度应排在这些约束之后。

  1. 实时局部感知优先 CNN/ConvNeXt,并测高分辨率吞吐与小目标召回
  2. 精细空间恢复使用 U-Net、特征金字塔或层级主干,保留浅层细节
  3. 全局关系与大规模预训练选择 ViT/Swin,检查 token 数、数据规模和注意力成本
  4. 关键点或图结构选择 GCN/Skeleton Transformer,先验证姿态前端质量
  5. 长视频与轨迹比较视频 Transformer、TCN、SSM/Mamba,报告有效时间覆盖
  6. 扩散去噪比较 U-Net、DiT 与 SSM,同时核算 NFE、单步成本与条件接口
Diagram evidenceConvNeXtSwinST-GCNDiffuSSM

决策图按局部实时、精细空间、全局 token、骨架图、长序列和生成去噪六种需求选择架构家族。

奠基论文导读

  1. AlexNet:端到端深卷积表示的历史转折。
  2. ResNet:残差连接与深层优化,重点区分机制与具体家族。
  3. U-Net:编码器—解码器与同尺度细节恢复。
  4. ViT:patch token 与大数据条件下的纯 Transformer。
  5. Swin Transformer:窗口注意力、跨窗口连接与层级表示。
  6. ConvNeXt:现代化卷积对“注意力唯一性”的反证。
  7. ST-GCN:非规则骨架图上的时空表示。
  8. DiffuSSM:状态空间模型作为高分辨率扩散主干对照。

常见误区与局限

  • 误区:backbone 越新越好。 数据量、任务头、分辨率和硬件不同会翻转排序。
  • 误区:FLOPs 低就更快。 内存访问、算子融合、batch、输入形状和实现同样决定延迟。
  • 误区:全局注意力必然理解全局关系。 能建立连接不等于训练目标要求正确属性绑定或时序因果。
  • 误区:U-Net 就是扩散。 U-Net 是网络形状,扩散是概率过程与训练/采样机制。
  • 误区:关键点模型天然可解释。 姿态估计错误、遮挡和视角偏差会进入 GCN,关节热图仍需证据校准。
  • 局限:主干比较常不公平。 数据增强、预训练、分辨率、训练步数与下游 head 必须同时记录。

与研究专题的关系

推荐阅读顺序

  1. 读 ResNet 与 U-Net,掌握残差相加和跨尺度拼接的区别。
  2. 读 ViT、Swin、ConvNeXt,比较全局、局部、层级与现代训练配方。
  3. 根据任务进入 ST-GCN、TimeSformer/VideoMAE 或 DiT/DiffuSSM。
  4. 做选型时记录数据、输入形状、真实延迟和下游输出,不只复制 leaderboard。

证据基础

相关页面