公司动态

SwinDETR 学习笔记

📅 2026/8/15 1:47:21
SwinDETR 学习笔记
目录1. 简介2. Swin Transformer2.1 整体架构2.2 Swin Transformer块2.3 分层结构2.4 移动窗口注意力3. SwinDETR 的网络架构4. 总结1. 简介SwinDETR 是将 Swin Transformer 作为骨干网络与 DETR 检测框架相结合的一种目标检测方法。它利用Swin Transformer的分层特征结构和移位窗口自注意力机制在控制计算量的同时提取多尺度图像特征。随后模型通过Transformer编码器和解码器建模全局信息并利用目标查询直接预测类别和边界框。该方法保留了DETR无锚框、无需候选区域和NMS的特点同时增强了对小目标及尺度变化目标的检测能力。2. Swin Transformer将 Transformer从语言领域迁移到视觉领域面临若干挑战例如视觉实体尺度变化显著以及图像像素分辨率远高于文本中的token。Swin Transformer就是为了解决这些差异而提出。2.1 整体架构与 ViT 类似模型首先通过图像块划分模块把输入 RGB 图像切分为互不重叠的图像块。每个图像块被视为一个 token其特征由原始 RGB 像素值拼接而成。论文中使用的图像块因此每个图像块的原始特征维度为 4×4×348。随后通过线性嵌入层将该特征投影到任意维度 C。在这些图像块上应用若干个采用改进自注意力计算方式的 Transformer 模块即 Swin Transformer 模块。这些 Transformer 模块保持token数量不变即维持为。这些模块与线性嵌入层共同构成“阶段1”Stage 1。为产生层次化特征表示随着网络逐渐加深模型通过图像块合并层逐步减少token数量。第一个图像块合并层将每组个相邻图像块的特征进行拼接并在拼接得到的维特征上应用一个线性层。这样token数量减少为原来的即特征图分辨率下采样 2 倍同时输出特征维度设置为。随后继续应用 Swin Transformer 块进行特征变换并把分辨率保持为这一部分称为第 2 阶段。该过程再重复两次形成第 3、4 阶段输出分辨率分别为与。四个阶段共同产生与 VGG、ResNet 等典型卷积网络相同分辨率层级的特征图因此可方便地替换现有视觉方法中的骨干网络。2.2 Swin Transformer块Swin Transformer 用基于移位窗口的模块替换标准 Transformer 块中的多头自注意力MSA其他层保持不变。一个 Swin Transformer 块包含基于移位窗口的 MSA随后是一个中间使用 GELU 非线性的两层 MLP。每个MSA 和 MLP 前均使用 LayerNormLN每个模块后均使用残差连接。2.3 分层结构Swin Transformer 通过在较深层中逐步合并图像块生成层次化特征图。由于自注意力计算仅在各个局部窗口红色部分内进行其计算复杂度与输入图像尺寸呈线性关系。因此Swin Transformer 可以作为通用骨干网络同时应用于图像分类和密集识别任务。相比之下以往的 Vision Transformer 只生成单一低分辨率的特征图并且由于需要在全局范围内计算自注意力其计算复杂度与输入图像尺寸呈二次关系。2.4 移动窗口注意力Swin Transformer 将自注意力限制在局部窗口内计算显著降低复杂度同时通过窗口在相邻层之间发生平移使信息能够跨窗口流动从而在保持局部计算效率的同时扩大感受野。该图展示了所提出的 Swin Transformer 中用于计算自注意力的移位窗口方法。在第层中采用常规的窗口划分方式并在每个窗口内部独立计算自注意力。在下一层中窗口划分方式发生移位形成新的窗口。由于新窗口跨越了第层原有窗口的边界因此在新窗口内进行自注意力计算时可以建立不同原始窗口之间的信息连接。3. SwinDETR 的网络架构从整体上看SwinDETR 可以理解为用 Swin Transformer 替换 DETR 中的骨干特征提取部分并将多尺度特征输入 Transformer 编码器。其典型流程如下输入图像经过 Swin Transformer 骨干网络提取多尺度特征。对多尺度特征进行位置编码后输入编码器建模全局上下文关系。解码器使用 object query 与编码特征进行交叉注意力计算。前馈网络输出类别预测与归一化边界框坐标。推理阶段直接根据阈值筛选检测结果无需 NMS。4. 总结SwinDETR将Swin Transformer的层次化特征提取能力与DETR的端到端检测框架相结合。Swin Transformer通过局部窗口和移位窗口自注意力机制降低了处理高分辨率图像时的计算复杂度DETR则采用目标查询和集合预测方式减少了对锚框及NMS等人工设计组件的依赖。学习这一组合模型有助于理解骨干网络与检测框架之间的协同关系并为进一步研究多尺度Transformer目标检测方法奠定基础。