公司动态
SingleTrack_Project(九)深度学习方法——SiamRPN++
SiamFC只能告诉目标在哪里不能告诉目标的大小目标尺寸只能通过多尺度测试离散的去猜SiamRPN引入了 Anchor 回归 RPN让网络同时做两件事分别是分类分支判断每个 Anchor 是前景目标还是背景与回归分支对前景 Anchor 的位置和大小做微调其中的Anchor即预设框对每个位置预置k个。SiamRPN这个做法就好比已经有很多个预设好的预测框只用根据结果去勾选哪个是合适的并对此进行微调最终得到最准确的预测框。而SiamRPN则是再SiamRPN上做了进一步的改进多层特征融合。原本SiamFC只用最后一个卷积层识别的特征去做互相关但是SiamRPN用ResNet50 空洞卷积代替AlexNet网络提取更丰富的特征同时使用 layer2、layer3、layer4 三层特征每层经过 AdjustLayer 调整到 256 通道最后对每一层分别做深度互相关对结果加权平均。卷积核卷积层进行特征提取的”小矩阵“常说的用卷积层去提取特征就是用卷积核去在图像上滑动每到一个位置就和对应的像素区域做点积运算检测这个区域是否包含它要找的特征。卷积核是在训练过程中自动学习而不是手工设计的。感受野通俗来说就是眼睛所看到的范围视野有多大看到的区域就有多大对应到神经网络中就是输出特征图上的点在原始图像上对应的区域比如卷积核是 3 × 3在原始图像上进行特征提取的时候3 × 3 范围内只提出一个特征那么这个特征对应的感受野就是 3 × 3。空洞卷积空洞卷积是为了扩大感受野的例如有效卷积核还是 3 × 3如果设置空洞卷积 (dilation2)那么此时的感受野就会变为 5 × 5这种做法可以为图像识别保留充足的分辨率避免感受野过小而造成位置信息的丢失举个例子来说明流程SiamRPN就是先输入 255×255 搜索区域然后卷积层通过卷积核去提取特征生成特征图 (15×15×256) 特征图每个点的感受野覆盖了整个目标设置每个点的 5 种 Anchor 预测框进行分类分支 回归分支最终选出选出最优框得到最终的跟踪结果。