公司动态
AI筑基录——卷积篇
前言我们前面几讲把神经网络基本的框架差不多搭建完成本来这一期我本来是想分享线性层的部分但是我觉得还是先分享卷积部分的内容这样到时候说到线性层部分的时候会更加容易理解这一讲我们来了解一下卷积明白卷积是什么还有对应的池化归一化等内容这一讲的内容会相对比较少专栏AI筑基录前面几期比较偏理论内容相对来说会比较枯燥但是这个是我们学习中一定要克服的后面我们会给大家比较有趣的实战作业没有看我们上一期的内容的可以看看上期的内容内容连贯起来会更加深刻上一期的链接我放到下面方便大家观看学习AI筑基录——损失函数篇-CSDN博客AI筑基录——激活函数篇-CSDN博客AI筑基录——梯度下降篇-CSDN博客卷积是什么在了解卷积之前我想先和大家介绍一下图片这个时候会有小伙伴问图片不就是我们经常接触的吗相机一拍就有了对但是实际图片里面隐藏许多细碎的知识把图片说清楚了我们后续卷积的理解才能顺利图片的构成像素我们平时看到一张图片第一反应可能是图片中有什么人物、物体或者场景但是计算机并不能像人一样直接理解图片内容在计算机眼中一张图片实际上就是一堆按照一定顺序排列的数字而组成图片最基本的单位就是像素我们可以把一张图片想象成由许多非常小的方格拼接而成每一个小方格就是一个像素。单独观察一个像素时我们可能只能看到一种颜色但是当大量像素按照一定的位置排列在一起后就形成了我们所看到的完整图片一般来说我们规定 0 表示的是黑色255 表示的是白色那么这其实就是一张由 4×4 个像素组成的灰度图片所以从计算机的角度来看图片并不是一个抽象的画面而是一个由数值组成的矩阵分辨率我们平时可能会听到 4K 超清实际上就是 3840×2160表示水平方向有 3840 个像素点垂直方向有 2160 个像素点这样的一张图片有 3840×2160 8294400个像素一般情况下在显示范围相同的前提下像素数量越多图片能够保存的细节也就越丰富有一个点注意一下分辨率高不一定代表图片就一定清晰图片是否清晰还受到拍摄质量、压缩程度、对焦、噪声以及显示尺寸等因素影响灰度图彩色图前面的例子中每一个像素只使用一个数值表示亮暗因此它是一张灰度图片通常是用 0~225去表示一个灰度像素比如一个经典的数据集 —— MNIST 手写数据集就是一个灰度图片这个后面我们实战的时候会用到彩色图片不能只用一个数值描述一个像素我们常见的彩色图片使用 RGB 三个颜色通道所以一张高度为 H、宽度为 W 的 RGB 图片可以看成三个大小相同的矩阵叠放在一起这三个矩阵分别保存红、绿、蓝三个通道的信息这三个颜色也被称为三原色所有的颜色都可以用这三个按照不同的比例进行混合RGB图片中的通道表示颜色信息卷积网络后续层中的通道通常表示不同的特征信息这个很重要通道的概念是卷积很重要的点那通道我们可以怎么理解呢通道可以理解成同一张图片中用来分别保存不同类型信息的多个二维矩阵我们深度学习一般采用的是 PyTorch 框架在这个框架下我们通常会把通道放到前面由上面讲我们知道我们训练的时候是按一个 batch 计算的所以一般我们输入的信息是B,C,H,W卷积卷积计算假设你是真的零基础你可能读到这里会有点懵那我们现在正是说一下卷积的内容看完这个部分再和前面的内容结合一下我相信你一定可以豁然开朗实际上我们人眼观察图片的时候也不是先把所有像素放在一起分析我们通常会先注意到一些局部信息例如边缘线条颜色纹理等等然后再把这些局部特征逐渐组合成眼睛、鼻子、轮廓最后识别出完整物体你感受不到是因为我们大脑处理的速度太快了我们又知道神经网络设计的初衷就是想让计算机像人一样思考问题处理问题因此我们卷积的时候就是先从浅层的信息开始提取比如现实边缘信息水平信息简单信息后面就是变成比较复杂的语义信息因此我们可以看出卷积是提取信息的一个方式实际上是一种特征提取的工具那么卷积是怎么提取特征的呢卷积是采用卷积核去扫描原图进行一个乘法加和计算得到一个特征值我们这边看一个例子假设我们原图的矩阵是卷积核的大小是:第一次扫描向右移动一次继续按照同样的方法扫描完全部16个位置得到假设觉得语言有点抽象缺少动态感的话我们可以看看下面的图片会比较清晰看到这里可能会有点疑问这个卷积核里的数字是谁定的答案是在神经网络中这些数字不是人设计的而是网络自己学出来的一开始里面的数字是随机初始化得到的卷积核的数值是可学习的参数在反向传播中不断的更新学习新的数值可能还会有一个疑问就是在多通道中卷积怎么扫描实际上多通道中对应的卷积核也是多通道的举一个例子我们在 RGB 通道中卷积核也有 3 个通道分别对应 R、G、B。扫描时卷积核的每个通道和图像的对应通道做乘加最后把三个通道的结果加起来得到一个输出值。所以一个卷积核输出一个通道的特征图。如果我们想要提取多种特征比如同时检测边缘、纹理、颜色就用多个卷积核每个卷积核输出一个通道最终得到多通道的特征图Padding 填充我们可以发现原图的大小是 7*7但是经过我们卷积之后特征图变成了 5*5 的这是因为卷积核每一次只能覆盖图片内部区域而边缘位置参与计算的次数会比较少我们通过观察会发现一个问题如果不断进行卷积操作会出现两个问题图片尺寸不断缩小边缘信息容易丢失尺寸减小我们在卷积的过程中可以直观的看出但是边缘信息是什么说法呢是因为边缘信息可能就是我们重要的信息但是由于卷积主要扫描图片内部区域边缘像素参与计算次数较少因此我们想在卷积之前给图片周围增加一些额外的信息让边缘也能够充分参与卷积计算Padding可以帮助我们解决这个问题常见的方式就是在我们图片的周围补0我们可以看看卷积的输出公式 其中H输入高度PPadding大小K卷积核大小SStride步长我们可以举一个例子计算在没有填充的时候也就是 P 0 的情况K 3H 7S 1这个时候代入计算输出是 5在有填充的时候也就是 P 1 的情况K 3H 7S 1这个时候代入计算输出是 7这个结果和我们一开始设想的是一样的Stride 步长聪明的你可能会有一个疑问如果卷积核每次只移动一个像素那计算量是不是太大没错的所以参数 Stride 就是控制卷积核移动距离假设为 1 表示的就是每隔一个移动一位假设为 2 就是每隔两位移动一位这个效果就是卷积输出的尺寸减小同时计算量减小池化卷积解决了特征提取的问题但是特征太多怎么办池化就是专门解决这个问题的降低空间尺寸保留重要信息减少计算量在计算上池化和卷积有点相似也会使用一个小窗口在特征图上滑动但卷积窗口会进行对应位置相乘再求和而池化通常只对窗口中的数值进行一种简单的统计操作比如说去最大值或者是平均值池化通常没有需要学习的权重参数它主要负责压缩特征图最大池化在窗口取最大值保留的是每个局部区域中响应最强的特征例如某一个卷积通道正在检测边缘那么数值越大可能表示该位置越符合这个卷积核想寻找的特征。最大池化就会把最明显的响应保留下来平均池化在窗口取平均值保留的是一个区域中的整体平均信息在经典卷积神经网络中最大池化比较常见。不过现代网络中也经常使用带步长的卷积代替池化进行下采样感受野感受野这个名词在后面的学习中我们会经常听到的这个和视野差不多视野越大感受野就越大我们举一个例子例如使用一个 3×3 卷积核时输出特征图中的一个数值来自输入图像中的一个 3 ×3 区域因此这一层输出位置的感受野是 3 ×3如果再叠加一个 3×3、Stride 为 1 的卷积层第二层中的一个位置不只是看到上一层的 3×3它对应到原图上时实际覆盖范围会变成 5×5以此类推归一化假设前一层卷积输出的特征值主要分布在 -1~1 之间经过若干层计算后下一层的特征值可能变成 -20~30 之间再往后数值分布还会不断发生变化如果不同层输出的数值尺度相差很大就可能导致梯度更新不稳定对学习率更加敏感网络收敛速度变慢深层网络更难训练因此我们希望对中间特征进行适当调整让它们保持在相对稳定的数值范围内归一化就是专门解决因为量纲不同和难度分布不同所带来的不公平这样的一个问题归一化的操作一般就是减去平均值(消除绝对数值对大小的影响)再除以标准差(给数据统一单位)归一化是对数据的数值分布进行调整不同归一化方法使用的基础计算大致相似主要区别在于它们选择哪些维度的数据计算均值和方差我们常用的归一化有两种分别是层归一化和批归一化下面介绍这两个归一化批归一化对每一个通道分别进行归一化也就是说同一个通道中会涉及到不同图片的数据会参与计算不同空间位置的数据也会参与计算不同通道不会混在一起计算层归一化在每个样本内部进行归一化不需要依赖其他图片或者其他样本一般这样的归一化是用在 Transformer 网络文字描述这个归一化缺乏动态感和例子我们看看下面的图片我们可以看到对于批归一化会把不同特征的内容给平均了这样会导致语义信息丢失所以 Transformer 通常都是采用层归一化自己内部的词语进行平均可以保证语义信息不会被中和那有小伙伴会问既然这样的话那我们就在每一步之间都进行归一化会存在两点问题1.拖慢训练速度因为归一化也是需要耗费时间的2. 数据本身发生的偏移或幅度变化也正是网络需要学习的重要特征如果频繁使用归一化会破坏模型学习这一部分的区别总结这一将的概念比较多还是得花点时间记忆一下实际上卷积的种类不止介绍的这个普通卷积比如还有深度可分离卷积分组卷积空洞卷积等等内容后面我们专栏AI筑基录也会慢慢推进这一些内容有了前面几期的内容我们下一期就是用 MNIST 数据集做一个简单的实战我们用完整的神经网络做一个分类任务浅浅期待一下AI筑基录的专栏会慢慢更新完带大家有体系的理解神经网络的由来制作不易喜欢博主文章的可以点赞收藏关注这些都是我持续更新的动力