与时代共振,AI助力工业缺陷检测( 二 )

文章图片
图2FCN网络拓扑示意图[2]FCN将来自于不同深度层的信息融合
FCN-32s是将特征提取的最后一层经过步长为32的上采样的像素预测结果 。 FCN-16s融合最后一层和4次池化操作以后经过步长为16的上采样的像素预测结果 。 FCN-8s融合前面两者和3次池化操作经过步长为8的上采样的像素预测结果 。 
文章图片
图3FCN不同分辨率下(左一至左三)的分割效果与真实标签的对比(右)[2]
文章图片
图4FCN经验感受野严重缺失原始图像;来自网络最后一层通道的热图;理论感受野;经验感受野
显然 , 经验感受野不够大 , 不足以捕捉全局的背景 。
FCN之后的语义分割模型大致可以分为以下几类:编码器-解码器结构、基于金字塔的模型、递归神经网络、视觉注意力模型 , 生成对抗网络 。 我们着重介绍其中几类能够更好捕捉目标细节 , 增强网络的经验感受野的模型结构 。
编码器-解码器结构与FCN类似 , 编码器相当于下采样提取特征的过程 , 解码器相当于上采样得到预测分割结果的过程 。 如图5 , Unet是这一结构中的代表作[6] 。 为了扩大感受野得到更多尺度的特征信息 , 解码器结构设计为多层卷积池化 。 此外 , 多尺度的信息融合的过程也更为丰富 , 相比于FCN的直接加和 , 这里利用了通道维度拼接的方法 。
注意的是 , 在拼接之前 , 需要把前层的特征图剪裁到和后层一样的大小 。 在上采样时 , 还加入了更为精细的卷积结构 。 SegNet是另一代表性结构[7](如图6) , 在结构上看 , SegNet和U-net其实大同小异 。 区别在于 , SegNet没有直接融合不同尺度的层的信息 , 而是利用了反池化操作 , 防止池化过程里像素位置的丢失 。 反池化是SegNet在池化的时候保留了最大池化对应的位置索引 , 然后上采样的时候加入了这个索引 , 就可以恢复空间信息了 。
在解码器中使用最大池化索引有几个实际优势:
它改善了边界的预测 , 因为避免了像素位置信息的损失;它对算力友好 , 这是由于本身上采样不会参与网络训练;这种形式的上采样可以合并到任何编码器-解码器结构中 。 
文章图片
图5Unet网络拓扑示意图[6]每个蓝框对应一个多通道特征图
通道的数量在框的顶部表示 。 每一层的x-y尺寸在框的左下边缘提供 。 白框表示复制的特征 。 箭头表示不同的操作 。 
文章图片
【与时代共振,AI助力工业缺陷检测】图6Segnet网络拓扑图[7]解码器使用编码器保留的池化索引对其输入进行上采样 , 以生成稀疏特征映射
- 投资|14万股东懵了!宁德时代刚募资450亿 就拿230亿买理财
- 剧本|划定底线红线 剧本杀产业进入合规管理时代
- 套餐资费|广电放号 5G套餐竞争告别“三国时代”
- 小米|小米12S系列官宣7月4日正式发布:小米与徕卡联合研发
- 新书推荐 │ 大数据算法设计与分析
- 最前线 | 腾讯游戏发布40余款产品与项目,《王者荣耀》发布全新规划
- 为了证明人类可与黑猩猩结合,女科学家亲身试验,结果怎么样?
- 腾讯游戏发布40余款产品与项目,《王者荣耀》发布全新规划
- 汽油|今日24时开启!油价或迎年内第2降 重回9元时代:加一箱将少花12.5元
- 宇宙大爆炸与理解生命起源和进化有什么关联?
