与时代共振,AI助力工业缺陷检测

与时代共振,AI助力工业缺陷检测
文章图片
由于深度学习强大的特征提取能力 , 代替了人工目检和传统的机器视觉 , 成为了工业缺陷检测的新利器 。 然而 , 基于深度学习的语义分割技术在工业缺陷检测领域的应用仍具有挑战性 。 本文先对比自然场景下的语义分割 , 概述了工业缺陷检测背景下语义分割技术的特点;接着 , 对于工业缺陷检测的常见难点 , 对常见的解决方案进行介绍 。 最后 , 作者提出了关于工业缺陷检测实际应用中一些问题的思考 。
语义分割是指使用语义标签对图像中的每一个像素进行分类 。 相比图像分类 , 前者要求更高 , 因为后者只是预测整个图像的单个标签[1] 。 相比于人工目检的费时费力 , 传统机器视觉强依赖于工程师的经验与试错 , 基于深度学习的方法由于其端到端自动提取特征实现分割过程的特点而逐渐崭露头角 。 FCN(全卷积神经网络)[2]作为基于深度学习的语义分割技术的开山之作早在2014年就已经被提出 , 但是计算机视觉背景下的语义分割研究大多以自然场景为主 , 例如常用的cityscape数据集[3] , 便是涵盖了城市道路、车 , 人 , 树等物体的自然场景数据集 。 工业缺陷检测相比于自然场景 , 类别更少 , 而且工件表面一般背景干扰小 , 变化更少 , 而且可以通过硬件(如打光)等方式去改良光照等条件以获取更好的数据集 。 那么是否意味着工业缺陷检测中的语义分割更为简单呢?
其实不然 , 简单来说 , 工业缺陷检测中的语义分割存在以下的问题:
以磁瓦缺陷数据集[4]为例 , 线状物体在多种缺陷或者无缺陷情况都有出现 。 这是这一数据集的固有属性 , 也是缺陷检测难做的原因 。 有一些情况 , 由于正负样本类内差异小 , 比如按照面积、灰度值等绘制其直方图 , 中间过渡区域永远存在一定量的样本 , 处于灰色地带 , 很难分辨 。 同一类缺陷下 , 缺陷的大小 , 形状 , 位置多变 。 有些数据集中 , 严重存在着正负样本不平衡的问题 , 良品多 , 不良率小 。 例如在磁瓦缺陷数据集中 , 有些裂痕或者空洞的尺寸很小 , 对于目标细节的分辨率要求高 。 与时代共振,AI助力工业缺陷检测
文章图片
图1磁瓦缺陷数据集[4]该数据集收集了6种常见磁瓦缺陷的图像 , 并做了语义分割的标注 。
下面我们结合上述难点 , 对于工业缺陷检测的常见难点 , 对常见的解决方案进行介绍:
Long等人提出了全卷积神经网络(FCN)[2]是基于深度学习的语义分割模型的一个里程碑 。 FCN将常用的CNN架构(如VGG16和GoogleNet)中的全连接层替换成卷积层 , 即整个网络结构为先通过卷积层下采样得到热图 , 再上采样得到空间分割映射图 。 如图2所示 , 如果直接将经过5次池化操作后得到的热图上采样 , 则得到FCN32s 。 但是这样的效果很差 , 这是经过多次卷积池化操作 , 虽然得到的语义信息不断增强 , 但是也造成了像素位置等信息的损失 。
因此 , FCN采用了(skip-connection)结构 , 这一结构将不同尺度的信息融合 , 这里主要用到的是将不同尺度的热图相加 , 得到了最终的分割结果(FCN8s) 。 相比于真实分割 , 网络推理的结果忽略了很多目标细节结构 , 而在实际工业缺陷背景下 , 由于缺陷级别低 , 特别是有些缺陷的判定会规定尺寸 , 例如小于某一尺寸的缺陷可以算作良品 。 所以选择能够提高目标细节分辨率的网络特别重要 。
此外 , FCN表现不好的另一原因在于经验感受野和理论感受野的不一致[5] 。 感受野(ReceptiveField)是指卷积神经网络每一层输出的特征图(featuremap)上的像素点在输入图片上映射的区域大小 。 图4的实验结果证明 , FCN的经验感受野不及理论感受野的1/4 , 因此选择能够增强经验感受野的拓扑也是另一个重要的问题 。