Paperreading之一 目标检测专用backbone—DetNet
1.前言:一个专门用于目标检测的backbone—DetNet,目前大多数用于目标检测的backbone都是使用在ImageNet上预训练的网络,比如常用的vgg,resnet系列等等,但是这些网络都是为图像分类而设计的,把这些网络用于目标检测领域,通常不能完美贴合,会或多或少的增加一些层。这样会有两个问题:
- 不能很好的利用ImageNet上预训练的模型,我们知道,目前来说预训练对于大部分算法的精度有很大影响
- 图像分类问题只关注分类,不用关注物体定位,对空间信息不关注,只关注足够大的感受野,但是目标检测领域同时很关注空间信息。如果下采样过多,会导致最后的featuremap很小,小目标很容易漏掉。
2.构建DetNet
针对以上两个问题,face++的研究员提出了专门针对目标检测领域的backbone。设计出一个网络尽量能完整作为目标检测网络的backbone,并且保证足够的感受野和一定的feature map。作者是在FPN基础上进行一些设计和改进的。
对于第一个问题,先看下FPN结构。

上图A就是FPN结构图,少画了一个stage,上面全部都是从4x开始,表示步长为4,也就是该层的feature map是原图的1/4。假设原始fpn的backbone是resnet50,原生resnet(上图B)最后一个stage输出是32x(也就是经过5次下采样),在fpn中增加了一层P6,做了一个下采样。这样就会有前言中的两个问题,增加层不能使用ImageNet预训练模型初始化,过多的下采样导致feature map太小,容易miss掉小物体。


155

被折叠的 条评论
为什么被折叠?



