转载请注明作者和出处: http://blog.csdn.net/john_bh/
paper 地址:DeepIM: Deep Iterative Matching for 6D Pose Estimation
作者及团队:清华大学 & NVIDIA & BNRist University of Washington
会议及时间:ECCV 2018
project: https://rse-lab.cs.washington.edu/projects/deepim/
code:https://github.com/liyi14/mx-DeepIM
code pytorch:https://github.com/NVlabs/DeepIM-PyTorch
1. 主要贡献
虽然将图像直接回归到目标姿态的精度有限,但将目标的渲染图像与输入图像进行匹配可以产生准确的结果。所以作者提出DeepIM,一种6D pose matching 深度神经网络。给定一个初始的姿态估计,DeepIM 能够通过将rendered image 与 observed image 进行匹配来迭代地改进姿态。解耦表示3D location 和3D orientation 迭代训练,预测相对位姿的变换。
- 提出了一个用于迭代的深度网络,基于图像的姿势改进,不需要任何手工制作的图像特征,自动学习内部改进机制;
- 提出了对象姿势之间SE(3)变换的解耦表示,以实现精确的姿态估计;这种表示也能够对unseen object进行精确的姿态估计。

如Fig.1 展示了DeepIM网络的迭代匹配过程。给定测试图像中对象的初始6D姿势估计,DeepIM预测相对于对象的 rendered view 与observed image 匹配的SE(3)变换。通过基于改进的姿势估计迭代地重新渲染对象,到网络的两个输入图像变得越来越相似,从而使网络能够生成越来越精确的姿势估计。
2. DeepIM Framework
DeepIM:给定观测图像和图像中目标的初始姿态估计,网络直接输出相对SE(3)变换,可应用于初始姿态,以改进估计。
- 首先根据已知的初始化pose和CAD模型,渲染图像;
- zooming in observed image和rendered image,用作网络的输入;
- 网络输出相对 SE(3)变换。
2.1 High-resolution Zoom In
当在图像中的物体很小时,很难提取有用的feature进行 matching,为了得到更多的信息,作者将 observed image 和 renderd image 进行放大,然后再入到网络中。
具体做法:作者为observed image 和rendered image生成一个foreground mask,根据mask 扩大边界框对四个图像裁剪,然后放大并执行双线性上采样,以获得与原始图像相同的大小(实验中是480 × 640)。这样在这个操作过程中,对象的宽高比不会改变。
已知 rendered mask m r e n d m_{rend} mrend 和 observed mask m o b s m_{obs} mobs ,crop patch :

- u ∗ , d ∗ , l ∗ , r ∗ u_*, d_*, l_*, r_* u∗,d∗,l∗,r∗ 表示 upper,lower,left,right 前景mask边界;
- x c , y c x_c,y_c xc,yc 表示物体在图像中的2D projection 中心;
- r r r 表示原始图像的长宽比(宽/高);
- λ \lambda λ 表示 expand ratio。
然后,对该patch进行双线性采样,采样到原始图像的大小,本文的原始图像大小为480*640。通过这样做,不仅物体被放大而不被扭曲,而且网络也提供了关于物体中心位置的信息。
2.2 Network Structure

如Fig.3 所示,DeepIM 网络结构图。
- 首先将rendered image , observed image 和两个mask concatenated into 一个 8 通道 tensor 作为网络的输入((3 channels for observed/rendered image,1 channel for each mask);
- 使用flowNet 作为backbone network, 预测两张图像之间的 optical flow,(作者尝试使用VGG16 作为backbone ,但是结果很差,直观地确认与光流相关的表示法对位姿匹配非常有用);
- 姿态估计分支以FlowNetSimple的11个卷积层后的feature map作为输入。它包含两个256维的全连接层,然后是另外两个全连接层,分别用于预测三维旋转和三维平移的四元数。
- 在训练过程中,还增加了两个辅助分支,以正则化网络的特征表示,提高训练的稳定性。一个分支用于预测rendered image和observed image之间的optical flow,另一个分支用于预测observed image中物体的foreground mask。
2.3 Untangled Transformation Representation

△ p \triangle p △p 表示当前估计的pose 与目标pose 的 相对SE(3)变换的表示; R s r c , t s r c R_{src}, t_{src} Rsrc,

DeepIM通过解耦旋转和平移预测,利用深度神经网络进行图像匹配,迭代提升6D姿态估计精度。论文介绍了高分辨率放大技术、网络结构、解耦表示和匹配损失,展示了在LINEMOD和Occlusion LINEMOD数据集上的实验结果。


7259

被折叠的 条评论
为什么被折叠?



