这篇博客分享的是ECCV 2020最佳论文原班人马邓嘉团队的最新力作《DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras》。该深度学习SLAM框架具有高精度、高鲁棒性、强泛化能力等优点。
1 概述
现代SLAM系统大都使用BA(bundle adjustment)来进行优化,它比传统的滤波方法具有更高的精度和实用性。它还有一个优点是,使得SLAM系统易于修改以利用不同的传感器。例如,ORB-SLAM3支持单目、立体、RGB-D和IMU传感器,现代系统可以支持多种相机型号。但是,现代SLAM系统仍然缺乏许多实际应用所需的鲁棒性。运行时的故障以多种形式出现,例如特征轨迹丢失、优化算法发散和漂移累积等。如今,对于这些遗留问题,深度学习已经成为一种重要的解决方案。

论文提出了一种新的基于深度学习的SLAM系统:DROID-SLAM。它通过密集BA层反复迭代更新相机姿态和像素深度。大量的实验表明,该SLAM系统具有高精度、高鲁棒性、强通用性等优点。在具有挑战性的基准数据集上,该SLAM系统大大超越了现有的经典或基于学习的SLAM系统。
DROID-SLAM的强大性能和通用性是由其“可微的循环优化启发设计”(Differentiable Recurrent Optimization-Inspired Design, DROID)实现的。DROID是一种端到端可微架构,结合了经典方法和深度网络的优点。它建立在RAFT光流的基础之上,引入了两项关键创新:
- RAFT迭代更新光流,DROID-SLAM迭代更新相机姿态和深度。RAFT在两个帧上运行,DROID-SLAM的更新可以应用于任意数量的帧上,从而实现所有相机姿态和深度图的联合全局优化,这对于最小化长轨迹和回环的漂移至关重要。
- DROID-SLAM中相机姿态和深度图的每次更新都由可微DBA(Dense Bundle Adjustment)层生成,该层计算相机姿态和逐像素深度的高斯-牛顿更新,以最大限度地提高其与当前光流估计的兼容性。该DBA层利用几何约束,提高精度和鲁棒性,并使单目系统能够处理stereo或RGB-D输入而无需再次进行训练。
DROID-SLAM的设计新颖。在先前的工作中,与DROID-SLAM体系结构最接近的深度学习方法是DeepV2D和BA-Net,它们都专注于深度估计。DeepV2D没有使用BA,而是交替更新深度和相机姿态。BA-Net有一个BA层,但与DROID-SLAM的BA层有很大的不同:前者不是“密集”的,因为它优化的是用于线性组合基础深度图的少量系数,而后者直接优化逐像素深度,不受基础深度图



758

被折叠的 条评论
为什么被折叠?



