【论文笔记】视觉重定位 层级场景坐标回归 Hierarchical Scene Coordinate Classification and Regression 2020

HSC-Net是一种用于视觉定位的场景坐标分类与回归网络,通过层级结构解决大场景中局部场景混淆问题,精度超越DSAC++。采用分层架构,包含两个分类分支和一个回归分支,利用条件层提高模型泛化能力。

Hierarchical Scene Coordinate Classification and Regressionfor Visual Localization

芬兰阿尔托大学 , Facebook AI Research

这篇论文的工作应该是在DSAC++ 的基础上改的,且仅仅对其场景坐标回归网络进行了改进。在大场景中也是SOTA,同时模型足够紧凑,解决了模型尺寸和容量的问题。未来可以考虑综合其他模块的改进进一步提升性能(如RANSAC模块,使用DSAC++的自适应RANSAC,或NG-RANSAC)。

本文针对的问题

DSAC++中,使用一个场景坐标回归网络对像素点对应的场景坐标进行稠密预测,然后使用pnp-RANSAC求解出相机位姿。

本文认为DSAC++的场景坐标回归网络泛化性不够,只适用于小场景。在大场景中感受野受限(DSAC的image patches输入),增大感受野(DSAC++)又容易过拟合。

由此本文提出HSC-Net,一种由粗到细层级结构的场景坐标回归网络。解决了场景坐标回归网络容易产生局部场景混淆的问题。

论文方法介绍

在这里插入图片描述

整体框架与DSAC++一样,但是对其场景坐标回归网络进行了改进,使用分层架构。

改进后的场景坐标回归网络由两个分类分支和一个回归分支

分类分支分别为每个像素预测其区域标签(即属于哪个区域),两层分类分支则可以达到对场景进行层级分割的目的,最后得到sub regions。回归分支则在此基础上再对其场景坐标的偏移量进行回归预测。使用偏移量而不是绝对场景坐标,因为这样网络更容易拟合。

网络的详细结构: 在这里插入图片描述

base regression network 还是VGG_like的,但是在每一个输出层之前都加入了条件层(conditioning layer)。 条件层的想法来自于视觉推理的论文《FiLM: Visual reasoning witha general conditioning layer》。

条件层的结构如图:

在这里插入图片描述

首先有一个条件参数生成器(conditioning parameter generator),其以分类分支预测的标签图L为输入,输出缩放参数γ\gammaγ和平移参数β\beta

内容概要:本文是一份针对全国计算机等级考试(NCRE)二级的全面备考指南,覆盖MS Office高级应用与设计、C语言程序设计和Python语言程序设计三大主流科目。文档按照“认知→题库→实战→冲刺”四步递进结构组织,系统介绍了考试基本信息、报名时间、考试形式、合格标准及科目选择建议,并深入剖析各科高频考点、真题规律与操作技巧。重点内容包括MS Office中的Word长文档排版、Excel函数应用与PPT动画设计;C语言中的指针、数组、函数及程序调试;Python中的基础语法、标准库(如turtle、random)与第三方库(如jieba、wordcloud、matplotlib)的应用。此外,还提供公共基础知识精讲、操作题逐步教学、易错题集锦、模拟软件使用指南和科学的时间管理策略,帮助考生高效备考。; 适合人群:零基础小白、临考突击型考生以及多次未通过的考生,尤其适合非计算机专业希望提升办公技能或理工科学生准备编程语言认证的学习者。; 使用场景及目标:①系统掌握NCRE二级考试所需的知识与实操技能;②通过刷真题、模拟考试和错题复盘提高应试能力;③在短时间内实现从入门到通关的跨越,一次性通过考试。; 阅读建议:建议按文档顺序逐步学习,结合官方考纲和真题进行实践操作,重视动手练习而非仅理论阅读,临考前使用模拟软件全真演练,强化时间分配与答题策略。
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值