全景视频全景分割与细粒度无监督语义分割技术解析
1. 全景视频全景分割(WOD:PVPS)
1.1 定性评估
在不同时间间隔下,对基于ViP - DeepLab的两个基线模型进行了定性评估。通过对比单视图预测和全景预测结果发现,基线模型在大多数场景中表现出色,不过在跟踪小物体、远距离物体以及处理拥挤场景时仍存在挑战。
例如,在图7中展示了两个非相邻时间帧下,基于单图像和全景图像训练及评估的两个ViP - DeepLab基线模型的结果。从图中可以看出,基线模型在非常密集的场景中能够准确跟踪物体。而且,全景模型在某些方面具有优势,如单视图模型在左右图像中对人行横道的预测不一致,而全景模型能够获取场景的完整上下文,避免此类错误;在t0时刻,单视图模型未能跟踪到穿过右前和右侧摄像机的汽车,而全景模型可以正确跟踪该物体。
1.2 基线比较
1.2.1 基于视频的基线
使用ViP - DeepLab进行基于视频的基线比较,并通过提出的加权STQ(wSTQ)进行评估,对比了不同的训练和评估方案:
| 训练方案 | 评估方案 | wSTQ | wAQ | wSQ |
| — | — | — | — | — |
| Ensemble - View | View | 16.92 | 7.61 | 37.33 |
| View | View | 17.78 | 8.21 | 38.46 |
| View | Pano | 14.87 | 6.13 | 36.04 |
| Pano | View | 17.56 | 8.11 | 38.04 |
| Pano |
超级会员免费看
订阅专栏 解锁全文

503

被折叠的 条评论
为什么被折叠?



