人間は、物体の一部が遮られている場合でも、物体全体を知覚する優れた能力を備えています。アモーダル知覚のこの能力は、私たちの世界の知覚的および認知的理解の基礎を形成します。ロボットがこの機能で推論できるようにするために、アモーダルパノプティコンセグメンテーションと名付けた新しいタスクを定式化して提案します。このタスクの目標は、スタッフクラスの可視領域のピクセル単位のセマンティックセグメンテーションラベルと、モノクラスの可視領域と遮蔽領域の両方のインスタンスセグメンテーションラベルを同時に予測することです。この新しいタスクの研究を容易にするために、KITTI-360-APSおよびBDD100K-APSとして公開しているピクセルレベルのアモーダルパノプティコンセグメンテーションラベルを使用して、2つの確立されたベンチマークデータセットを拡張します。解釈可能な方法でパフォーマンスを定量化するために、アモーダルパノプティコン品質(APQ)およびアモーダル解析カバレッジ(APC)メトリックとともに、いくつかの強力なベースラインを提示します。さらに、オクルーダーとオクルードの間の複雑な関係を明示的にモデル化することにより、このタスクに対処するための最初のステップとして、新しいアモーダルパノプティコンセグメンテーションネットワーク(APSNet)を提案します。広範な実験的評価は、APSNetが両方のベンチマークで最先端のパフォーマンスを達成し、さらに重要なことに、アモーダル認識の有用性を実証していることを示しています。ベンチマークはhttp://amodal-panoptic.cs.uni-freiburg.deで入手できます。
Humans have the remarkable ability to perceive objects as a whole, even when parts of them are occluded. This ability of amodal perception forms the basis of our perceptual and cognitive understanding of our world. To enable robots to reason with this capability, we formulate and propose a novel task that we name amodal panoptic segmentation. The goal of this task is to simultaneously predict the pixel-wise semantic segmentation labels of the visible regions of stuff classes and the instance segmentation labels of both the visible and occluded regions of thing classes. To facilitate research on this new task, we extend two established benchmark datasets with pixel-level amodal panoptic segmentation labels that we make publicly available as KITTI-360-APS and BDD100K-APS. We present several strong baselines, along with the amodal panoptic quality (APQ) and amodal parsing coverage (APC) metrics to quantify the performance in an interpretable manner. Furthermore, we propose the novel amodal panoptic segmentation network (APSNet), as a first step towards addressing this task by explicitly modeling the complex relationships between the occluders and occludes. Extensive experimental evaluations demonstrate that APSNet achieves state-of-the-art performance on both benchmarks and more importantly exemplifies the utility of amodal recognition. The benchmarks are available at http://amodal-panoptic.cs.uni-freiburg.de.