arXiv reaDer
曲がる現実:パノラマセマンティックセグメンテーションに適応するための歪みを意識したトランスフォーマー
Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation
360度の指向性ビューを備えたパノラマ画像は、周囲の空間に関する徹底的な情報を網羅し、シーンを理解するための豊富な基盤を提供します。この可能性を堅牢なパノラマセグメンテーションモデルの形で展開するには、大量の高価なピクセル単位の注釈が成功に不可欠です。このような注釈は利用できますが、主に、既成のパノラマモデルをトレーニングするための最適ではないリソースとして機能する狭角のピンホールカメラ画像に使用できます。 360度のパノラマでの歪みと明確な画像の特徴の分布は、注釈が豊富なピンホールドメインからの転送を妨げるため、パフォーマンスに大きな打撃を与えます。このドメインの違いを回避し、ピンホールおよび360度のサラウンドビジュアルからのセマンティックアノテーションをまとめるために、変形可能パッチ埋め込み(DPE)および変形可能MLP(DMLP)コンポーネントでオブジェクトの変形とパノラマ画像の歪みを学習することを提案します。パノラミックセマンティックセグメンテーション用トランス(Trans4PASS)モデル。最後に、マルチスケールプロトタイプ機能を生成し、教師なしドメイン適応のために相互プロトタイプ適応(MPA)でそれらを調整することにより、ピンホールおよびパノラマ機能の埋め込みで共有セマンティクスを結び付けます。屋内のStanford2D3Dデータセットでは、MPAを備えたTrans4PASSは、完全に監視された最先端のパフォーマンスと同等のパフォーマンスを維持し、1,400を超えるラベル付きパノラマの必要性を削減します。屋外のDensePASSデータセットでは、最新技術を14.39%mIoU破り、新しいバーを56.38%に設定します。コードはhttps://github.com/jamycheung/Trans4PASSで公開されます。
Panoramic images with their 360-degree directional view encompass exhaustive information about the surrounding space, providing a rich foundation for scene understanding. To unfold this potential in the form of robust panoramic segmentation models, large quantities of expensive, pixel-wise annotations are crucial for success. Such annotations are available, but predominantly for narrow-angle, pinhole-camera images which, off the shelf, serve as sub-optimal resources for training panoramic models. Distortions and the distinct image-feature distribution in 360-degree panoramas impede the transfer from the annotation-rich pinhole domain and therefore come with a big dent in performance. To get around this domain difference and bring together semantic annotations from pinhole- and 360-degree surround-visuals, we propose to learn object deformations and panoramic image distortions in the Deformable Patch Embedding (DPE) and Deformable MLP (DMLP) components which blend into our Transformer for PAnoramic Semantic Segmentation (Trans4PASS) model. Finally, we tie together shared semantics in pinhole- and panoramic feature embeddings by generating multi-scale prototype features and aligning them in our Mutual Prototypical Adaptation (MPA) for unsupervised domain adaptation. On the indoor Stanford2D3D dataset, our Trans4PASS with MPA maintains comparable performance to fully-supervised state-of-the-arts, cutting the need for over 1,400 labeled panoramas. On the outdoor DensePASS dataset, we break state-of-the-art by 14.39% mIoU and set the new bar at 56.38%. Code will be made publicly available at https://github.com/jamycheung/Trans4PASS.
updated: Thu Mar 17 2022 23:17:38 GMT+0000 (UTC)
published: Wed Mar 02 2022 23:00:32 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト