arXiv reaDer
SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation
SegNetと呼ばれるセマンティックピクセル単位のセグメンテーションのための、斬新で実用的な深く完全な畳み込みニューラルネットワークアーキテクチャを提示します。このコアトレーニング可能なセグメンテーションエンジンは、エンコーダーネットワーク、対応するデコーダーネットワーク、それに続くピクセル単位の分類レイヤーで構成されます。エンコーダネットワークのアーキテクチャは、VGG16ネットワークの13の畳み込み層とトポロジ的に同一です。デコーダーネットワークの役割は、ピクセル単位の分類のために、低解像度エンコーダー機能マップをフル入力解像度機能マップにマップすることです。 SegNetの新規性は、デコーダが低解像度の入力フィーチャマップをアップサンプリングする方法にあります。具体的には、デコーダーは、対応するエンコーダーの最大プーリングステップで計算されたプーリングインデックスを使用して、非線形アップサンプリングを実行します。これにより、アップサンプリングを学習する必要がなくなります。アップサンプリングされたマップはスパースで、トレーニング可能なフィルターで畳み込まれ、高密度の特徴マップが生成されます。提案されているアーキテクチャを、広く採用されているFCNとよく知られているDeepLab-LargeFOV、DeconvNetアーキテクチャと比較します。この比較により、優れたセグメンテーションパフォーマンスの達成に伴うメモリと精度のトレードオフが明らかになります。 SegNetは、主にシーン理解アプリケーションによって動機付けられました。したがって、推論時のメモリと計算時間の両方の点で効率的であるように設計されています。また、他の競合するアーキテクチャよりもトレーニング可能なパラメーターの数が大幅に少なくなっています。また、道路シーンとSUN RGB-D屋内シーンセグメンテーションタスクの両方で、SegNetおよびその他のアーキテクチャの制御されたベンチマークを実行しました。 SegNetは、他のアーキテクチャと比較して、競合的な推論時間とメモリ単位の効率的な推論で優れたパフォーマンスを提供することを示します。また、SegNetのCaffe実装とのWebデモも提供しています。
We present a novel and practical deep fully convolutional neural network architecture for semantic pixel-wise segmentation termed SegNet. This core trainable segmentation engine consists of an encoder network, a corresponding decoder network followed by a pixel-wise classification layer. The architecture of the encoder network is topologically identical to the 13 convolutional layers in the VGG16 network. The role of the decoder network is to map the low resolution encoder feature maps to full input resolution feature maps for pixel-wise classification. The novelty of SegNet lies is in the manner in which the decoder upsamples its lower resolution input feature map(s). Specifically, the decoder uses pooling indices computed in the max-pooling step of the corresponding encoder to perform non-linear upsampling. This eliminates the need for learning to upsample. The upsampled maps are sparse and are then convolved with trainable filters to produce dense feature maps. We compare our proposed architecture with the widely adopted FCN and also with the well known DeepLab-LargeFOV, DeconvNet architectures. This comparison reveals the memory versus accuracy trade-off involved in achieving good segmentation performance. SegNet was primarily motivated by scene understanding applications. Hence, it is designed to be efficient both in terms of memory and computational time during inference. It is also significantly smaller in the number of trainable parameters than other competing architectures. We also performed a controlled benchmark of SegNet and other architectures on both road scenes and SUN RGB-D indoor scene segmentation tasks. We show that SegNet provides good performance with competitive inference time and more efficient inference memory-wise as compared to other architectures. We also provide a Caffe implementation of SegNet and a web demo at
updated: Mon Oct 10 2016 21:11:59 GMT+0000 (UTC)
published: Mon Nov 02 2015 15:51:03 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)アソシエイト