Simultaneous Object Detection and Semantic Segmentation
 カメラ画像のオブジェクト検出とセマンティックセグメンテーションは、自動車両にとって重要なタスクです。計画および行動モジュールが他の道路利用者について推論できるように、オブジェクト検出が必要です。セマンティックセグメンテーションは、たとえば、空き領域情報と、環境の静的および動的な部分に関する情報を提供します。畳み込みニューラルネットワークを使用して両方のタスクを解決するための多くの研究がありました。これらのアプローチは良好な結果をもたらしますが、計算が要求されます。実際には、検出パフォーマンス、検出品質、タスク数の間で妥協点を見つける必要があります。そうでなければ、自動車両のリアルタイム要件を満たすことはできません。この作業では、両方のタスクを同時に解決するニューラルネットワークアーキテクチャを提案します。このアーキテクチャは、現在のハードウェアの1 MPイメージで約10 Hzで動作するように設計されています。私たちのアプローチは、挑戦的なCityscapesベンチマークでのセマンティックセグメンテーションタスクの平均IoU 61.2%を達成しています。また、自動車の平均精度は69.3%、KITTIベンチマークの難易度は中程度の67.7%です。
Both object detection in and semantic segmentation of camera images are important tasks for automated vehicles. Object detection is necessary so that the planning and behavior modules can reason about other road users. Semantic segmentation provides for example free space information and information about static and dynamic parts of the environment. There has been a lot of research to solve both tasks using Convolutional Neural Networks. These approaches give good results but are computationally demanding. In practice, a compromise has to be found between detection performance, detection quality and the number of tasks. Otherwise it is not possible to meet the real-time requirements of automated vehicles. In this work, we propose a neural network architecture to solve both tasks simultaneously. This architecture was designed to run with around 10 Hz on 1 MP images on current hardware. Our approach achieves a mean IoU of 61.2% for the semantic segmentation task on the challenging Cityscapes benchmark. It also achieves an average precision of 69.3% for cars and 67.7% on the moderate difficulty level of the KITTI benchmark.
updated: Thu Feb 13 2020 13:47:18 GMT+0000 (UTC)
published: Mon May 06 2019 22:45:22 GMT+0000 (UTC)
