セマンティックセグメンテーションは、最近のコンピュータービジョンにおける主要な研究関心の1つです。ロボット工学や自動運転など、多くの分野の知覚基盤として機能します。セマンティックセグメンテーションの迅速な開発は、特にディープラーニング関連のメソッドの場合、大規模なデータセットに大きく貢献します。 CityscapesやCamVidデータセットなど、複雑な都市シーンでのセマンティックセグメンテーション手法を比較するためのセマンティックセグメンテーションデータセットがいくつか存在します。ここでは、運転中の車に取り付けられたカメラでオブジェクトの側面図がキャプチャされます。また、オブジェクトの上面ビューがキャプチャされる空中イメージと衛星イメージのセマンティックラベリングデータセットも存在します。ただし、オブジェクトの上面図と側面図の両方を観察できる斜めの無人航空機(UAV)の視点から都市のシーンをキャプチャするデータセットはわずかであり、オブジェクト認識のためのより多くの情報を提供します。このホワイトペーパーでは、UAVidデータセット、新しい高解像度UAVセマンティックセグメンテーションデータセットを補完するものとして紹介します。これにより、大規模な変動、移動物体の認識、時間的一貫性の維持など、新たな課題がもたらされます。当社のUAVデータセットは、傾斜したビューで4K高解像度画像をキャプチャする30ビデオシーケンスで構成されています。合計で、300枚の画像は、意味的なラベリングタスク用に8つのクラスで密にラベル付けされています。事前トレーニングを含むいくつかのディープラーニングベースラインメソッドを提供しました。その中で、提案されているマルチスケール拡張ネットは、マルチスケール特徴抽出を介して最高のパフォーマンスを発揮します。 UAVidのWebサイトとラベル付けツールはhttps://uavid.nl/で公開されています。
Semantic segmentation has been one of the leading research interests in computer vision recently. It serves as a perception foundation for many fields, such as robotics and autonomous driving. The fast development of semantic segmentation attributes enormously to the large scale datasets, especially for the deep learning related methods. There already exist several semantic segmentation datasets for comparison among semantic segmentation methods in complex urban scenes, such as the Cityscapes and CamVid datasets, where the side views of the objects are captured with a camera mounted on the driving car. There also exist semantic labeling datasets for the airborne images and the satellite images, where the top views of the objects are captured. However, only a few datasets capture urban scenes from an oblique Unmanned Aerial Vehicle (UAV) perspective, where both of the top view and the side view of the objects can be observed, providing more information for object recognition. In this paper, we introduce our UAVid dataset, a new high-resolution UAV semantic segmentation dataset as a complement, which brings new challenges, including large scale variation, moving object recognition and temporal consistency preservation. Our UAV dataset consists of 30 video sequences capturing 4K high-resolution images in slanted views. In total, 300 images have been densely labeled with 8 classes for the semantic labeling task. We have provided several deep learning baseline methods with pre-training, among which the proposed Multi-Scale-Dilation net performs the best via multi-scale feature extraction. Our UAVid website and the labeling tool have been published https://uavid.nl/.