深度補完と物体検出は、無人航空機 (UAV) の空中 3D マッピング、経路計画、および衝突回避によく使用される 2 つの重要なタスクです。一般的なソリューションには、LiDAR センサーからの測定値の使用が含まれます。ただし、生成された点群は多くの場合、まばらで不規則であり、3D レンダリングおよび安全性が重要な意思決定におけるシステムの機能を制限します。この課題を軽減するために、UAV の他のセンサー (物体検出に使用されるカメラ) からの情報を利用して、深度補完プロセスがより高密度の 3D モデルを生成できるようにします。 2 つのセンサーからのデータを融合しながら、空中深度の完了とオブジェクト検出の両方のタスクを実行すると、リソースの効率性に課題が生じます。この課題に対処するには、1 つのパスで 2 つのタスクを共同で実行する新しいアプローチを提案します。提案された方法は、2 つのタスクを共同で学習した機能に公開する、エンコーダに焦点を当てたマルチタスク学習モデルに基づいています。オブジェクト検出経路によって学習されたシーン内のオブジェクトのセマンティックな期待が、不足している深度値を配置しながら、深度補完経路のパフォーマンスをどのように向上させることができるかを示します。実験結果は、提案されたマルチタスク ネットワークが、特に欠陥のある入力にさらされた場合に、シングルタスクのネットワークよりも優れていることを示しています。
Depth completion and object detection are two crucial tasks often used for aerial 3D mapping, path planning, and collision avoidance of Uncrewed Aerial Vehicles (UAVs). Common solutions include using measurements from a LiDAR sensor; however, the generated point cloud is often sparse and irregular and limits the system's capabilities in 3D rendering and safety-critical decision-making. To mitigate this challenge, information from other sensors on the UAV (viz., a camera used for object detection) is utilized to help the depth completion process generate denser 3D models. Performing both aerial depth completion and object detection tasks while fusing the data from the two sensors poses a challenge to resource efficiency. We address this challenge by proposing a novel approach to jointly execute the two tasks in a single pass. The proposed method is based on an encoder-focused multi-task learning model that exposes the two tasks to jointly learned features. We demonstrate how semantic expectations of the objects in the scene learned by the object detection pathway can boost the performance of the depth completion pathway while placing the missing depth values. Experimental results show that the proposed multi-task network outperforms its single-task counterpart, particularly when exposed to defective inputs.