RGB入力のみからシーンの深さとカメラの動きを予測することを学ぶことは、難しい課題です。ほとんどの既存の学習ベースの方法は、このタスクを監視された方法で処理します。この方法では、取得に費用がかかる地上の真実データが必要です。最近のアプローチでは、自己監視型学習フレームワークでシーン深度とカメラポーズを推定する可能性を探っています。有望な結果が示されているにもかかわらず、現在の方法は、単眼のビデオから深度とポーズを学習し、通常、シーン構造とカメラモーションの間にマルチビュージオメトリの制約を適用せずに学習するか、入力としてステレオシーケンスを必要としますパラメータを知る必要があります。本論文では、特徴メトリック誤差を最小化することにより微分可能なバンドル調整(BA)レイヤーを組み込むことにより、シーンの深度とカメラの動きを共同で最適化し、最終的な監視信号としてビュー合成でフォトメトリック整合性損失を形成することを提案します。提案されたアプローチは、入力としてラベルなしの単眼ビデオのみを必要とし、KITTIおよびCityscapesデータセットの広範な実験は、入力として単眼ビデオを使用して自己監視アプローチで最先端の結果を達成し、さらにはキャリブレーションされたステレオシーケンスから学習する一連のメソッド(つまり、ポーズの監視)。
Learning to predict scene depth and camera motion from RGB inputs only is a challenging task. Most existing learning based methods deal with this task in a supervised manner which require ground-truth data that is expensive to acquire. More recent approaches explore the possibility of estimating scene depth and camera pose in a self-supervised learning framework. Despite encouraging results are shown, current methods either learn from monocular videos for depth and pose and typically do so without enforcing multi-view geometry constraints between scene structure and camera motion, or require stereo sequences as input where the ground-truth between-frame motion parameters need to be known. In this paper we propose to jointly optimize the scene depth and camera motion via incorporating differentiable Bundle Adjustment (BA) layer by minimizing the feature-metric error, and then form the photometric consistency loss with view synthesis as the final supervisory signal. The proposed approach only needs unlabeled monocular videos as input, and extensive experiments on the KITTI and Cityscapes dataset show that our method achieves state-of-the-art results in self-supervised approaches using monocular videos as input, and even gains advantage to the line of methods that learns from calibrated stereo sequences (i.e. with pose supervision).