マルチステージの自己教師ありマルチビュー ステレオ (MVS) 方式と比較して、エンドツーエンド (E2E) アプローチは、その簡潔で効率的なトレーニング パイプラインにより、より注目を集めています。最近の E2E 自己監視型 MVS アプローチでは、追加の一貫性制約を提供するためにサードパーティ モデル (オプティカル フロー モデル、セマンティック セグメンテーション モデル、NeRF モデルなど) を統合していますが、これにより GPU メモリの消費量が増加し、モデルの構造とトレーニング パイプラインが複雑になります。この研究では、ES-MVSNet と呼ばれる、エンドツーエンドの自己監視型 MVS の効率的なフレームワークを提案します。現在の E2E 自己監視型 MVS フレームワークの高いメモリ消費を軽減するために、モデルのパフォーマンスを損なうことなくメモリ使用量を 43% 削減するメモリ効率の高いアーキテクチャを紹介します。さらに、非対称ビュー選択ポリシーと領域を意識した深さの一貫性の新しい設計により、追加の一貫性信号についてサードパーティのモデルに依存することなく、E2E 自己教師あり MVS メソッドの中で最先端のパフォーマンスを実現します。 DTU および Tanks&Temples ベンチマークに関する広範な実験により、提案された ES-MVSNet アプローチが E2E 自己教師あり MVS メソッドの中で最先端のパフォーマンスを実現し、多くの教師ありおよびマルチステージ自己教師ありメソッドと競合するパフォーマンスを達成できることが実証されました。
Compared to the multi-stage self-supervised multi-view stereo (MVS) method, the end-to-end (E2E) approach has received more attention due to its concise and efficient training pipeline. Recent E2E self-supervised MVS approaches have integrated third-party models (such as optical flow models, semantic segmentation models, NeRF models, etc.) to provide additional consistency constraints, which grows GPU memory consumption and complicates the model's structure and training pipeline. In this work, we propose an efficient framework for end-to-end self-supervised MVS, dubbed ES-MVSNet. To alleviate the high memory consumption of current E2E self-supervised MVS frameworks, we present a memory-efficient architecture that reduces memory usage by 43% without compromising model performance. Furthermore, with the novel design of asymmetric view selection policy and region-aware depth consistency, we achieve state-of-the-art performance among E2E self-supervised MVS methods, without relying on third-party models for additional consistency signals. Extensive experiments on DTU and Tanks&Temples benchmarks demonstrate that the proposed ES-MVSNet approach achieves state-of-the-art performance among E2E self-supervised MVS methods and competitive performance to many supervised and multi-stage self-supervised methods.