一対の画像間で局所的な特徴を正確に一致させることは、コンピュータ ビジョンの困難な作業です。これまでの研究では通常、視覚的および幾何学的情報の推論のために、画像内または画像全体にわたるキーポイント上の完全に接続されたグラフを備えた注意ベースのグラフ ニューラル ネットワーク (GNN) が使用されています。ただし、特徴マッチングのコンテキストでは、検出器のオクルージョンや障害によりかなりのキーポイントが再現不可能であるため、メッセージ パッシングには無関係です。反復不可能なキーポイントとの接続により、冗長性が生じて効率が制限されるだけでなく、表現集約プロセスが妨げられ、精度が制限されます。高精度と効率を目標として、再現不可能なキーポイントをバイパスし、一致するキーポイントを利用してコンパクトで意味のあるメッセージ パッシングをガイドする、スパース アテンション ベースの GNN アーキテクチャである MaKeGNN を提案します。より具体的には、双方向コンテキスト認識サンプリング モジュールは、まず、画像ペアから一致性スコアが高く、よく分散されたキーポイントの 2 つの小さなセットを動的にサンプリングします。次に、Matchable Keypoint-Assisted Context Aggregation Module は、サンプリングされた有益なキーポイントをメッセージのボトルネックとみなして、各キーポイントを、一致可能なキーポイント内および一致可能なキーポイントからのみ好ましいコンテキスト情報を取得するように制限し、反復不可能なキーポイントとの無関係で冗長な接続の干渉を回避します。 。さらに、最初のキーポイントとサンプリングされた一致可能なキーポイントの潜在的なノイズを考慮して、MKACA モジュールは、より純粋なデータ依存のコンテキスト伝播のために、一致性ガイドに基づく注意集約操作を採用します。これらの手段により、一般的なアテンション GNN と比較して計算量とメモリの複雑さを大幅に軽減しながら、相対カメラ推定、基本行列推定、および視覚的位置特定に関する最先端のパフォーマンスを実現します。
Accurately matching local features between a pair of images is a challenging computer vision task. Previous studies typically use attention based graph neural networks (GNNs) with fully-connected graphs over keypoints within/across images for visual and geometric information reasoning. However, in the context of feature matching, considerable keypoints are non-repeatable due to occlusion and failure of the detector, and thus irrelevant for message passing. The connectivity with non-repeatable keypoints not only introduces redundancy, resulting in limited efficiency, but also interferes with the representation aggregation process, leading to limited accuracy. Targeting towards high accuracy and efficiency, we propose MaKeGNN, a sparse attention-based GNN architecture which bypasses non-repeatable keypoints and leverages matchable ones to guide compact and meaningful message passing. More specifically, our Bilateral Context-Aware Sampling Module first dynamically samples two small sets of well-distributed keypoints with high matchability scores from the image pair. Then, our Matchable Keypoint-Assisted Context Aggregation Module regards sampled informative keypoints as message bottlenecks and thus constrains each keypoint only to retrieve favorable contextual information from intra- and inter- matchable keypoints, evading the interference of irrelevant and redundant connectivity with non-repeatable ones. Furthermore, considering the potential noise in initial keypoints and sampled matchable ones, the MKACA module adopts a matchability-guided attentional aggregation operation for purer data-dependent context propagation. By these means, we achieve the state-of-the-art performance on relative camera estimation, fundamental matrix estimation, and visual localization, while significantly reducing computational and memory complexity compared to typical attentional GNNs.