arXiv reaDer
PGGANet:個人の再識別のためのポーズガイドグラフ注意ネットワーク
PGGANet: Pose Guided Graph Attention Network for Person Re-identification
人物再識別(ReID)は、さまざまなカメラでキャプチャされた画像から人物を取得することを目的としています。ディープラーニングベースのReIDメソッドの場合、人物画像のグローバルな特徴と一緒にローカルな特徴を使用すると、人物を取得するための堅牢な特徴表現を提供できることが証明されています。人間のポーズ情報は、人間の骨格の位置を提供して、ネットワークがこれらの重要な領域により多くの注意を払うように効果的にガイドし、背景やオクルージョンからのノイズの気晴らしを減らすのにも役立ちます。ただし、以前のポーズ関連の作業で提案された方法では、ポーズ情報の利点を十分に活用できない可能性があり、さまざまなローカル機能のさまざまな寄与を考慮していませんでした。本論文では、ポーズ誘導グラフ注意ネットワーク、グローバル機能用の1つのブランチ、ミッドグラニュラーボディ機能用の1つのブランチ、およびファイングラニュラーキーポイント機能用の1つのブランチで構成されるマルチブランチアーキテクチャを提案します。事前にトレーニングされたポーズ推定器を使用して、局所特徴学習のキーポイントヒートマップを生成し、類似関係をモデル化することによって抽出された局所特徴の寄与重みを再評価するグラフ注意畳み込み層を注意深く設計します。実験結果は、識別的特徴学習に対する私たちのアプローチの有効性を示しており、私たちのモデルがいくつかの主流の評価データセットで最先端のパフォーマンスを達成していることを示しています。また、ホリスティックデータセット、部分データセット、オクルードデータセット、クロスドメインテストなど、ネットワークの有効性と堅牢性を証明するために、さまざまなアブレーション研究を実施し、さまざまな種類の比較実験を設計しています。
Person re-identification (ReID) aims at retrieving a person from images captured by different cameras. For deep-learning-based ReID methods, it has been proved that using local features together with global feature of person image could help to give robust feature representations for person retrieval. Human pose information could provide the locations of human skeleton to effectively guide the network to pay more attention on these key areas and could also help to reduce the noise distractions from background or occlusions. However, methods proposed by previous pose-related works might not be able to fully exploit the benefits of pose information and did not take into consideration the different contributions of different local features. In this paper, we propose a pose guided graph attention network, a multi-branch architecture consisting of one branch for global feature, one branch for mid-granular body features and one branch for fine-granular key point features. We use a pre-trained pose estimator to generate the key-point heatmap for local feature learning and carefully design a graph attention convolution layer to re-evaluate the contribution weights of extracted local features by modeling the similarities relations. Experiments results demonstrate the effectiveness of our approach on discriminative feature learning and we show that our model achieves state-of-the-art performances on several mainstream evaluation datasets. We also conduct a plenty of ablation studies and design different kinds of comparison experiments for our network to prove its effectiveness and robustness, including holistic datasets, partial datasets, occluded datasets and cross-domain tests.
updated: Mon Nov 29 2021 09:47:39 GMT+0000 (UTC)
published: Mon Nov 29 2021 09:47:39 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト