Maximize the Exploration of Congeneric Semantics for Weakly Supervised Semantic Segmentation
画像データの数が増加し、対応するラベルが不足しているため、最近、コンピュータビジョンのタスク、特にきめ細かいセマンティックセグメンテーションの問題で、弱教師あり学習が大きな注目を集めています。高価なピクセルごとの注釈による人間の努力を軽減するために、私たちの方法は、取得がはるかに簡単な画像レベルのタグを使用した弱教師ありセマンティックセグメンテーション(WSSS)に焦点を当てています。ピクセルレベルのセグメンテーションと画像レベルのラベルの間には大きなギャップが存在するため、各ピクセルに画像レベルのセマンティック情報をどのように反映するかが重要な問題です。同じクラスから最大までの同種の意味領域を探索するために、同じクラスラベルを含む異なる画像からの自己検出パッチに基づいてパッチレベルグラフニューラルネットワーク(P-GNN)を構築します。パッチは、オブジェクトを可能な限りフレーム化し、背景をできるだけ少なくすることができます。ノードとしてパッチを使用して確立されたグラフネットワークは、類似したオブジェクトの相互学習を最大化できます。パッチの埋め込みベクトルをノードと見なし、トランスフォーマーベースの補完学習モジュールを使用して、異なるノード間の埋め込みの類似性に従って重み付きエッジを構築します。さらに、セマンティック情報をより適切に補足するために、ネットワーク構造全体に一致するソフト補完損失関数を提案します。人気のあるPASCALVOC 2012ベンチマークで実験を行い、モデルは最先端のパフォーマンスを生み出します。
With the increase in the number of image data and the lack of corresponding labels, weakly supervised learning has drawn a lot of attention recently in computer vision tasks, especially in the fine-grained semantic segmentation problem. To alleviate human efforts from expensive pixel-by-pixel annotations, our method focuses on weakly supervised semantic segmentation (WSSS) with image-level tags, which are much easier to obtain. As a huge gap exists between pixel-level segmentation and image-level labels, how to reflect the image-level semantic information on each pixel is an important question. To explore the congeneric semantic regions from the same class to the maximum, we construct the patch-level graph neural network (P-GNN) based on the self-detected patches from different images that contain the same class labels. Patches can frame the objects as much as possible and include as little background as possible. The graph network that is established with patches as the nodes can maximize the mutual learning of similar objects. We regard the embedding vectors of patches as nodes, and use transformer-based complementary learning module to construct weighted edges according to the embedding similarity between different nodes. Moreover, to better supplement semantic information, we propose soft-complementary loss functions matched with the whole network structure. We conduct experiments on the popular PASCAL VOC 2012 benchmarks, and our model yields state-of-the-art performance.
