Improving Weakly-supervised Object Localization via Causal Intervention
最近出現した弱教師ありオブジェクトローカリゼーション(WSOL)メソッドは、画像レベルのラベルを使用するだけで、画像内のオブジェクトをローカライズすることを学習できます。以前の作品は、小さくてまばらな識別注意マップから間隔オブジェクトを認識しようと努めていますが、共起交絡因子(鳥と空など)を無視しているため、モデル検査(CAMなど)でオブジェクトとコンテキストを区別するのが困難です。 。この論文では、因果的介入(CI)を介してこの課題に取り組むための初期の試みを行います。 CI-CAMと呼ばれる提案された方法は、画像、コンテキスト、およびカテゴリ間の因果関係を調査して、クラスアクティベーションマップでの偏った共起を排除し、オブジェクトのローカリゼーションの精度を向上させます。いくつかのベンチマークでの広範な実験は、交絡するコンテキストから明確なオブジェクト境界を学習する際のCI-CAMの有効性を示しています。特に、共起交絡因子に深刻な影響を受けているCUB-200-2011では、CI-CAMは従来のCAMベースのベースラインを大幅に上回っています(上位1のローカリゼーション精度で58.39%対52.4%)。 ImageNetなどのより一般的なシナリオでは、CI-CAMは最先端の技術と同等のパフォーマンスを発揮します。
The recent emerged weakly supervised object localization (WSOL) methods can learn to localize an object in the image only using image-level labels. Previous works endeavor to perceive the interval objects from the small and sparse discriminative attention map, yet ignoring the co-occurrence confounder (e.g., bird and sky), which makes the model inspection (e.g., CAM) hard to distinguish between the object and context. In this paper, we make an early attempt to tackle this challenge via causal intervention (CI). Our proposed method, dubbed CI-CAM, explores the causalities among images, contexts, and categories to eliminate the biased co-occurrence in the class activation maps thus improving the accuracy of object localization. Extensive experiments on several benchmarks demonstrate the effectiveness of CI-CAM in learning the clear object boundaries from confounding contexts. Particularly, in CUB-200-2011 which severely suffers from the co-occurrence confounder, CI-CAM significantly outperforms the traditional CAM-based baseline (58.39% vs 52.4% in top-1 localization accuracy). While in more general scenarios such as ImageNet, CI-CAM can also perform on par with the state of the arts.
updated: Tue Aug 03 2021 07:27:33 GMT+0000 (UTC)
published: Wed Apr 21 2021 04:44:33 GMT+0000 (UTC)
