データスケールが大きくなるにつれて、深い認識モデルは、カテゴリ間でサンプル数が大きく不均衡になるため、ロングテールのデータ分布に悩まされることがよくあります。実際、実際のデータは通常、この作業ではカテゴリの類似性と呼ばれる、さまざまなカテゴリ(ハトやスズメなど)間の類似性の関係を示しています。外観が似ているこのようなカテゴリ間で不均衡が発生した場合、二重に困難になります。ただし、既存のソリューションは主にサンプル数に焦点を合わせてデータ分布のバランスを取り直します。本研究では、ロングテール問題の本質を統一的な視点から体系的に調査します。具体的には、ロングテール認識がサンプル数とカテゴリの類似性の両方に悩まされていることを示します。直感的に、おもちゃの例を使用して、サンプル番号がロングテール認識のパフォーマンス低下の一意の影響要因ではないことを最初に示します。理論的には、(1)カテゴリの類似性は、必然的な要因として、同様のサンプルを介したロングテール分布の下でのモデル学習にも影響を与えること、(2)類似性の低減のためにより識別的な表現方法(自己教師あり学習など)を使用することを示します。 、分類器のバイアスは、パフォーマンスを大幅に向上させることでさらに軽減できます。いくつかのロングテールデータセットでの広範な実験により、理論的分析の合理性が検証され、既存の最先端(SOTA)に基づいて、類似性の低減によってパフォーマンスがさらに向上する可能性があることが示されています。私たちの調査は、ロングテール問題の背後にある本質を浮き彫りにし、将来の作業のためのいくつかの実行可能な方向性を主張しています。
As the data scale grows, deep recognition models often suffer from long-tailed data distributions due to the heavy imbalanced sample number across categories. Indeed, real-world data usually exhibit some similarity relation among different categories (e.g., pigeons and sparrows), called category similarity in this work. It is doubly difficult when the imbalance occurs between such categories with similar appearances. However, existing solutions mainly focus on the sample number to re-balance data distribution. In this work, we systematically investigate the essence of the long-tailed problem from a unified perspective. Specifically, we demonstrate that long-tailed recognition suffers from both sample number and category similarity. Intuitively, using a toy example, we first show that sample number is not the unique influence factor for performance dropping of long-tailed recognition. Theoretically, we demonstrate that (1) category similarity, as an inevitable factor, would also influence the model learning under long-tailed distribution via similar samples, (2) using more discriminative representation methods (e.g., self-supervised learning) for similarity reduction, the classifier bias can be further alleviated with greatly improved performance. Extensive experiments on several long-tailed datasets verify the rationality of our theoretical analysis, and show that based on existing state-of-the-arts (SOTAs), the performance could be further improved by similarity reduction. Our investigations highlight the essence behind the long-tailed problem, and claim several feasible directions for future work.