On-the-fly Global Embeddings Using Random Projections for Extreme Multi-label Classification
eXtreme Multi-label Learning(XML)の目標は、非常に大きなラベルの語彙(100万個のラベルなど)からのラベルの最も関連性の高いサブセットで、特定のデータポイントに自動的に注釈を付けることです。最近、ベンチマークデータセットで妥当なパフォーマンスを達成するこの問題に対処するために多くの試みがなされてきました。このホワイトペーパーでは、まったく新しい方法を考え出すのではなく、このタスクの簡単なベースラインを提示して検証することを目的としています。正確には、学習フェーズがトレーニングサンプルやラベルの語彙に依存しないランダムな射影を使用して、オンザフライでグローバルな構造保存機能の埋め込み手法を調査します。さらに、複数のそのような学習者のアンサンブルを使用して、トレーニングと予測時間を直線的に増加させるだけで、予測精度をさらに向上させる方法を示します。 3つの公開XMLベンチマークでの実験は、提案されたアプローチが多くの既存の方法と比較して競争力のある精度を獲得することを示しています。さらに、トレーニング時間の点で約6572倍の高速化率を提供し、公開されている最大のデータセットで最も近い競合他社と比較してモデルサイズを約14.7倍縮小します。
The goal of eXtreme Multi-label Learning (XML) is to automatically annotate a given data point with the most relevant subset of labels from an extremely large vocabulary of labels (e.g., a million labels). Lately, many attempts have been made to address this problem that achieve reasonable performance on benchmark datasets. In this paper, rather than coming-up with an altogether new method, our objective is to present and validate a simple baseline for this task. Precisely, we investigate an on-the-fly global and structure preserving feature embedding technique using random projections whose learning phase is independent of training samples and label vocabulary. Further, we show how an ensemble of multiple such learners can be used to achieve further boost in prediction accuracy with only linear increase in training and prediction time. Experiments on three public XML benchmarks show that the proposed approach obtains competitive accuracy compared with many existing methods. Additionally, it also provides around 6572x speed-up ratio in terms of training time and around 14.7x reduction in model-size compared to the closest competitors on the largest publicly available dataset.
updated: Fri Oct 15 2021 06:54:43 GMT+0000 (UTC)
published: Tue Dec 17 2019 17:11:17 GMT+0000 (UTC)
