ノイズの多いラベルは、実際のデータによく見られ、ディープニューラルネットワークのパフォーマンスを低下させます。データを手動でクリーニングすることは、労働集約的で時間がかかります。以前の研究は、ノイズの多いラベルに対する分類モデルの強化に主に焦点を当てていますが、ノイズの多いラベルに対するディープメトリック学習(DML)の堅牢性はあまりよく調べられていません。このホワイトペーパーでは、DMLの確率的ランキングベースのメモリを使用したインスタンス選択(PRISM)アプローチを提案することにより、この重要なギャップを埋めます。 PRISMは、ラベルがクリーンである確率を計算し、ノイズの可能性のあるサンプルを除外します。具体的には、各データクラスのフォンミーゼスフィッシャー(vMF)分布を推定することにより、この確率を計算するための新しい方法、つまりフォンミーゼスフィッシャー分布類似性(vMF-Sim)を提案します。既存の平均類似度法(AvgSim)と比較して、vMF-Simは、平均類似度に加えて、各クラスの分散を考慮します。このような設計により、提案されたアプローチは、サンプルの大部分がノイズの多い困難なDML状況に対処できます。合成データセットと実世界のノイズの多いデータセットの両方での広範な実験により、提案されたアプローチは、妥当なトレーニング時間内に、最高のパフォーマンスを発揮する最先端のベースラインアプローチと比較して最大8.37%高いPrecision @ 1を達成することが示されています。
Noisy labels are commonly found in real-world data, which cause performance degradation of deep neural networks. Cleaning data manually is labour-intensive and time-consuming. Previous research mostly focuses on enhancing classification models against noisy labels, while the robustness of deep metric learning (DML) against noisy labels remains less well-explored. In this paper, we bridge this important gap by proposing Probabilistic Ranking-based Instance Selection with Memory (PRISM) approach for DML. PRISM calculates the probability of a label being clean, and filters out potentially noisy samples. Specifically, we propose a novel method, namely the von Mises-Fisher Distribution Similarity (vMF-Sim), to calculate this probability by estimating a von Mises-Fisher (vMF) distribution for each data class. Compared with the existing average similarity method (AvgSim), vMF-Sim considers the variance of each class in addition to the average similarity. With such a design, the proposed approach can deal with challenging DML situations in which the majority of the samples are noisy. Extensive experiments on both synthetic and real-world noisy dataset show that the proposed approach achieves up to 8.37% higher Precision@1 compared with the best performing state-of-the-art baseline approaches, within reasonable training time.