インスタンスレベルの検出/セグメンテーションのパフォーマンスを向上させるために、既存の自己監視および半教師ありの方法では、ラベルのないデータからタスクに関係のないトレーニング信号またはタスク固有のトレーニング信号を抽出します。タスク特異性スペクトルの2つの極端な端にある、これら2つのアプローチは、タスクのパフォーマンスにとって最適ではないことを示します。タスク固有のトレーニング信号の使用が少なすぎると、ダウンストリームタスクのグラウンドトゥルースラベルに過剰適合し、逆にグラウンドトゥルースラベルに過剰適合します。この目的のために、ラベルのないデータからトレーニング信号を抽出する際に、より好ましいタスク固有のバランスを実現するために、新しいクラスにとらわれない半教師あり学習(CA-SSL)フレームワークを提案します。 CA-SSLには、グラウンドトゥルースラベル(ラベル付きデータ)または疑似ラベル(ラベルなしデータ)のいずれかに作用する3つのトレーニングステージがあります。このデカップリング戦略は、両方のデータ型からの寄与のバランスをとる従来のSSLメソッドの複雑なスキームを回避します。特に、ローカリゼーショントレーニング信号を保持しながら、疑似ラベルのクラス情報を無視することにより、タスクの特異性のより最適なバランスを実現するためのウォームアップトレーニングステージを導入します。その結果、ウォームアップモデルは、検出およびセグメンテーションタスクでグラウンドトゥルースラベルを微調整した場合に、過適合/過剰適合をより適切に回避できます。 360万のラベルなしデータを使用して、FCOSオブジェクト検出でImageNetで事前トレーニングされたベースラインよりも4.7%の大幅なパフォーマンスの向上を達成します。さらに、ウォームアップモデルは、他の検出およびセグメンテーションフレームワークへの優れた転送可能性を示しています。
To improve instance-level detection/segmentation performance, existing self-supervised and semi-supervised methods extract either task-unrelated or task-specific training signals from unlabeled data. We show that these two approaches, at the two extreme ends of the task-specificity spectrum, are suboptimal for the task performance. Utilizing too little task-specific training signals causes underfitting to the ground-truth labels of downstream tasks, while the opposite causes overfitting to the ground-truth labels. To this end, we propose a novel Class-Agnostic Semi-Supervised Learning (CA-SSL) framework to achieve a more favorable task-specificity balance in extracting training signals from unlabeled data. CA-SSL has three training stages that act on either ground-truth labels (labeled data) or pseudo labels (unlabeled data). This decoupling strategy avoids the complicated scheme in traditional SSL methods that balances the contributions from both data types. Especially, we introduce a warmup training stage to achieve a more optimal balance in task specificity by ignoring class information in the pseudo labels, while preserving localization training signals. As a result, our warmup model can better avoid underfitting/overfitting when fine-tuned on the ground-truth labels in detection and segmentation tasks. Using 3.6M unlabeled data, we achieve a significant performance gain of 4.7% over ImageNet-pretrained baseline on FCOS object detection. In addition, our warmup model demonstrates excellent transferability to other detection and segmentation frameworks.