arXiv reaDer
対照的な自己監視学習の一般化に向けて
Towards the Generalization of Contrastive Self-Supervised Learning
最近、自己監視学習は、トレーニングにラベルのないデータしか必要としないため、大きな注目を集めています。対照学習は、自己監視学習の一般的な方法の1つであり、有望な経験的パフォーマンスを達成しています。ただし、その一般化能力の理論的理解はまだ限られています。この目的のために、データ拡張を数学的に定量化するための一種の(σ、δ)メジャーを定義し、メジャーに基づいてダウンストリーム分類エラーの上限を提供します。対照的な自己監視学習の一般化能力は、ポジティブサンプルのアラインメント、クラスセンターの発散、および拡張データの集中という3つの重要な要因に依存することを示します。最初の2つの要素は対照的なアルゴリズムによって最適化できますが、3番目の要素は事前定義されたデータ拡張によって事前に決定されます。上記の理論的発見により、2つの標準的な対照損失、InfoNCEと相互相関損失をさらに調査し、両方が最初の2つの要素を実際に満たすことができることを証明します。さらに、実際のデータセットでさまざまな実験を行うことにより、3番目の要因を経験的に検証し、データ拡張と対照的な自己監視学習の一般化との関係に関する理論的推論が経験的観察と一致することを示します。
Recently, self-supervised learning has attracted great attention, since it only requires unlabeled data for training. Contrastive learning is one popular method for self-supervised learning and has achieved promising empirical performance. However, the theoretical understanding of its generalization ability is still limited. To this end, we define a kind of (σ,δ)-measure to mathematically quantify the data augmentation, and then provide an upper bound of the downstream classification error based on the measure. We show that the generalization ability of contrastive self-supervised learning depends on three key factors: alignment of positive samples, divergence of class centers, and concentration of augmented data. The first two factors can be optimized by contrastive algorithms, while the third one is priorly determined by pre-defined data augmentation. With the above theoretical findings, we further study two canonical contrastive losses, InfoNCE and cross-correlation loss, and prove that both of them are indeed able to satisfy the first two factors. Moreover, we empirically verify the third factor by conducting various experiments on the real-world dataset, and show that our theoretical inferences on the relationship between the data augmentation and the generalization of contrastive self-supervised learning agree with the empirical observations.
updated: Thu May 26 2022 16:16:22 GMT+0000 (UTC)
published: Mon Nov 01 2021 07:39:38 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト