出力または中間アクティベーションを使用した複数のネットワーク間の知識伝達は、単純な教師と生徒のアプローチ(知識の蒸留)から双方向コホート(深い相互学習)への広範な手動設計によって進化しました。このような知識伝達の重要な要素には、ネットワークのサイズ、ネットワークの数、伝達方向、および損失関数の設計が含まれます。しかし、これらの要因は組み合わされたときに巨大であり、複雑に絡み合うため、従来の知識伝達の方法は限られた組み合わせのみを検討してきました。この論文では、知識伝達のより柔軟で多様な組み合わせのための新しいグラフベースのアプローチを提案します。知識移転を達成するために、我々は知識移転の統一されたビューを提供し、多様な知識移転パターンを表現する可能性を有する知識移転グラフと呼ばれる新しいグラフ表現を提案します。また、損失関数に導入される4つのゲート関数を提案します。勾配を制御する4つのゲートは、知識伝達のさまざまな組み合わせを提供できます。グラフ構造を検索すると、手動で設計した方法よりも効果的な知識伝達方法を見つけることができます。 CIFAR-10、-100、およびTiny-ImageNetデータセットに関する実験結果は、提案された方法が大幅なパフォーマンスの改善を達成し、顕著なグラフ構造を見つけることができたことを示しています。
Knowledge transfer among multiple networks using their outputs or intermediate activations have evolved through extensive manual design from a simple teacher-student approach (knowledge distillation) to a bidirectional cohort one (deep mutual learning). The key factors of such knowledge transfer involve the network size, the number of networks, the transfer direction, and the design of the loss function. However, because these factors are enormous when combined and become intricately entangled, the methods of conventional knowledge transfer have explored only limited combinations. In this paper, we propose a new graph-based approach for more flexible and diverse combinations of knowledge transfer. To achieve the knowledge transfer, we propose a novel graph representation called knowledge transfer graph that provides a unified view of the knowledge transfer and has the potential to represent diverse knowledge transfer patterns. We also propose four gate functions that are introduced into loss functions. The four gates, which control the gradient, can deliver diverse combinations of knowledge transfer. Searching the graph structure enables us to discover more effective knowledge transfer methods than a manually designed one. Experimental results on the CIFAR-10, -100, and Tiny-ImageNet datasets show that the proposed method achieved significant performance improvements and was able to find remarkable graph structures.