この論文はビジョントランスのモデル圧縮問題を研究した。自己注意モジュールの恩恵を受けて、トランスアーキテクチャは多くのコンピュータビジョンタスクで並外れたパフォーマンスを示しています。ネットワークのパフォーマンスは向上しますが、トランスフォーマーには、メモリ使用量や推論の複雑さなど、より多くの計算リソースが必要になることがよくあります。既存の知識蒸留アプローチと比較して、画像と分割されたパッチの関係を通じて、教師のトランスフォーマーから有用な情報を発掘することを提案します。次に、教師と生徒のモデルでクロスイメージ、クロスパッチ、およびランダムに選択されたマニフォールドを同時に計算する、効率的な細粒度マニフォールド蒸留アプローチについて説明します。いくつかのベンチマークで実施された実験結果は、より高性能なポータブルトランスモデルを蒸留するための提案されたアルゴリズムの優位性を示しています。たとえば、私たちのアプローチは、他のViT蒸留法よりも優れたDeiT-Tinyモデルをトレーニングするために、ImageNet-1kデータセットで75.06%のトップ1精度を達成します。
This paper studies the model compression problem of vision transformers. Benefit from the self-attention module, transformer architectures have shown extraordinary performance on many computer vision tasks. Although the network performance is boosted, transformers are often required more computational resources including memory usage and the inference complexity. Compared with the existing knowledge distillation approaches, we propose to excavate useful information from the teacher transformer through the relationship between images and the divided patches. We then explore an efficient fine-grained manifold distillation approach that simultaneously calculates cross-images, cross-patch, and random-selected manifolds in teacher and student models. Experimental results conducted on several benchmarks demonstrate the superiority of the proposed algorithm for distilling portable transformer models with higher performance. For example, our approach achieves 75.06% Top-1 accuracy on the ImageNet-1k dataset for training a DeiT-Tiny model, which outperforms other ViT distillation methods.