Emerging Properties in Self-Supervised Vision Transformers
本論文では、自己教師あり学習がVision Transformer (ViT)が、畳み込みネットワーク(convnet)と比較して際立った創発的特性を与えるかどうかを問う。第一に、自己教師ありViTの特徴は、画像のセマンティックセグメンテーションに関する明確な情報を含んでおり、これは教師ありViTやconvnetでは明確に現れない。次に、これらの特徴は優れたk-NN分類器でもあり、小さなViTでImageNetの78.3% top-1に達した。本研究では、モーメンタムエンコーダ、マルチクロップトレーニング、およびViTでの小さなパッチの使用の重要性も強調している。我々の研究結果を、DINOと呼ばれるシンプルな自己教師付き手法に実装した。それはラベルのない自己蒸留の一形態と解釈できる。ViT-Baseを用いた線形評価において、ImageNetで80.1%のtop-1を達成し、DINOとViTsの相乗効果を示した。
In this paper, we question if self-supervised learning provides new properties to Vision Transformer (ViT) that stand out compared to convolutional networks (convnets). Beyond the fact that adapting self-supervised methods to this architecture works particularly well, we make the following observations: first, self-supervised ViT features contain explicit information about the semantic segmentation of an image, which does not emerge as clearly with supervised ViTs, nor with convnets. Second, these features are also excellent k-NN classifiers, reaching 78.3% top-1 on ImageNet with a small ViT. Our study also underlines the importance of momentum encoder, multi-crop training, and the use of small patches with ViTs. We implement our findings into a simple self-supervised method, called DINO, which we interpret as a form of self-distillation with no labels. We show the synergy between DINO and ViTs by achieving 80.1% top-1 on ImageNet in linear evaluation with ViT-Base.
updated: Mon May 24 2021 17:49:18 GMT+0000 (UTC)
published: Thu Apr 29 2021 12:28:51 GMT+0000 (UTC)
