arXiv reaDer
ビジョントランスフォーマー用の統一された剪定フレームワーク
A Unified Pruning Framework for Vision Transformers
最近、ビジョントランスフォーマー(ViT)とそのバリアントは、さまざまなコンピュータービジョンタスクで有望なパフォーマンスを達成しています。しかし、ViTの高い計算コストとトレーニングデータ要件は、リソースに制約のある設定でのアプリケーションを制限します。モデル圧縮は深層学習モデルを高速化するための効果的な方法ですが、ViTの圧縮に関する研究はあまり検討されていません。これまでの多くの作業は、トークンの数を減らすことに重点を置いています。ただし、この一連の攻撃はViTの空間構造を破壊し、ダウンストリームタスクに一般化するのは困難です。この論文では、ViTとそのバリアント、つまりUP-ViTの両方の構造的剪定のための統一されたフレームワークを設計します。私たちの方法は、モデル構造の一貫性を維持しながら、すべてのViTコンポーネントを枝刈りすることに焦点を当てています。豊富な実験結果は、私たちの方法が圧縮されたViTとバリアントで高精度を達成できることを示しています。たとえば、UP-DeiT-TはImageNetで75.79%の精度を達成し、同じ計算コストでバニラDeiT-Tを3.59%上回っています。 UP-PVTv2-B0は、ImageNet分類のPVTv2-B0の精度を4.83%向上させます。一方、UP-ViTはトークン表現の一貫性を維持し、オブジェクト検出タスクで一貫した改善を実現します。
Recently, vision transformer (ViT) and its variants have achieved promising performances in various computer vision tasks. Yet the high computational costs and training data requirements of ViTs limit their application in resource-constrained settings. Model compression is an effective method to speed up deep learning models, but the research of compressing ViTs has been less explored. Many previous works concentrate on reducing the number of tokens. However, this line of attack breaks down the spatial structure of ViTs and is hard to be generalized into downstream tasks. In this paper, we design a unified framework for structural pruning of both ViTs and its variants, namely UP-ViTs. Our method focuses on pruning all ViTs components while maintaining the consistency of the model structure. Abundant experimental results show that our method can achieve high accuracy on compressed ViTs and variants, e.g., UP-DeiT-T achieves 75.79% accuracy on ImageNet, which outperforms the vanilla DeiT-T by 3.59% with the same computational cost. UP-PVTv2-B0 improves the accuracy of PVTv2-B0 by 4.83% for ImageNet classification. Meanwhile, UP-ViTs maintains the consistency of the token representation and gains consistent improvements on object detection tasks.
updated: Tue Nov 30 2021 05:01:02 GMT+0000 (UTC)
published: Tue Nov 30 2021 05:01:02 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト