Sequential Random Network for Fine-grained Image Classification
Deep Convolutional Neural Network(DCNN)とTransformerは、画像認識で目覚ましい成功を収めています。ただし、きめ細かい画像認識でのパフォーマンスは、実際のニーズの要件を満たすことは依然として困難です。この論文は、DCNNの性能を向上させるためにシーケンスランダムネットワーク(SRN)を提案します。 DCNNの出力は1次元の特徴です。この一次元の特徴は、画像情報を抽象的に表現していますが、画像の詳細情報をうまく表現していません。この問題に対処するために、BiLSTMといくつかのTanh-Dropoutブロック(BiLSTM-TDNと呼ばれる)で構成される提案されたSRNを使用して、画像の詳細情報を強調するためのDCNN1次元特徴をさらに処理します。 BiLSTM-TDNによる特徴変換後、認識性能が大幅に向上しました。 6つのきめの細かい画像データセットで実験を行いました。 FGVC-Aircraftを除いて、他のデータセットで提案された方法の精度は99%を超えました。実験結果は、BiLSTM-TDNが既存の最先端の方法よりもはるかに優れていることを示しています。 DCNNに加えて、BiLSTM-TDNは、Transformerなどの他のモデルにも拡張できます。
Deep Convolutional Neural Network (DCNN) and Transformer have achieved remarkable successes in image recognition. However, their performance in fine-grained image recognition is still difficult to meet the requirements of actual needs. This paper proposes a Sequence Random Network (SRN) to enhance the performance of DCNN. The output of DCNN is one-dimensional features. This one-dimensional feature abstractly represents image information, but it does not express well the detailed information of image. To address this issue, we use the proposed SRN which composed of BiLSTM and several Tanh-Dropout blocks (called BiLSTM-TDN), to further process DCNN one-dimensional features for highlighting the detail information of image. After the feature transform by BiLSTM-TDN, the recognition performance has been greatly improved. We conducted the experiments on six fine-grained image datasets. Except for FGVC-Aircraft, the accuracies of the proposed methods on the other datasets exceeded 99%. Experimental results show that BiLSTM-TDN is far superior to the existing state-of-the-art methods. In addition to DCNN, BiLSTM-TDN can also be extended to other models, such as Transformer.
updated: Mon Jun 07 2021 09:59:50 GMT+0000 (UTC)
published: Fri Mar 12 2021 12:16:03 GMT+0000 (UTC)
