多くの動物や人間は、さまざまな空間分解能(中心窩視覚)で視野を処理し、周辺処理を使用して眼球運動を行い、中心窩を指し示して、関心のあるオブジェクトに関する高解像度の情報を取得します。このアーキテクチャにより、計算効率の高い迅速なシーン探索が可能になります。自己注意ベースのビジョントランスフォーマーの最近の進歩により、機能の場所間のグローバルな相互作用が可能になり、敵対的な攻撃に対する堅牢性が向上します。ただし、Transformerモデルは、視覚系の中心窩のプロパティや、眼球運動と分類タスクの間の相互作用を明示的にモデル化しません。プーリング領域と眼球運動を使用してオブジェクト分類タスクを実行する、Foveed Transformer(FoveaTer)モデルを提案します。私たちが提案するモデルは、生物学的に着想を得た中心窩アーキテクチャの近似である、二乗プール領域を使用して画像の特徴をプールします。トランスフォーマーが過去および現在の固定からさまざまな場所に割り当てた注意に基づいて、後続の固定位置を決定します。最終的なオブジェクトカテゴリの決定を行う前に、より困難な画像により多くの固定/計算リソースを動的に割り当てます。 FoveaTerを、プーリングを含まないフル解像度のベースラインモデルと比較します。 ImageNetデータセットでは、ダイナミックストップを備えたFoveatedモデルは、51%のスループットゲインでフル解像度モデルより1.9%低い精度を達成します。 Dynamic-stopを備えたFoveatedモデルとFull-resolutionモデルを使用すると、アンサンブルはベースラインのFull-resolutionを0.2%アウトパフォームし、スループットが7.7%向上します。また、敵対的な攻撃に対するモデルの堅牢性も示しています。最後に、Foveatedモデルをシーン分類タスクでの人間のパフォーマンスと比較し、探索的凝視の数と同様の精度の依存性を示します。
Many animals and humans process the visual field with a varying spatial resolution (foveated vision) and use peripheral processing to make eye movements and point the fovea to acquire high-resolution information about objects of interest. This architecture results in computationally efficient rapid scene exploration. Recent progress in self-attention-based vision Transformers allow global interactions between feature locations and result in increased robustness to adversarial attacks. However, the Transformer models do not explicitly model the foveated properties of the visual system nor the interaction between eye movements and the classification task. We propose foveated Transformer (FoveaTer) model, which uses pooling regions and eye movements to perform object classification tasks. Our proposed model pools the image features using squared pooling regions, an approximation to the biologically-inspired foveated architecture. It decides on subsequent fixation locations based on the attention assigned by the Transformer to various locations from past and present fixations. It dynamically allocates more fixation/computational resources to more challenging images before making the final object category decision. We compare FoveaTer against a Full-resolution baseline model, which does not contain any pooling. On the ImageNet dataset, the Foveated model with Dynamic-stop achieves an accuracy of 1.9% below the full-resolution model with a throughput gain of 51%. Using a Foveated model with Dynamic-stop and the Full-resolution model, the ensemble outperforms the baseline Full-resolution by 0.2% with a throughput gain of 7.7%. We also demonstrate our model's robustness against adversarial attacks. Finally, we compare the Foveated model to human performance in a scene categorization task and show similar dependence of accuracy with number of exploratory fixations.