畳み込みニューラルネットワーク(CNN)を非ユークリッド幾何学に拡張することで、多様体を研究するための複数のフレームワークが生まれました。これらの方法の多くは、不規則な表面への畳み込みの一般化が自明ではないため、長距離関連のモデリングが不十分になる設計上の制限を示しています。 Vision Transformers(ViT)の最近の最先端のパフォーマンスは、自己注意を実装する汎用アーキテクチャがCNNのローカル機能学習操作に取って代わる可能性があることを示しています。コンピュータビジョンにおける注意モデリングの成功に動機付けられて、シーケンス間問題として表面学習のタスクを再定式化することによってViTを表面に拡張し、表面メッシュのパッチメカニズムを提案します。開発中のヒューマンコネクトームプロジェクト(dHCP)データセットの2つの脳年齢予測タスクで提案されたSurface Vision Transformer(SiT)のパフォーマンスを検証し、モデルのパフォーマンスに対する事前トレーニングの影響を調査します。実験は、SiTが多くの表面CNNを上回っていることを示していますが、一般的な変換の不変性のいくつかの証拠を示しています。 https://github.com/metrics-lab/surface-vision-transformersで入手可能なコード
The extension of convolutional neural networks (CNNs) to non-Euclidean geometries has led to multiple frameworks for studying manifolds. Many of those methods have shown design limitations resulting in poor modelling of long-range associations, as the generalisation of convolutions to irregular surfaces is non-trivial. Recent state-of-the-art performance of Vision Transformers (ViTs) demonstrates that a general-purpose architecture, which implements self-attention, could replace the local feature learning operations of CNNs. Motivated by the success of attention-modelling in computer vision, we extend ViTs to surfaces by reformulating the task of surface learning as a sequence-to-sequence problem and propose a patching mechanism for surface meshes. We validate the performance of the proposed Surface Vision Transformer (SiT) on two brain age prediction tasks in the developing Human Connectome Project (dHCP) dataset and investigate the impact of pre-training on model performance. Experiments show that the SiT outperforms many surface CNNs, while indicating some evidence of general transformation invariance. Code available at https://github.com/metrics-lab/surface-vision-transformers