手ジェスチャーは手話で重要な役割を果たします。現在の深層学習ベースの手話認識(SLR)メソッドは、限られた手話データソースのために、不十分な解釈可能性と過剰適合に苦しむ可能性があります。この論文では、SLR用のハンドプライアを組み込んだ最初の自己監視型の事前トレーニング可能なSignBERTを紹介します。 SignBERTは、手のポーズを、既成のポーズ抽出機能から派生した視覚的なトークンと見なします。次に、視覚トークンには、ジェスチャ状態、時間的および手のキラリティー情報が埋め込まれます。利用可能なサインデータソースを最大限に活用するために、SignBERTはまず、ビジュアルトークンをマスキングして再構築することにより、自己監視型の事前トレーニングを実行します。いくつかのマスクモデリング戦略と共同で、モデル対応メソッドにハンドプライアを組み込んで、ハンドシーケンス全体の階層コンテキストをより適切にモデル化しようとします。次に、予測ヘッドが追加されると、SignBERTはダウンストリームSLRタスクを実行するように微調整されます。 SLRでのメソッドの有効性を検証するために、4つの公開ベンチマークデータセット、つまりNMF(CSL、SLR500、MSASL、およびWLASL)で広範な実験を実行します。実験結果は、自己教師あり学習とインポートされた事前の両方の有効性を示しています。さらに、すべてのベンチマークで最先端のパフォーマンスを達成し、顕著な成果を上げています。
Hand gesture serves as a critical role in sign language. Current deep-learning-based sign language recognition (SLR) methods may suffer insufficient interpretability and overfitting due to limited sign data sources. In this paper, we introduce the first self-supervised pre-trainable SignBERT with incorporated hand prior for SLR. SignBERT views the hand pose as a visual token, which is derived from an off-the-shelf pose extractor. The visual tokens are then embedded with gesture state, temporal and hand chirality information. To take full advantage of available sign data sources, SignBERT first performs self-supervised pre-training by masking and reconstructing visual tokens. Jointly with several mask modeling strategies, we attempt to incorporate hand prior in a model-aware method to better model hierarchical context over the hand sequence. Then with the prediction head added, SignBERT is fine-tuned to perform the downstream SLR task. To validate the effectiveness of our method on SLR, we perform extensive experiments on four public benchmark datasets, i.e., NMFs-CSL, SLR500, MSASL and WLASL. Experiment results demonstrate the effectiveness of both self-supervised learning and imported hand prior. Furthermore, we achieve state-of-the-art performance on all benchmarks with a notable gain.