手話連続認識(CSLR)は、手話データの時系列に正確な注釈がないため、困難な研究タスクです。最近人気のある使い方は、CSLR用の「CNN+RNN」をベースにしたハイブリッドモデルです。しかし、これらの作品で時間的特徴を抽出する場合、固定された時間的受容野を使用するほとんどの方法は、各手話単語の時間的特徴をうまく抽出することができません。より正確な時間的特徴を得るために、本論文はマルチスケール時間的ネットワーク(MSTNet)を提案した。ネットワークは主に3つの部分で構成されています。 Resnetと2つの完全に接続された(FC)層は、フレームごとの特徴抽出部分を構成します。時間的特徴抽出部分は、提案されたマルチスケール時間ブロック(MSTブロック)を使用して異なるスケールの時間受容野特徴を最初に抽出して時間モデリング機能を改善し、次に異なるスケールの時間的特徴をさらにエンコードすることによって時間的特徴学習を実行しますより正確な時間的特徴を得るために、トランスモジュールによってスケーリングします。最後に、提案されたマルチレベルのコネクショニスト時分類(CTC)損失部分は、認識結果を取得するためのトレーニングに使用されます。マルチレベルのCTC損失により、CNNの浅いネットワークパラメーターの学習と更新が向上します。この方法ではパラメーターが増加することはなく、他のモデルに柔軟に組み込むことができます。 2つの公開されているデータセットの実験結果は、私たちの方法が事前の知識なしに手話の特徴をエンドツーエンドで効果的に抽出し、CSLRの精度を向上させ、最先端に到達できることを示しています。
Continuous Sign Language Recognition (CSLR) is a challenging research task due to the lack of accurate annotation on the temporal sequence of sign language data. The recent popular usage is a hybrid model based on "CNN + RNN" for CSLR. However, when extracting temporal features in these works, most of the methods using a fixed temporal receptive field and cannot extract the temporal features well for each sign language word. In order to obtain more accurate temporal features, this paper proposes a multi-scale temporal network (MSTNet). The network mainly consists of three parts. The Resnet and two fully connected (FC) layers constitute the frame-wise feature extraction part. The time-wise feature extraction part performs temporal feature learning by first extracting temporal receptive field features of different scales using the proposed multi-scale temporal block (MST-block) to improve the temporal modeling capability, and then further encoding the temporal features of different scales by the transformers module to obtain more accurate temporal features. Finally, the proposed multi-level Connectionist Temporal Classification (CTC) loss part is used for training to obtain recognition results. The multi-level CTC loss enables better learning and updating of the shallow network parameters in CNN, and the method has no parameter increase and can be flexibly embedded in other models. Experimental results on two publicly available datasets demonstrate that our method can effectively extract sign language features in an end-to-end manner without any prior knowledge, improving the accuracy of CSLR and reaching the state-of-the-art.