arXiv reaDer
マルチモーダルゼロショット手話認識
Multi-Modal Zero-Shot Sign Language Recognition
ゼロショット学習(ZSL)は、近年急速に進歩しています。手話認識(SLR)の注釈のボトルネックを克服するために、テキストによる説明を活用して、注釈付きの視覚的な例のないゼロショット手話認識(ZS-SLR)のアイデアを探ります。このように、スケルトンベースのものと融合した深い特徴の補完的な機能を利用したマルチモーダルゼロショット手話認識(ZS-SLR)モデルを提案します。 TransformerベースのモデルとC3Dモデルは、それぞれ手の検出と深部特徴抽出に使用されます。スケルトンベースの機能と深い機能の次元の間でトレードオフを行うために、Long Short Term Memory(LSTM)ネットワーク上でAuto-Encoder(AE)を使用します。最後に、セマンティックスペースを使用して、視覚的特徴をクラスラベルの言語埋め込みにマッピングします。これは、トランスフォーマーからの双方向エンコーダー表現(BERT)モデルを介して実現されます。 4つの大規模データセット、RKS-PERSIANSIGN、First-Person、ASLVID、およびisoGDの結果は、ZS-SLRの最先端の代替案と比較して提案されたモデルの優位性を示しています。
Zero-Shot Learning (ZSL) has rapidly advanced in recent years. Towards overcoming the annotation bottleneck in the Sign Language Recognition (SLR), we explore the idea of Zero-Shot Sign Language Recognition (ZS-SLR) with no annotated visual examples, by leveraging their textual descriptions. In this way, we propose a multi-modal Zero-Shot Sign Language Recognition (ZS-SLR) model harnessing from the complementary capabilities of deep features fused with the skeleton-based ones. A Transformer-based model along with a C3D model is used for hand detection and deep features extraction, respectively. To make a trade-off between the dimensionality of the skeletonbased and deep features, we use an Auto-Encoder (AE) on top of the Long Short Term Memory (LSTM) network. Finally, a semantic space is used to map the visual features to the lingual embedding of the class labels, achieved via the Bidirectional Encoder Representations from Transformers (BERT) model. Results on four large-scale datasets, RKS-PERSIANSIGN, First-Person, ASLVID, and isoGD, show the superiority of the proposed model compared to state-of-the-art alternatives in ZS-SLR.
updated: Thu Sep 02 2021 09:10:39 GMT+0000 (UTC)
published: Thu Sep 02 2021 09:10:39 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト