本論文では、スケルトンベースの行動認識のための結合空間時間的注意(CSTA)モデルを提案します。これは、空間ドメインと時間ドメインで最も識別可能な関節とフレームを同時に把握することを目的としています。従来のアプローチでは、通常、骨格シーケンス内のすべてのジョイントまたはフレームが同様に重要であると見なされますが、これらは曖昧で冗長な情報に対して堅牢ではありません。これに対処するために、まず、2つのサブネットワークを介して異なるジョイントとフレームの2つの重みセットを学習します。これにより、モデルは比較的有益なセクションに「注意を払う」ことができます。次に、結合された空間時間的注意のジョイントとフレームの重みに基づいて外積を計算します。さらに、CSTAメカニズムを既存の階層CNNモデル(CSTA-CNN)に簡単にプラグインして、その機能を実現できます。最近収集されたUESTCデータセットと現在最大のNTUデータセットに関する広範な実験結果は、スケルトンベースのアクション認識のために提案された方法の有効性を示しています。
In this paper, we propose a coupled spatial-temporal attention (CSTA) model for skeleton-based action recognition, which aims to figure out the most discriminative joints and frames in spatial and temporal domains simultaneously. Conventional approaches usually consider all the joints or frames in a skeletal sequence equally important, which are unrobust to ambiguous and redundant information. To address this, we first learn two sets of weights for different joints and frames through two subnetworks respectively, which enable the model to have the ability of "paying attention to" the relatively informative section. Then, we calculate the cross product based on the weights of joints and frames for the coupled spatial-temporal attention. Moreover, our CSTA mechanisms can be easily plugged into existing hierarchical CNN models (CSTA-CNN) to realize their function. Extensive experimental results on the recently collected UESTC dataset and the currently largest NTU dataset have shown the effectiveness of our proposed method for skeleton-based action recognition.