Dynamic Gesture Recognition by Using CNNs and Star RGB: a Temporal Information Condensation
  技術の進歩により、機械は人々の日常生活にますます存在しています。したがって、対話の直感的な方法を提供する動的なジェスチャなどのインターフェイスを開発する努力がますます行われています。現在、最も一般的な傾向は、マルチモーダルデータを深度およびスケルトン情報として使用して、動的なジェスチャー認識を可能にすることです。ただし、RGBカメラはほとんどすべての公共の場所で通常利用可能であり、他の機器を設置することなくジェスチャ認識に使用できるため、色情報のみを使用する方がより興味深いでしょう。このようなアプローチの主な問題は、色だけを使用して時空間情報を表現するのが難しいことです。これを念頭に置いて、ビデオに示されている動的なジェスチャーをたった1つのRGB画像に凝縮できる技術を提案します。この手法をスターRGBと呼びます。次に、この画像は、2つのResnet CNN、ソフトアテンションアンサンブル、および入力ビデオに存在するジェスチャのクラスを示す完全に接続されたレイヤーで構成される分類器に渡されます。実験は、MontalbanoとGRITの両方のデータセットを使用して実行されました。モンタルバノデータセットの場合、提案されたアプローチは94.58%の精度を達成しました。このデータセットと色情報のみを考慮すると、そのような結果は最先端に達します。 GRITデータセットに関して、私たちの提案は、精度、再現率、精度、F1スコアの98%以上を達成し、参照アプローチを6%以上上回っています。
Due to the advance of technologies, machines are increasingly present in people's daily lives. Thus, there has been more and more effort to develop interfaces, such as dynamic gestures, that provide an intuitive way of interaction. Currently, the most common trend is to use multimodal data, as depth and skeleton information, to enable dynamic gesture recognition. However, using only color information would be more interesting, since RGB cameras are usually available in almost every public place, and could be used for gesture recognition without the need of installing other equipment. The main problem with such approach is the difficulty of representing spatio-temporal information using just color. With this in mind, we propose a technique capable of condensing a dynamic gesture, shown in a video, in just one RGB image. We call this technique star RGB. This image is then passed to a classifier formed by two Resnet CNNs, a soft-attention ensemble, and a fully connected layer, which indicates the class of the gesture present in the input video. Experiments were carried out using both Montalbano and GRIT datasets. For Montalbano dataset, the proposed approach achieved an accuracy of 94.58%. Such result reaches the state-of-the-art when considering this dataset and only color information. Regarding the GRIT dataset, our proposal achieves more than 98% of accuracy, recall, precision, and F1-score, outperforming the reference approach by more than 6%.
updated: Sun Sep 08 2019 15:57:22 GMT+0000 (UTC)
published: Wed Apr 10 2019 00:39:32 GMT+0000 (UTC)
