ビデオ アクション認識のパフォーマンスは、2 ストリームの畳み込みニューラル ネットワーク (CNN) アーキテクチャ内でモーション表現を使用することによって大幅に向上しました。ただし、実際のシナリオでの行動認識には、視点やポーズの変化、背景の変化など、いくつかの困難な問題があります。トレーニング データとテスト データの間のドメインの不一致により、パフォーマンスが低下します。モデルの堅牢性を向上させるために、ドメインの不一致を増加させる入力のタスクに関係のないコンテンツを決定する新しい方法を提案します。この方法は、密な対応ラベル付けとセマンティック部分セグメンテーションを共同で行うヒューマン パーシング モデル (HP モデル) に基づいています。 HP モデルからの予測は、同じテクスチャ セットを使用して各ビデオの人間の領域を再レンダリングし、すべてのクラスの人間の外観を同じにする機能も果たします。トレーニングとテスト用に改訂されたデータセットが生成され、アクション認識モデルが入力内の無関係なコンテンツに対して不変性を示すようになります。さらに、HP モデルからの予測は、トレーニングとテストの両方で AR モデルへの入力を強化するために使用されます。実験結果は、HMDB-51 データセットおよび Penn Action データセットでの行動認識に関して、提案したモデルが既存のモデルよりも優れていることを示しています。
The performance of video action recognition has been significantly boosted by using motion representations within a two-stream Convolutional Neural Network (CNN) architecture. However, there are a few challenging problems in action recognition in real scenarios, e.g., the variations in viewpoints and poses, and the changes in backgrounds. The domain discrepancy between the training data and the test data causes the performance drop. To improve the model robustness, we propose a novel method to determine the task-irrelevant content in inputs which increases the domain discrepancy. The method is based on a human parsing model (HP model) which jointly conducts dense correspondence labelling and semantic part segmentation. The predictions from the HP model also function as re-rendering the human regions in each video using the same set of textures to make humans appearances in all classes be the same. A revised dataset is generated for training and testing and makes the action recognition model exhibit invariance to the irrelevant content in the inputs. Moreover, the predictions from the HP model are used to enrich the inputs to the AR model during both training and testing. Experimental results show that our proposed model is superior to existing models for action recognition on the HMDB-51 dataset and the Penn Action dataset.