Mobile Video Action Recognition
  ビデオアクション認識は、コンピュータービジョンとビデオ分析で話題になっていますが、短いビデオクリップを、髪をブラッシングしたり、階段を登るなどの事前定義されたカテゴリに割り当てることを目的としています。最近の作品は、高性能プラットフォームを必要とする最先端の結果を達成するディープニューラルネットワークを使用したアクション認識に焦点を当てています。モバイルコンピューティングの急速な発展にもかかわらず、モバイルデバイスでのビデオアクション認識については完全には議論されていません。このホワイトペーパーでは、モバイルデバイスの計算機能のみにアクセスできる、新しいモバイルビデオアクション認識タスクに注目します。巨大なストレージを持つ生のビデオの代わりに、圧縮されたビデオから直接複数のモダリティ(Iフレーム、モーションベクトル、残差を含む)を抽出することを選択します。 MobileNetV2をバックボーンとして採用することにより、モバイルビデオアクション認識のための複数のモダリティを融合するための新しいTemporal Trilinear Pooling(TTP)モジュールを提案します。モーションベクトルに加えて、時間コンテキストを明示的に誘導するための時間融合法も提供します。モバイルデバイスでの効率テストは、モデルが約40FPSでモバイルビデオアクション認識を実行できることを示しています。 2つのベンチマークの比較結果は、モデルのサイズと時間がかかりますが、競合する精度で、既存のアクション認識方法よりも優れていることを示しています。
Video action recognition, which is topical in computer vision and video analysis, aims to allocate a short video clip to a pre-defined category such as brushing hair or climbing stairs. Recent works focus on action recognition with deep neural networks that achieve state-of-the-art results in need of high-performance platforms. Despite the fast development of mobile computing, video action recognition on mobile devices has not been fully discussed. In this paper, we focus on the novel mobile video action recognition task, where only the computational capabilities of mobile devices are accessible. Instead of raw videos with huge storage, we choose to extract multiple modalities (including I-frames, motion vectors, and residuals) directly from compressed videos. By employing MobileNetV2 as backbone, we propose a novel Temporal Trilinear Pooling (TTP) module to fuse the multiple modalities for mobile video action recognition. In addition to motion vectors, we also provide a temporal fusion method to explicitly induce the temporal context. The efficiency test on a mobile device indicates that our model can perform mobile video action recognition at about 40FPS. The comparative results on two benchmarks show that our model outperforms existing action recognition methods in model size and time consuming, but with competitive accuracy.
updated: Tue Aug 27 2019 12:16:55 GMT+0000 (UTC)
published: Tue Aug 27 2019 12:16:55 GMT+0000 (UTC)
