arXiv reaDer
Learning Representative Temporal Features for Action Recognition
この論文では、第三者のビデオのさまざまなカテゴリを効率的に認識することを目的とした新しいビデオ分類方法を提示します。私たちの動機は、不十分なトレーニングデータでトレーニングできる軽量モデルを実現することです。この直感により、3次元ビデオ入力の処理は、空間の2Dの上に、時間の次元で1Dに分割されます。 2D空間フレームに関連するプロセスは、トレーニングフェーズのない事前トレーニング済みネットワークを利用して実行されています。トレーニングを伴う唯一のステップは、2D信号の記述から得られた1D時系列を分類することです。実際のところ、オプティカルフロー画像は最初に連続するフレームから計算され、事前にトレーニングされたCNNネットワークによって記述されます。次に、PCAを使用してそれらの寸法を縮小します。記述ベクトルを並べてスタックすることにより、ビデオごとにマルチチャネル時系列が作成されます。時系列の各チャネルは特定の機能を表し、時間の経過とともにそれに従います。提案手法の主な焦点は、得られた時系列を効果的に分類することです。これに向けて、アイデアは機械に時間的特徴を学習させることです。これは、マルチチャネル1次元畳み込みニューラルネットワーク(1D-CNN)をトレーニングすることによって行われます。 1D-CNNは、唯一の時間的次元に沿って特徴を学習します。したがって、トレーニングパラメータの数が大幅に減少し、その結果、さらに小さなデータセットでメソッドのトレーニングが可能になります。提案された方法は、2つの公開データセットUCF11、jHMDBで最先端の結果に到達し、HMDB51で競合する結果に到達する可能性があることが示されています。
In this paper, a novel video classification method is presented that aims to recognize different categories of third-person videos efficiently. Our motivation is to achieve a light model that could be trained with insufficient training data. With this intuition, the processing of the 3-dimensional video input is broken to 1D in temporal dimension on top of the 2D in spatial. The processes related to 2D spatial frames are being done by utilizing pre-trained networks with no training phase. The only step which involves training is to classify the 1D time series resulted from the description of the 2D signals. As a matter of fact, optical flow images are first calculated from consecutive frames and described by pre-trained CNN networks. Their dimension is then reduced using PCA. By stacking the description vectors beside each other, a multi-channel time series is created for each video. Each channel of the time series represents a specific feature and follows it over time. The main focus of the proposed method is to classify the obtained time series effectively. Towards this, the idea is to let the machine learn temporal features. This is done by training a multi-channel one dimensional Convolutional Neural Network (1D-CNN). The 1D-CNN learns the features along the only temporal dimension. Hence, the number of training parameters decreases significantly which would result in the trainability of the method on even smaller datasets. It is illustrated that the proposed method could reach the state-of-the-art results on two public datasets UCF11, jHMDB and competitive results on HMDB51.
updated: Tue May 04 2021 18:34:32 GMT+0000 (UTC)
published: Mon Feb 19 2018 17:36:24 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)アソシエイト