Multi-Task Learning of Generalizable Representations for Video Action Recognition
 従来のビデオアクション認識では、ラベルに多様なビデオの外観とダイナミクスに関する十分な情報が含まれていない場合があるため、標準の教師あり学習パラダイムでトレーニングされた既存のモデルは、一般化できない機能を抽出する場合があります。ビデオ分析における上記のラベルバイアスの問題は、さまざまなデータソースにわたってさらに顕著であるため、これらのモデルをクロスデータセットの実験設定の下で評価します。モデル入力としてオプティカルフローを使用すると、ほとんどのビデオ認識モデルの汎化能力が損なわれることがわかりました。これらの調査結果に基づいて、ビデオ分類のためのマルチタスク学習パラダイムを提示します。私たちの重要なアイデアは、データを独自の監視またはデータの制約として監視することにより、ラベルのバイアスを回避し、汎化能力を向上させることです。まず、オプティカルフローとRGBフレームを補助監視として取り、モデルを逆2ストリームネットワーク(Rev2Net)と名付けます。さらに、Rev2Netに新しいトレーニング目標を導入することにより、補助フロー予測タスクとフレーム再構築タスクを連携させます。これは、マルチタスク機能の不一致を自己監視方式で制限するDecoding Discrepancy Penalty(DDP)という名前です。 Rev2Netは、古典的なアクション認識タスクに効果的であることが示されています。特に、クロスデータセット実験で強力な汎化能力を示しています。
In classic video action recognition, labels may not contain enough information about the diverse video appearance and dynamics, thus, existing models that are trained under the standard supervised learning paradigm may extract less generalizable features. We evaluate these models under a cross-dataset experiment setting, as the above label bias problem in video analysis is even more prominent across different data sources. We find that using the optical flows as model inputs harms the generalization ability of most video recognition models. Based on these findings, we present a multi-task learning paradigm for video classification. Our key idea is to avoid label bias and improve the generalization ability by taking data as its own supervision or supervising constraints on the data. First, we take the optical flows and the RGB frames by taking them as auxiliary supervisions, and thus naming our model as Reversed Two-Stream Networks (Rev2Net). Further, we collaborate the auxiliary flow prediction task and the frame reconstruction task by introducing a new training objective to Rev2Net, named Decoding Discrepancy Penalty (DDP), which constraints the discrepancy of the multi-task features in a self-supervised manner. Rev2Net is shown to be effective on the classic action recognition task. It specifically shows a strong generalization ability in the cross-dataset experiments.
updated: Sun Apr 12 2020 02:56:41 GMT+0000 (UTC)
published: Tue Nov 20 2018 16:49:17 GMT+0000 (UTC)
