arXiv reaDer
トリミングされていないビデオアクション認識のためのスキミングとスキャン
Skimming and Scanning for Untrimmed Video Action Recognition
ビデオアクション認識(VAR)はビデオ理解の主要なタスクであり、トリミングされていないビデオは実際のシーンでより一般的です。トリミングされていないビデオには、コンテキスト情報を含む冗長で多様なクリップがあるため、高密度のクリップをサンプリングすることが不可欠です。最近、いくつかの作品は、N個の最も代表的なクリップを選択するために一般的なモデルを訓練しようとしています。ただし、クラス内クリップとクラス間ビデオからの複雑な関係を単一のモデルと固定された選択数内でモデル化することは困難であり、複数の関係の絡み合いも説明するのが困難です。したがって、「一度だけ見る」のではなく、「分割統治」戦略がトリミングされていないVARに適していると主張します。速読メカニズムに着想を得て、スキムスキャン技術に基づいたシンプルで効果的なクリップレベルのソリューションを提案します。具体的には、提案されたスキムスキャンフレームワークは、最初にビデオ全体をスキミングし、それらの有益で誤解を招くクリップをドロップします。残りのクリップについては、さまざまな機能を備えたクリップを徐々にスキャンして、冗長なクリップを削除しますが、重要なコンテンツをカバーします。上記の戦略では、さまざまなビデオの難易度に応じて、必要なクリップを適応的に選択できます。計算の複雑さとパフォーマンスをトレードオフするために、軽量ネットワークと重いネットワークの間で同様の統計式を観察します。したがって、それらの組み合わせを調査することができます。包括的な実験がActivityNetおよびmini-FCVIDデータセットで実行され、結果は、当社のソリューションが精度と効率の両方の点で最先端のパフォーマンスを上回っていることを示しています。
Video action recognition (VAR) is a primary task of video understanding, and untrimmed videos are more common in real-life scenes. Untrimmed videos have redundant and diverse clips containing contextual information, so sampling dense clips is essential. Recently, some works attempt to train a generic model to select the N most representative clips. However, it is difficult to model the complex relations from intra-class clips and inter-class videos within a single model and fixed selected number, and the entanglement of multiple relations is also hard to explain. Thus, instead of "only look once", we argue "divide and conquer" strategy will be more suitable in untrimmed VAR. Inspired by the speed reading mechanism, we propose a simple yet effective clip-level solution based on skim-scan techniques. Specifically, the proposed Skim-Scan framework first skims the entire video and drops those uninformative and misleading clips. For the remaining clips, it scans clips with diverse features gradually to drop redundant clips but cover essential content. The above strategies can adaptively select the necessary clips according to the difficulty of the different videos. To trade off the computational complexity and performance, we observe the similar statistical expression between lightweight and heavy networks, thus it supports us to explore the combination of them. Comprehensive experiments are performed on ActivityNet and mini-FCVID datasets, and results demonstrate that our solution surpasses the state-of-the-art performance in terms of both accuracy and efficiency.
updated: Wed Apr 21 2021 12:23:44 GMT+0000 (UTC)
published: Wed Apr 21 2021 12:23:44 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト