Few-Shot Temporal Action Localization with Query Adaptive Transformer
既存の時間的アクションローカリゼーション(TAL)の動作は、徹底的なセグメントレベルのアノテーションを備えた多数のトレーニングビデオに依存しており、新しいクラスへのスケーリングを妨げています。この問題の解決策として、少数ショットTAL(FS-TAL)は、単一のビデオで表される新しいクラスにモデルを適応させることを目的としています。 FS-TALメソッドを終了すると、新しいクラスのトレーニングビデオがトリミングされると想定されます。ただし、この設定は、通常、トリミングされていないビデオでキャプチャされる不自然なアクションであるだけでなく、前景アクションのセグメンテーションのための重要なコンテキストキューを含む背景ビデオセグメントも無視します。この作業では、最初に、トリミングされていないトレーニングビデオの使用を提案することにより、新しいFS-TAL設定を提案します。さらに、トレーニングクラスからの知識の伝達を最大化すると同時に、モデルを新しいクラスとそのクラスの各ビデオの両方に同時に動的に適応させることができる、新しいFS-TALモデルが提案されています。これは、モデルにクエリアダプティブトランスフォーマーを導入することで実現されます。 2つのアクションローカリゼーションベンチマークに関する広範な実験は、私たちの方法が、シングルドメインとクロスドメインの両方のシナリオで、最先端の代替案すべてを大幅に上回ることができることを示しています。ソースコードはにあります
Existing temporal action localization (TAL) works rely on a large number of training videos with exhaustive segment-level annotation, preventing them from scaling to new classes. As a solution to this problem, few-shot TAL (FS-TAL) aims to adapt a model to a new class represented by as few as a single video. Exiting FS-TAL methods assume trimmed training videos for new classes. However, this setting is not only unnatural actions are typically captured in untrimmed videos, but also ignores background video segments containing vital contextual cues for foreground action segmentation. In this work, we first propose a new FS-TAL setting by proposing to use untrimmed training videos. Further, a novel FS-TAL model is proposed which maximizes the knowledge transfer from training classes whilst enabling the model to be dynamically adapted to both the new class and each video of that class simultaneously. This is achieved by introducing a query adaptive Transformer in the model. Extensive experiments on two action localization benchmarks demonstrate that our method can outperform all the state of the art alternatives significantly in both single-domain and cross-domain scenarios. The source code can be found in
updated: Wed Oct 20 2021 13:18:01 GMT+0000 (UTC)
published: Wed Oct 20 2021 13:18:01 GMT+0000 (UTC)
