ビデオアクション検出器は通常、完全に監視された時間的注釈付きのデータセットを使用してトレーニングされます。このようなデータセットの構築は、コストのかかる作業です。この問題を軽減するために、最近の方法では、ビデオがトリミングされておらず、ビデオレベルのラベルしか使用できない弱いラベリングを活用しようとしています。本論文では、新しい弱教師あり時間的作用局在化法であるRefineLocを提案する。 RefineLocは、反復ごとにスニペットレベルの疑似グラウンドトゥルースを推定してトレーニングすることにより、反復的な改良アプローチを使用します。この反復アプローチの利点を示し、5つの異なる疑似グラウンドトゥルースジェネレーターの広範な分析を示します。 2つの標準アクションデータセット、ActivityNetv1.2とTHUMOS14でのモデルの有効性を示します。 RefineLocは、弱く監視された時間的ローカリゼーションにおいて、最先端の競争力のある結果を示しています。さらに、私たちの反復的な改良プロセスは、2つの最先端の方法のパフォーマンスを大幅に改善し、THUMOS14に新しい最先端を設定することができます。
Video action detectors are usually trained using datasets with fully-supervised temporal annotations. Building such datasets is an expensive task. To alleviate this problem, recent methods have tried to leverage weak labeling, where videos are untrimmed and only a video-level label is available. In this paper, we propose RefineLoc, a novel weakly-supervised temporal action localization method. RefineLoc uses an iterative refinement approach by estimating and training on snippet-level pseudo ground truth at every iteration. We show the benefit of this iterative approach and present an extensive analysis of five different pseudo ground truth generators. We show the effectiveness of our model on two standard action datasets, ActivityNet v1.2 and THUMOS14. RefineLoc shows competitive results with the state-of-the-art in weakly-supervised temporal localization. Additionally, our iterative refinement process is able to significantly improve the performance of two state-of-the-art methods, setting a new state-of-the-art on THUMOS14.