3C-Net: Category Count and Center Loss for Weakly-Supervised Action Localization
 一時的なアクションのローカリゼーションは、現実のアプリケーションが多数存在するコンピュータービジョンの問題です。既存のほとんどの方法では、アクションローカリゼーションモデルをトレーニングするために骨の折れるフレームレベルの監督が必要です。この作業では、3C-Netと呼ばれるフレームワークを提案します。このフレームワークは、アクションカテゴリラベルと対応するカウントの形式でビデオレベルの監視(弱い監視)のみを必要とします。ローカライズ機能が強化された差別的アクション機能を学習するための新しい定式化を紹介します。共同定式化には3つの用語があります:学習されたアクション機能の分離性を確保するための分類用語、アクション機能の識別可能性を強化するための適応マルチラベルセンター損失条件、および隣接するアクションシーケンスを描くためのカウント損失条件は、ローカライズの改善につながります。包括的な実験は、2つの挑戦的なベンチマークで実行されます:THUMOS14とActivityNet 1.2。私たちのアプローチは、両方のデータセットで弱く監視された時間的アクションのローカリゼーションのための新しい最先端を設定します。 THUMOS14データセットでは、提案された方法は、最新技術と比較して、平均平均精度(mAP)に関して4.6%の絶対ゲインを達成します。ソースコードはで入手できます。
Temporal action localization is a challenging computer vision problem with numerous real-world applications. Most existing methods require laborious frame-level supervision to train action localization models. In this work, we propose a framework, called 3C-Net, which only requires video-level supervision (weak supervision) in the form of action category labels and the corresponding count. We introduce a novel formulation to learn discriminative action features with enhanced localization capabilities. Our joint formulation has three terms: a classification term to ensure the separability of learned action features, an adapted multi-label center loss term to enhance the action feature discriminability and a counting loss term to delineate adjacent action sequences, leading to improved localization. Comprehensive experiments are performed on two challenging benchmarks: THUMOS14 and ActivityNet 1.2. Our approach sets a new state-of-the-art for weakly-supervised temporal action localization on both datasets. On the THUMOS14 dataset, the proposed method achieves an absolute gain of 4.6% in terms of mean average precision (mAP), compared to the state-of-the-art. Source code is available at
updated: Mon Nov 18 2019 12:28:41 GMT+0000 (UTC)
published: Thu Aug 22 2019 06:20:38 GMT+0000 (UTC)
