Spatiotemporal Contrastive Learning of Facial Expressions in Videos
ビデオの表情認識(FER)のための自己教師あり対照学習アプローチを提案します。対照学習に使用される標準的な空間拡張に加えて、利用される新しい時間サンプリングベースの拡張スキームを提案します。私たちが提案する時間的拡張スキームは、(1)純粋なランダムサンプリング、(2)均一なサンプリング、および(3)順次サンプリングの3つの時間的サンプリング手法のいずれかからランダムに選択します。これに続いて、最大3つの標準的な空間拡張の組み合わせが行われます。次に、FERにディープR(2 + 1)Dネットワークを使用します。これは、拡張に基づいて自己監視方式でトレーニングし、その後微調整します。実験はOulu-CASIAデータセットで実行され、パフォーマンスはFERの他の作業と比較されます。結果は、私たちの方法が89.4%の精度を達成し、他の作品をしのぐことによって新しい最先端を設定することを示しています。追加の実験と分析は、既存の空間的増強に対する提案された時間的増強のかなりの貢献を確認します。
We propose a self-supervised contrastive learning approach for facial expression recognition (FER) in videos. We propose a novel temporal sampling-based augmentation scheme to be utilized in addition to standard spatial augmentations used for contrastive learning. Our proposed temporal augmentation scheme randomly picks from one of three temporal sampling techniques: (1) pure random sampling, (2) uniform sampling, and (3) sequential sampling. This is followed by a combination of up to three standard spatial augmentations. We then use a deep R(2+1)D network for FER, which we train in a self-supervised fashion based on the augmentations and subsequently fine-tune. Experiments are performed on the Oulu-CASIA dataset and the performance is compared to other works in FER. The results indicate that our method achieves an accuracy of 89.4%, setting a new state-of-the-art by outperforming other works. Additional experiments and analysis confirm the considerable contribution of the proposed temporal augmentation versus the existing spatial ones.
updated: Fri Aug 06 2021 11:27:06 GMT+0000 (UTC)
published: Fri Aug 06 2021 11:27:06 GMT+0000 (UTC)
