DeepFakeの生成方法が改善されたため、変更および操作された面の作成がより一般的になりました。同時に、画像やビデオのコンテンツから操作された顔と元の顔を区別するための検出モデルの開発を見てきました。公開されているDeepFake検出データセットのほとんどはバリエーションが限られており、多くの動画で1つの顔が使用されているため、トレーニングデータセットがオーバーサンプリングされていることがわかりました。このため、ディープニューラルネットワークは、DeepFakeコンテンツの操作機能を検出することを学習するのではなく、顔の機能に過剰適合する傾向があります。その結果、ほとんどの検出アーキテクチャは、目に見えないデータでテストした場合、パフォーマンスが低下します。この論文では、この問題を調査するための定量分析を提供し、少数のアクターから生成された大量のサンプルによるモデルの過剰適合を防ぐための解決策を提示します。 DeepFake検出を改善するために、畳み込みニューラルネットワーク(CNN)をトレーニングするためのデータ拡張方法であるFace-Cutoutを紹介します。この方法では、向きに関係なく、顔のランドマーク情報を使用して、さまざまなオクルージョンを持つトレーニング画像が動的に生成されます。他の汎用の拡張方法とは異なり、DeepFakeの検出に不可欠な顔の情報に焦点を当てています。私たちの方法は、他のオクルージョンベースの拡張手法と比較して、さまざまなデータセットでLogLossを15.2%から35.3%削減します。 Face-Cutoutは、CNNベースの認識モデルと簡単に統合でき、検出パフォーマンスを向上できることを示しています。
The creation of altered and manipulated faces has become more common due to the improvement of DeepFake generation methods. Simultaneously, we have seen detection models' development for differentiating between a manipulated and original face from image or video content. We have observed that most publicly available DeepFake detection datasets have limited variations, where a single face is used in many videos, resulting in an oversampled training dataset. Due to this, deep neural networks tend to overfit to the facial features instead of learning to detect manipulation features of DeepFake content. As a result, most detection architectures perform poorly when tested on unseen data. In this paper, we provide a quantitative analysis to investigate this problem and present a solution to prevent model overfitting due to the high volume of samples generated from a small number of actors. We introduce Face-Cutout, a data augmentation method for training Convolutional Neural Networks (CNN), to improve DeepFake detection. In this method, training images with various occlusions are dynamically generated using face landmark information irrespective of orientation. Unlike other general-purpose augmentation methods, it focuses on the facial information that is crucial for DeepFake detection. Our method achieves a reduction in LogLoss of 15.2% to 35.3% on different datasets, compared to other occlusion-based augmentation techniques. We show that Face-Cutout can be easily integrated with any CNN-based recognition model and improve detection performance.