顔のポーズ推定は、人間とロボットの相互作用、視線推定、ドライバーの監視など、多くの実用的なアプリケーションで多くの注目を集めています。一方、エンドツーエンドのディープラーニングベースの顔のポーズ推定はますます人気が高まっています。ただし、顔のポーズの推定には重要な課題があります。それは、多くのポーズ、特に大きなポーズの十分なトレーニングデータが不足していることです。近いポーズの顔が似ているという観察に触発されて、顔のポーズ推定をラベル分布学習問題として再定式化し、各顔画像を単一のラベルではなくガウスラベル分布に関連付けられた例として考慮し、畳み込みニューラルを構築しますカラー画像から直接顔のポーズを予測するために、AFLWデータセットと300W-LPデータセットのマルチロス関数でトレーニングされたネットワーク。 AFLW2000、BIWI、AFLW、AFWなど、いくつかの一般的なベンチマークで広範な実験が行われ、私たちのアプローチは他の最先端の方法よりも大きな利点を示しています。
Facial pose estimation has gained a lot of attentions in many practical applications, such as human-robot interaction, gaze estimation and driver monitoring. Meanwhile, end-to-end deep learning-based facial pose estimation is becoming more and more popular. However, facial pose estimation suffers from a key challenge: the lack of sufficient training data for many poses, especially for large poses. Inspired by the observation that the faces under close poses look similar, we reformulate the facial pose estimation as a label distribution learning problem, considering each face image as an example associated with a Gaussian label distribution rather than a single label, and construct a convolutional neural network which is trained with a multi-loss function on AFLW dataset and 300W-LP dataset to predict the facial poses directly from color image. Extensive experiments are conducted on several popular benchmarks, including AFLW2000, BIWI, AFLW and AFW, where our approach shows a significant advantage over other state-of-the-art methods.