arXiv reaDer
スマートフォンでの実用的な視線推定に向けた一般化されたロバストな方法
A Generalized and Robust Method Towards Practical Gaze Estimation on Smart Phone
  通常のスマートフォンの視線推定、例えばユーザーが電話画面のどこを見ているかを推定することは、さまざまなアプリケーションに適用できます。ただし、広く使用されている外観ベースのCNNメソッドには、実際に採用するには2つの問題があります。第1に、データセットが限られているため、視線の推定は過剰適合になりやすく、実行時の精度が低下します。第二に、現在の方法は通常ロバストではありません。つまり、ユーザーが凝視を行っている場合でも予測結果に顕著なジッタがあり、ユーザーエクスペリエンスが大幅に低下します。最初の問題については、コサイン類似性プルーニングと整列直交初期化で強化された反復ランダム知識蒸留フレームワークである、新しい寛容で才能のある(TAT)トレーニングスキームを提案します。知識の蒸留は、多様で有益な監督を提供する寛容な教育プロセスです。強化されたプルーニングと初期化は、ネットワークがローカルミニマムから脱出し、より良いスタートから生まれ変わることを促す才能ある学習プロセスです。 2番目の問題については、視線推定器のロバスト性を測定するための新しいメトリックを定義し、それを改善するために敵対訓練に基づく順序損失を伴う外乱(DwO)メソッドを提案します。実験結果は、TATメソッドがGazeCaptureデータセットで最先端のパフォーマンスを達成し、DwOメソッドが同等の精度を維持しながら堅牢性を向上させることを示しています。
Gaze estimation for ordinary smart phone, e.g. estimating where the user is looking at on the phone screen, can be applied in various applications. However, the widely used appearance-based CNN methods still have two issues for practical adoption. First, due to the limited dataset, gaze estimation is very likely to suffer from over-fitting, leading to poor accuracy at run time. Second, the current methods are usually not robust, i.e. their prediction results having notable jitters even when the user is performing gaze fixation, which degrades user experience greatly. For the first issue, we propose a new tolerant and talented (TAT) training scheme, which is an iterative random knowledge distillation framework enhanced with cosine similarity pruning and aligned orthogonal initialization. The knowledge distillation is a tolerant teaching process providing diverse and informative supervision. The enhanced pruning and initialization is a talented learning process prompting the network to escape from the local minima and re-born from a better start. For the second issue, we define a new metric to measure the robustness of gaze estimator, and propose an adversarial training based Disturbance with Ordinal loss (DwO) method to improve it. The experimental results show that our TAT method achieves state-of-the-art performance on GazeCapture dataset, and that our DwO method improves the robustness while keeping comparable accuracy.
updated: Wed Oct 16 2019 13:15:57 GMT+0000 (UTC)
published: Wed Oct 16 2019 13:15:57 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト