arXiv reaDer
アライメント正則化によるストリーミングオーディオビジュアル音声認識
Streaming Audio-Visual Speech Recognition with Alignment Regularization
この研究では、ハイブリッド コネクショニスト時間分類 (CTC)/注意ニューラル ネットワーク アーキテクチャに基づくストリーミング AV-ASR システムを提案します。オーディオおよびビジュアル エンコーダー ニューラル ネットワークは両方ともコンフォーマー アーキテクチャに基づいており、チャンクごとのセルフ アテンション (CSA) と因果的畳み込みを使用してストリーミング可能になっています。デコーダー ニューラル ネットワークによるストリーミング認識は、CTC/アテンション スコアリングを併用して時間同期デコードを実行するトリガー アテンション技術を使用して実現されます。さらに、オーディオとビジュアルのエンコーダーの同期を促進する新しいアライメント正則化手法を提案します。これにより、ストリーミングおよびオフライン AV-ASR モデルのすべての SNR レベルでワード エラー レート (WER) が向上します。提案された AV-ASR モデルは、オフライン設定およびオンライン設定の読唇文 3 (LRS3) データセットでそれぞれ 2.0% と 2.6% の WER を達成します。どちらも、外部トレーニング データがない場合に最先端の結果を示します。使用済み。
In this work, we propose a streaming AV-ASR system based on a hybrid connectionist temporal classification (CTC)/attention neural network architecture. The audio and the visual encoder neural networks are both based on the conformer architecture, which is made streamable using chunk-wise self-attention (CSA) and causal convolution. Streaming recognition with a decoder neural network is realized by using the triggered attention technique, which performs time-synchronous decoding with joint CTC/attention scoring. Additionally, we propose a novel alignment regularization technique that promotes synchronization of the audio and visual encoder, which in turn results in better word error rates (WERs) at all SNR levels for streaming and offline AV-ASR models. The proposed AV-ASR model achieves WERs of 2.0% and 2.6% on the Lip Reading Sentences 3 (LRS3) dataset in an offline and online setup, respectively, which both present state-of-the-art results when no external training data are used.
updated: Sun Jul 02 2023 00:33:36 GMT+0000 (UTC)
published: Thu Nov 03 2022 20:20:47 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト