光学式文字認識(OCR)システムは、画像から意味情報を抽出するためのさまざまなアプリケーションで広く使用されています。ユーザーがプライバシーをより細かく制御できるようにするには、デバイス上のソリューションが必要です。現在の最先端モデルは重すぎて複雑すぎて、デバイスに展開できません。効率的な軽量シーンテキスト認識(STR)システムを開発しました。このシステムは、パラメーターがわずか88万個で、リアルタイムのテキスト認識を実行します。アテンションモジュールはSTRネットワークの精度を高める傾向がありますが、一般的に低速であり、デバイスの推論用に最適化されていません。そこで、テキスト認識ネットワークに畳み込み注意モジュールを使用することを提案します。これは、非常に最小限の計算コストを追加することにより、LSTMモジュールにチャネルおよび空間注意情報を提供することを目的としています。これにより、ICDAR 13データセットの単語の精度がほぼ2%向上します。また、水平テキストと垂直テキストの両方の同時認識をサポートするために、新しい方向分類モジュールを紹介します。提案されたモデルは、推論時間とメモリフットプリントのデバイス上のメトリックを上回り、主要な商用およびその他のオープンソースOCRエンジンと比較した場合に同等の精度を実現します。 Exynos 990チップセットデバイスでワードあたり2.44ミリ秒の推論速度でシステムをデバイスに展開し、ICDAR-13データセットで88.4%の精度を達成します。
Optical Character Recognition (OCR) systems have been widely used in various applications for extracting semantic information from images. To give the user more control over their privacy, an on-device solution is needed. The current state-of-the-art models are too heavy and complex to be deployed on-device. We develop an efficient lightweight scene text recognition (STR) system, which has only 0.88M parameters and performs real-time text recognition. Attention modules tend to boost the accuracy of STR networks but are generally slow and not optimized for device inference. So, we propose the use of convolution attention modules to the text recognition networks, which aims to provide channel and spatial attention information to the LSTM module by adding very minimal computational cost. It boosts our word accuracy on ICDAR 13 dataset by almost 2%. We also introduce a novel orientation classifier module, to support the simultaneous recognition of both horizontal and vertical text. The proposed model surpasses on-device metrics of inference time and memory footprint and achieves comparable accuracy when compared to the leading commercial and other open-source OCR engines. We deploy the system on-device with an inference speed of 2.44 ms per word on the Exynos 990 chipset device and achieve an accuracy of 88.4% on ICDAR-13 dataset.