arXiv reaDer
A BLSTM Network for Printed Bengali OCR System with High Accuracy
このペーパーでは、128ユニットを持つ単一の隠しBLSTM-CTCアーキテクチャを使用して、私たちが開発した印刷されたベンガル語と英語のテキストOCRシステムを紹介します。ここでは、BLSTMでピープホール接続とドロップアウトを使用しなかったため、精度が向上しました。このアーキテクチャは、英語の単語も含む47,720のテキスト行によってトレーニングされました。 20以上の異なるベンガル語フォントをテストしたところ、文字レベルの精度は99.32%、単語レベルの精度は96.65%でした。優れたインド語のマルチスクリプトOCRシステムもGoogleによって開発されています。ベンガル語の文字を、ベンガル語以外の文字、特にいくつかの文字を除いてベンガル語と区別のないアッサム語の文字と同じ文字に認識することがあります。たとえば、「RA」のベンガル語の文字は、主に接続子音の形で、アッサム語の文字として認識されることがあります。 OCRにはこのようなエラーはありません。このOCRシステムは、https://banglaocr.nltr.orgからオンラインで入手できます。
This paper presents a printed Bengali and English text OCR system developed by us using a single hidden BLSTM-CTC architecture having 128 units. Here, we did not use any peephole connection and dropout in the BLSTM, which helped us in getting better accuracy. This architecture was trained by 47,720 text lines that include English words also. When tested over 20 different Bengali fonts, it has produced character level accuracy of 99.32% and word level accuracy of 96.65%. A good Indic multi script OCR system is also developed by Google. It sometimes recognizes a character of Bengali into the same character of a non-Bengali script, especially Assamese, which has no distinction from Bengali, except for a few characters. For example, Bengali character for 'RA' is sometimes recognized as that of Assamese, mainly in conjunct consonant forms. Our OCR is free from such errors. This OCR system is available online at
updated: Fri Aug 23 2019 05:45:27 GMT+0000 (UTC)
published: Fri Aug 23 2019 05:45:27 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)アソシエイト