DeepErase: Weakly Supervised Ink Artifact Removal in Document Text Images
 保険、法律、政府などの紙集約型産業は、光学式文字認識(OCR)を長年活用して、スキャンしたドキュメントの大部分をダウンストリーム処理用のテキスト文字列に自動的に転写しました。 2019年でさえ、非デジタル形式で企業に持ち込まれるスキャンされたドキュメントやメールはまだたくさんあります。実世界のドキュメントから抽出されるテキストは、多くの場合、インクがテキスト自体のインクに触れる、またはインクを打つこともある空白のボックスまたは下線のある表形式の構造やフォームなど、豊富な書式設定の中にあります。さらに、テキスト領域には、ランダムなインクの汚れや偽のストロークが含まれる場合があります。このようなインクアーティファクトは、認識アルゴリズムまたはその他のダウンストリーム処理タスクのパフォーマンスを大幅に妨げる可能性があります。この作業では、テキストイメージからインクアーティファクトを消去するニューラルベースのプリプロセッサであるDeepEraseを提案します。ピクセルレベルの注釈はアセンブリプロセス中に自動的に取得されるため、実際のテキスト画像と実際のアーティファクトを現実的に見える「ダーティ」テキスト画像にプログラムでアセンブルする方法を考案します。 。高いセグメンテーション精度に加えて、クレンジングされた画像がTesseract 4.0などの一般的なOCRソフトウェアによって認識精度を大幅に向上させることを示しています。最後に、スキャンしたIRS納税申告書の非流通データセット(NIST SDB)でDeepEraseをテストし、2桁の精度向上を達成します。すべての実験は、印刷テキストと手書きテキストの両方で実行されます。すべての実験のコードはで入手できます。
Paper-intensive industries like insurance, law, and government have long leveraged optical character recognition (OCR) to automatically transcribe hordes of scanned documents into text strings for downstream processing. Even in 2019, there are still many scanned documents and mail that come into businesses in non-digital format. Text to be extracted from real world documents is often nestled inside rich formatting, such as tabular structures or forms with fill-in-the-blank boxes or underlines whose ink often touches or even strikes through the ink of the text itself. Further, the text region could have random ink smudges or spurious strokes. Such ink artifacts can severely interfere with the performance of recognition algorithms or other downstream processing tasks. In this work, we propose DeepErase, a neural-based preprocessor to erase ink artifacts from text images. We devise a method to programmatically assemble real text images and real artifacts into realistic-looking "dirty" text images, and use them to train an artifact segmentation network in a weakly supervised manner, since pixel-level annotations are automatically obtained during the assembly process. In addition to high segmentation accuracy, we show that our cleansed images achieve a significant boost in recognition accuracy by popular OCR software such as Tesseract 4.0. Finally, we test DeepErase on out-of-distribution datasets (NIST SDB) of scanned IRS tax return forms and achieve double-digit improvements in accuracy. All experiments are performed on both printed and handwritten text. Code for all experiments is available at
updated: Thu Jan 16 2020 05:35:49 GMT+0000 (UTC)
published: Tue Oct 15 2019 21:57:04 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)