この作業では、テキスト認識(手書きまたはシーンテキスト)とドキュメント画像の強調という2つのタスクを解決することを目的とした、テキスト劣化不変オートエンコーダ(Text-DIAE)を提案します。ラベル付けされたデータを使用せずに事前トレーニング中に最適化される学習目標として、3つの口実タスクを定義します。各プレテキストの目的は、最終的なダウンストリームタスク用に特別に調整されています。特定のドメインの各劣化の重要性を示すいくつかのアブレーション実験を実施します。徹底的な実験は、私たちの方法が対照的な損失に基づく以前の最先端の制限を持たないと同時に、収束するために本質的に少ないデータサンプルを必要とすることを示しています。最後に、私たちの方法が、手書きおよびシーンのテキスト認識とドキュメント画像の強化における既存の監視および自己監視設定で、最先端を大幅に上回っていることを示します。私たちのコードとトレーニングされたモデルは、〜http:// Upon_Acceptanceで公開されます。
In this work, we propose Text-Degradation Invariant Auto Encoder (Text-DIAE) aimed to solve two tasks, text recognition (handwritten or scene-text) and document image enhancement. We define three pretext tasks as learning objectives to be optimized during pre-training without the usage of labelled data. Each of the pre-text objectives is specifically tailored for the final downstream tasks. We conduct several ablation experiments that show the importance of each degradation for a specific domain. Exhaustive experimentation shows that our method does not have limitations of previous state-of-the-art based on contrastive losses while at the same time requiring essentially fewer data samples to converge. Finally, we demonstrate that our method surpasses the state-of-the-art significantly in existing supervised and self-supervised settings in handwritten and scene text recognition and document image enhancement. Our code and trained models will be made publicly available at~ http://Upon_Acceptance.