このペーパーでは、CVPR 2020のワークショップ「ディープラーニング時代のテキストとドキュメント」の一部として組織されたドキュメントのビジュアル質問応答チャレンジの結果を紹介します。このチャレンジでは、新しい問題-ドキュメントイメージのビジュアル質問応答が導入されます。課題は2つのタスクで構成されていました。最初のタスクは、単一のドキュメントイメージについて質問することです。一方、2番目のタスクは、画像の集合に質問が出される検索タスクとして設定されます。タスク1では、12,767を超えるドキュメントイメージに対して定義された50,000の質問と回答のペアで構成される新しいデータセットが導入されます。タスク2では、同じドキュメントテンプレートを共有する14,362を超えるドキュメント画像を含む20の質問を含む別のデータセットが作成されました。
This paper presents results of Document Visual Question Answering Challenge organized as part of "Text and Documents in the Deep Learning Era" workshop, in CVPR 2020. The challenge introduces a new problem - Visual Question Answering on document images. The challenge comprised two tasks. The first task concerns with asking questions on a single document image. On the other hand, the second task is set as a retrieval task where the question is posed over a collection of images. For the task 1 a new dataset is introduced comprising 50,000 questions-answer(s) pairs defined over 12,767 document images. For task 2 another dataset has been created comprising 20 questions over 14,362 document images which share the same document template.