視覚的な質問応答のような視覚と言語の共同作業は、高度な理解を模索するので魅力的ですが、同時に言語の偏りが生じやすい傾向があります。このペーパーでは、MovieQAデータセットのバイアスを調査し、それらを活用できる驚くほど単純なモデルを提案します。適切な単語の埋め込みを使用することが最も重要であることがわかりました。適切に訓練された単語の埋め込みを使用することにより、質問と回答だけを見るだけで質問回答(QA)の約半分に答えることができ、ビデオクリップ、字幕、映画の脚本からの物語の文脈を完全に無視します。リーダーボードで公開されている最高の論文と比較して、単純な質問+回答のみのモデルでは、ビデオ+字幕カテゴリで5%、字幕で5%、DVSで15%、スクリプトで6%精度が向上します。
Joint vision and language tasks like visual question answering are fascinating because they explore high-level understanding, but at the same time, can be more prone to language biases. In this paper, we explore the biases in the MovieQA dataset and propose a strikingly simple model which can exploit them. We find that using the right word embedding is of utmost importance. By using an appropriately trained word embedding, about half the Question-Answers (QAs) can be answered by looking at the questions and answers alone, completely ignoring narrative context from video clips, subtitles, and movie scripts. Compared to the best published papers on the leaderboard, our simple question + answer only model improves accuracy by 5% for video + subtitle category, 5% for subtitle, 15% for DVS and 6% higher for scripts.