arXiv reaDer
視覚的質問応答における分布外性能における質問エンコーダシーケンスモデルの重要性について
On the Significance of Question Encoder Sequence Model in the Out-of-Distribution Performance in Visual Question Answering
経験を超えて一般化することは、実用的なAIシステムの開発において重要な役割を果たします。現在の視覚的質問応答(VQA)モデルは、列車セットからの言語事前確率(質問タイプとそれらの最も頻繁な回答の間の疑似相関)に過度に依存しており、配布外( OOD)テストセット。この行為はそれらの一般化可能性を制限し、それらが実際の状況で利用されることを制限します。このホワイトペーパーでは、質問エンコーダで使用されるシーケンスモデルアーキテクチャが、VQAモデルの一般化に重要な役割を果たしていることを示しています。これを実証するために、既存のさまざまなRNNベースおよびTransformerベースの質問エンコーダーの詳細な分析を実行し、それに沿って、新しいグラフアテンションネットワーク(GAT)ベースの質問エンコーダーを提案しました。私たちの研究では、質問エンコーダーでシーケンスモデルをより適切に選択すると、追加の比較的複雑なバイアス緩和アプローチを使用しなくても、VQAモデルの一般化可能性が向上することがわかりました。
Generalizing beyond the experiences has a significant role in developing practical AI systems. It has been shown that current Visual Question Answering (VQA) models are over-dependent on the language-priors (spurious correlations between question-types and their most frequent answers) from the train set and pose poor performance on Out-of-Distribution (OOD) test sets. This conduct limits their generalizability and restricts them from being utilized in real-world situations. This paper shows that the sequence model architecture used in the question-encoder has a significant role in the generalizability of VQA models. To demonstrate this, we performed a detailed analysis of various existing RNN-based and Transformer-based question-encoders, and along, we proposed a novel Graph attention network (GAT)-based question-encoder. Our study found that a better choice of sequence model in the question-encoder improves the generalizability of VQA models even without using any additional relatively complex bias-mitigation approaches.
updated: Sat Aug 28 2021 05:51:27 GMT+0000 (UTC)
published: Sat Aug 28 2021 05:51:27 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト