arXiv reaDer
VQA用の変調された自己注意畳み込みネットワーク
Modulated Self-attention Convolutional Network for VQA
 現実世界の視覚的推論と構成的質問応答のための新しいデータセットが出現しているため、トレーニング中のエンドツーエンドプロセスとして視覚的特徴抽出を使用する必要があるかもしれません。この小さな貢献は、視覚的質問応答(VQA)のための従来の畳み込みネットワークの視覚処理を改善する新しいアイデアを提案することを目的としています。本稿では、CNNは自己注意で増補の言語入力によって変調することを提案します。この方向での将来の研究に向けて、相対的な改善を奨励することを示します。
As new data-sets for real-world visual reasoning and compositional question answering are emerging, it might be needed to use the visual feature extraction as a end-to-end process during training. This small contribution aims to suggest new ideas to improve the visual processing of traditional convolutional network for visual question answering (VQA). In this paper, we propose to modulate by a linguistic input a CNN augmented with self-attention. We show encouraging relative improvements for future research in this direction.
updated: Thu Oct 31 2019 16:59:23 GMT+0000 (UTC)
published: Tue Oct 08 2019 11:28:38 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト