複雑な視覚ナビゲーションタスクは、エージェントをさまざまな状況に置き、さまざまな視覚認識能力を必要とします。たとえば、「最寄りの椅子に行く」には、エージェントはセマンティクスを使用して居間の椅子を識別し、消失点の手がかりを使用して廊下をたどり、奥行きを使用して障害物を回避する必要があります。したがって、視覚環境の状況理解に基づいて適切な視覚認識能力を利用することで、目に見えない視覚環境でこれらのナビゲーションモデルを強化することができます。多様な視覚能力に対応する視覚表現の大規模なセットを融合するようにエージェントを訓練することを提案します。各表現を十分に活用するために、アクションレベルの表現融合スキームを開発します。これは、各表現からアクション候補を予測し、これらのアクション候補を最終的なアクションに適応的に統合します。さらに、データ駆動型のタスク間アフィニティ正則化を採用して、冗長性を減らし、一般化を改善します。私たちのアプローチは、ImageNetで事前にトレーニングされたベースラインや他の融合方法よりも新しい環境で大幅に改善されたパフォーマンスにつながります。
A complex visual navigation task puts an agent in different situations which call for a diverse range of visual perception abilities. For example, to "go to the nearest chair", the agent might need to identify a chair in a living room using semantics, follow along a hallway using vanishing point cues, and avoid obstacles using depth. Therefore, utilizing the appropriate visual perception abilities based on a situational understanding of the visual environment can empower these navigation models in unseen visual environments. We propose to train an agent to fuse a large set of visual representations that correspond to diverse visual perception abilities. To fully utilize each representation, we develop an action-level representation fusion scheme, which predicts an action candidate from each representation and adaptively consolidate these action candidates into the final action. Furthermore, we employ a data-driven inter-task affinity regularization to reduce redundancies and improve generalization. Our approach leads to a significantly improved performance in novel environments over ImageNet-pretrained baseline and other fusion methods.