arXiv reaDer
人間のシーン理解のイクシャナ仮説
The Ikshana Hypothesis of Human Scene Understanding
近年、ディープニューラルネットワーク(DNN)は、いくつかのコンピュータービジョンタスクで最先端のパフォーマンスを実現しました。ただし、これらのDNNの典型的な欠点の1つは、大量のラベル付きデータが必要になることです。数ショットの学習方法はこの問題に対処しますが、既存の方法に加えてメタ学習や計量学習などの手法を使用することがよくあります。この作業では、神経科学のいくつかの発見によってサポートされているIkshanaという名前の仮説を提案することにより、神経科学の観点からこの問題に対処します。私たちの仮説は、自然のシーン/イメージを理解しながら、人間の脳の概念の要点を洗練するプロセスを近似しています。私たちの仮説は神経科学において特に目新しいものではありませんが、視覚課題のためのDNNを設計するための新しい視点を提供します。 Ikshana仮説に従うことにより、IkshanaNetという名前の新しいニューラルインスパイアードCNNアーキテクチャを設計します。経験的結果は、CityscapesとCamVidセマンティックセグメンテーションベンチマークの全体とサブセットでいくつかのベースラインを上回っていることにより、私たちの方法の有効性を示しています。
In recent years, deep neural networks (DNNs) achieved state-of-the-art performance on several computer vision tasks. However, the one typical drawback of these DNNs is the requirement of massive labeled data. Even though few-shot learning methods address this problem, they often use techniques such as meta-learning and metric-learning on top of the existing methods. In this work, we address this problem from a neuroscience perspective by proposing a hypothesis named Ikshana, which is supported by several findings in neuroscience. Our hypothesis approximates the refining process of conceptual gist in the human brain while understanding a natural scene/image. While our hypothesis holds no particular novelty in neuroscience, it provides a novel perspective for designing DNNs for vision tasks. By following the Ikshana hypothesis, we design a novel neural-inspired CNN architecture named IkshanaNet. The empirical results demonstrate the effectiveness of our method by outperforming several baselines on the entire and subsets of the Cityscapes and the CamVid semantic segmentation benchmarks.
updated: Tue Nov 30 2021 11:48:41 GMT+0000 (UTC)
published: Thu Jan 21 2021 10:30:56 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト