arXiv reaDer
人間の行動認識のために教師なしSTDPでトレーニングされた2D対3D畳み込みスパイキングニューラルネットワーク
2D versus 3D Convolutional Spiking Neural Networks Trained with Unsupervised STDP for Human Action Recognition
テクノロジーの現在の進歩は、コンピュータービジョンの領域におけるビデオ分析の重要性を浮き彫りにしました。ただし、ビデオ分析は、従来の人工ニューラルネットワーク(ANN)ではかなり高い計算コストがかかります。スパイキングニューラルネットワーク(SNN)は、情報をスパイクの形で処理する、生物学的にもっともらしい第3世代のモデルです。スパイクタイミング依存可塑性(STDP)ルールを使用したSNNによる教師なし学習は、通常の人工ニューラルネットワークのいくつかのボトルネックを克服する可能性がありますが、STDPベースのSNNはまだ未成熟であり、そのパフォーマンスはANNのパフォーマンスをはるかに下回っています。この作業では、人間の行動認識のタスクに挑戦したときのSNNのパフォーマンスを研究します。これは、このタスクがビデオ監視などのコンピュータービジョンに多くのリアルタイムアプリケーションを持っているためです。この論文では、教師なしSTDPでトレーニングされた多層3D畳み込みSNNモデルを紹介します。このモデルのパフォーマンスを、KTHおよびWeizmannデータセットでチャレンジしたときの2DSTDPベースのSNNのパフォーマンスと比較します。また、これらのモデルのパフォーマンスを正確に評価するために、これらのモデルの単層バージョンと多層バージョンを比較します。 STDPベースの畳み込みSNNは、3Dカーネルを使用してモーションパターンを学習できるため、ビデオからのモーションベースの認識が可能になることを示します。最後に、特に長いビデオシーケンスを処理する場合、3D畳み込みがSTDPベースのSNNを使用した2D畳み込みよりも優れているという証拠を示します。
Current advances in technology have highlighted the importance of video analysis in the domain of computer vision. However, video analysis has considerably high computational costs with traditional artificial neural networks (ANNs). Spiking neural networks (SNNs) are third generation biologically plausible models that process the information in the form of spikes. Unsupervised learning with SNNs using the spike timing dependent plasticity (STDP) rule has the potential to overcome some bottlenecks of regular artificial neural networks, but STDP-based SNNs are still immature and their performance is far behind that of ANNs. In this work, we study the performance of SNNs when challenged with the task of human action recognition, because this task has many real-time applications in computer vision, such as video surveillance. In this paper we introduce a multi-layered 3D convolutional SNN model trained with unsupervised STDP. We compare the performance of this model to those of a 2D STDP-based SNN when challenged with the KTH and Weizmann datasets. We also compare single-layer and multi-layer versions of these models in order to get an accurate assessment of their performance. We show that STDP-based convolutional SNNs can learn motion patterns using 3D kernels, thus enabling motion-based recognition from videos. Finally, we give evidence that 3D convolution is superior to 2D convolution with STDP-based SNNs, especially when dealing with long video sequences.
updated: Thu May 26 2022 16:34:22 GMT+0000 (UTC)
published: Thu May 26 2022 16:34:22 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト