この論文では、畳み込みニューラルネットワーク(CNN)ベースのクラウドカウント(PGCNet)の新しい遠近法誘導畳み込み(PGC)を提案します。ほとんどの最新技術では、このような問題に対処するためにマルチスケールまたはマルチカラムアーキテクチャを採用していますが、個別の代表的なスケールのみが考慮されるため、一般的に連続スケールバリエーションのモデリングに失敗します。一方、PGCNetは、パースペクティブ情報を使用して、フィーチャマップを連続的な畳み込みに送る前に、フィーチャマップの空間的に変化する平滑化をガイドします。また、PGCNetには効果的な視点推定ブランチが導入されています。PGCNetは、ブランチが事前にトレーニングされている場合、教師あり設定または弱教師あり設定でトレーニングできます。 PGCNetは、計算がやや増加した単一カラムであり、4つのベンチマークデータセットに関する広範な実験結果は、最先端技術に対する本方法の改善を示しています。さらに、Crowd Surveillanceも導入します。これは、困難なシナリオを伴う13,000以上の高解像度画像を含む、クラウドカウント用の大規模なデータセットです。
In this paper, we propose a novel perspective-guided convolution (PGC) for convolutional neural network (CNN) based crowd counting (i.e. PGCNet), which aims to overcome the dramatic intra-scene scale variations of people due to the perspective effect. While most state-of-the-arts adopt multi-scale or multi-column architectures to address such issue, they generally fail in modeling continuous scale variations since only discrete representative scales are considered. PGCNet, on the other hand, utilizes perspective information to guide the spatially variant smoothing of feature maps before feeding them to the successive convolutions. An effective perspective estimation branch is also introduced to PGCNet, which can be trained in either supervised setting or weakly-supervised setting when the branch has been pre-trained. Our PGCNet is single-column with moderate increase in computation, and extensive experimental results on four benchmark datasets show the improvements of our method against the state-of-the-arts. Additionally, we also introduce Crowd Surveillance, a large scale dataset for crowd counting that contains 13,000+ high-resolution images with challenging scenarios.