arXiv reaDer
空間と時間におけるスペクトルオブジェクトセグメンテーションへの3D畳み込みアプローチ
A 3D Convolutional Approach to Spectral Object Segmentation in Space and Time
 ビデオのオブジェクトセグメンテーションを、ノードがピクセルであり、それらの関係が局所的な近傍を形成する、空間と時間のグラフ分割問題として定式化します。このピクセルレベルのグラフで最も強いクラスターは、顕著なオブジェクトのセグメンテーションを表すと主張します。マトリックスを明示的に構築せずに、スペクトルクラスタリングソリューション、つまりグラフの隣接マトリックスの主固有ベクトルを見つける、斬新で高速な3Dフィルタリング技術を使用してメインクラスターを計算します。これは扱いにくいでしょう。私たちの方法は、行列の主要な固有ベクトルを見つけるためのべき乗反復に基づいています。これは、時空間フィーチャボリュームで特定の3D畳み込みのセットを実行することと同等であることを証明します。これにより、マトリックスの作成を回避し、GPUで高速並列実装を実現できます。我々の方法は、隣接行列に直接適用される従来のパワー反復よりもはるかに高速であることを示します。他の作品とは異なり、私たちの作品は、ピクセルのレベルで空間と時間のオブジェクトの一貫性を維持することに専念しています。そのためには、フレームレベルで強力なピクセル単位の機能が必要です。このため、バックボーンネットワークやその他の方法の出力を組み込んで、監視なしでソリューションを迅速に改善するのに最適です。実験では、監視されていないタスクと半監視されているタスクの両方で、DAVIS-2016データセットの最先端のメソッドに対して、同じハイパーパラメータのセットで一貫した改善が得られます。また、有名なSegTrackv2データセットで最高の結果を達成しました。
We formulate object segmentation in video as a graph partitioning problem in space and time, in which nodes are pixels and their relations form local neighborhoods. We claim that the strongest cluster in this pixel-level graph represents the salient object segmentation. We compute the main cluster using a novel and fast 3D filtering technique that finds the spectral clustering solution, namely the principal eigenvector of the graph's adjacency matrix, without building the matrix explicitly - which would be intractable. Our method is based on the power iteration for finding the principal eigenvector of a matrix, which we prove is equivalent to performing a specific set of 3D convolutions in the space-time feature volume. This allows us to avoid creating the matrix and have a fast parallel implementation on GPU. We show that our method is much faster than classical power iteration applied directly on the adjacency matrix. Different from other works, ours is dedicated to preserving object consistency in space and time at the level of pixels. For that, it requires powerful pixel-wise features at the frame level. This makes it perfectly suitable for incorporating the output of a backbone network or other methods and fast-improving over their solution without supervision. In experiments, we obtain consistent improvement, with the same set of hyper-parameters, over the top state of the art methods on DAVIS-2016 dataset, both in unsupervised and semi-supervised tasks. We also achieve top results on the well-known SegTrackv2 dataset.
updated: Mon Apr 27 2020 19:35:48 GMT+0000 (UTC)
published: Fri Jul 05 2019 09:07:19 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト