エントリの一部のみを調べることで大規模なビジュアルデータテンソルを処理する、エンドツーエンドのトレーニング可能なフレームワークを提案します。私たちの方法は、ニューラルネットワークエンコーダーとテンソルトレイン分解を組み合わせて低ランクの潜在エンコーディングを学習し、クロス近似(CA)と組み合わせて元のサンプルのサブセットを介して表現を学習します。 CAは、テンソル分解に固有の適応サンプリングアルゴリズムであり、完全な高解像度データを明示的に操作することを回避します。代わりに、アウトオブコアおよびオンデマンドでフェッチするローカルの代表的なサンプルを積極的に選択します。必要なサンプル数は、入力のサイズに応じて対数的にのみ増加します。ネットワーク内のテンソルの暗黙的な表現により、圧縮されていない形式では扱いにくい大きなグリッドの処理が可能になります。提案されたアプローチは、大規模な多次元グリッドデータ(たとえば、3Dトモグラフィー)、および大きな受容野にわたるコンテキストを必要とするタスク(たとえば、臓器全体の病状の予測)に特に役立ちます。コードはhttps://github.com/aelphy/c-picで入手できます。
We propose an end-to-end trainable framework that processes large-scale visual data tensors by looking at a fraction of their entries only. Our method combines a neural network encoder with a tensor train decomposition to learn a low-rank latent encoding, coupled with cross-approximation (CA) to learn the representation through a subset of the original samples. CA is an adaptive sampling algorithm that is native to tensor decompositions and avoids working with the full high-resolution data explicitly. Instead, it actively selects local representative samples that we fetch out-of-core and on-demand. The required number of samples grows only logarithmically with the size of the input. Our implicit representation of the tensor in the network enables processing large grids that could not be otherwise tractable in their uncompressed form. The proposed approach is particularly useful for large-scale multidimensional grid data (e.g., 3D tomography), and for tasks that require context over a large receptive field (e.g., predicting the medical condition of entire organs). The code is available at https://github.com/aelphy/c-pic.