Frontal Low-rank Random Tensors for Fine-grained Action Segmentation
 トリミングされていない長い動画のきめの細かいアクションセグメンテーションは、監視、ロボット工学、人間とコンピュータの相互作用など、多くのアプリケーションにとって重要なタスクです。長期にわたる微妙で正確なアクションを理解するために、2次情報(例:特徴の共分散)以上が文献で効果的であると報告されています。しかし、そのような高次の情報を抽出することは、かなり簡単ではありません。特に、次元数は情報の順序とともに指数関数的に増加します。したがって、より多くの表現力を得ることは、計算コストと過剰適合のリスクも増加させます。この論文では、単純で効果的な双線形形式を介して時間アクションセグメンテーションの高次情報を表現するアプローチを提案します。特に、私たちの貢献は次のとおりです。(1)マルチリニアの観点から、3ウェイテンソルに低ランクの正面スライスがあると仮定して、低複雑度の双線形フォームを導出します。 (2)データからテンソルエントリを学習するのではなく、異なる基になる分布からエントリをサンプリングし、基になる分布が情報の順序に影響することを証明します。 (3)最新のディープニューラルネットワークの中間層としてバイリニア形式を採用し、複雑なディープモデルで高次の情報を効果的かつ効率的に表現できるようにしました。私たちの実験結果は、提案された双一次形式が、挑戦的な時間的アクションのセグメンテーションタスクに関する以前の最先端の方法よりも優れていることを示しています。データ、モデル、コードについては、プロジェクトページをご覧ください。
Fine-grained action segmentation in long untrimmed videos is an important task for many applications such as surveillance, robotics, and human-computer interaction. To understand subtle and precise actions within a long time period, second-order information (e.g. feature covariance) or higher is reported to be effective in the literature. However, extracting such high-order information is considerably non-trivial. In particular, the dimensionality increases exponentially with the information order, and hence gaining more representation power also increases the computational cost and the risk of overfitting. In this paper, we propose an approach to representing high-order information for temporal action segmentation via a simple yet effective bilinear form. Specifically, our contributions are: (1) From the multilinear perspective, we derive a bilinear form of low complexity, assuming that the three-way tensor has low-rank frontal slices. (2) Rather than learning the tensor entries from data, we sample the entries from different underlying distributions, and prove that the underlying distribution influences the information order. (3) We employed our bilinear form as an intermediate layer in state-of-the-art deep neural networks, enabling to represent high-order information in complex deep models effectively and efficiently. Our experimental results demonstrate that the proposed bilinear form outperforms the previous state-of-the-art methods on the challenging temporal action segmentation task. One can see our project page for data, model and code:
updated: Mon Apr 06 2020 14:42:57 GMT+0000 (UTC)
published: Mon Jun 03 2019 18:12:26 GMT+0000 (UTC)
