時間的アクションの検出は、ビデオを理解する上で基本的かつ困難なタスクです。最先端の方法の多くは、2次元物体検出検出器に類似した所定のアンカーに基づいて、アクションインスタンスの境界を予測します。ただし、トリミングされていないビデオのインスタンスの期間は数秒から数分まで変化する可能性があるため、所定の時間スケールですべてのアクションインスタンスを検出することは困難です。本論文では、アンカーフリーの1段階時間アクション検出器(AFO-TAD)という新しいアクション検出アーキテクチャを提案します。 AFO-TADは、2つの側面に起因する任意の長さと高い時間解像度でアクションインスタンスを検出するためのパフォーマンスを向上させます。最初に、正確なアクション検出のために受容野を動的に調整する受容野適応モジュールを設計します。第二に、AFO-TADは、事前に決められたアンカーなしで、すべての時間的位置でカテゴリと境界を直接予測します。広範な実験により、AFO-TADがTHUMOS'14の最先端のパフォーマンスを改善することが示されています。
Temporal action detection is a fundamental yet challenging task in video understanding. Many of the state-of-the-art methods predict the boundaries of action instances based on predetermined anchors akin to the two-dimensional object detection detectors. However, it is hard to detect all the action instances with predetermined temporal scales because the durations of instances in untrimmed videos can vary from few seconds to several minutes. In this paper, we propose a novel action detection architecture named anchor-free one-stage temporal action detector (AFO-TAD). AFO-TAD achieves better performance for detecting action instances with arbitrary lengths and high temporal resolution, which can be attributed to two aspects. First, we design a receptive field adaption module which dynamically adjusts the receptive field for precise action detection. Second, AFO-TAD directly predicts the categories and boundaries at every temporal locations without predetermined anchors. Extensive experiments show that AFO-TAD improves the state-of-the-art performance on THUMOS'14.