TikTokやKwaiのような短いビデオアプリケーションは最近大ヒットしています。高まる需要に対応し、短いビデオの視覚情報を最大限に活用するには、各短いビデオのオブジェクトを特定し、アップストリームタスクとして分析する必要があります。したがって、何百ものカテゴリと複雑な視覚効果(VFX)を備えた大量の短いビデオ全体で、オブジェクトの検出、追跡、および再識別の精度と堅牢性をどのように改善するかという疑問が生じます。この目的のために、検出モジュール、追跡モジュール、および一般的なオブジェクト再識別モジュールで構成されるシステムを本論文で提案し、短いビデオから主要なオブジェクトの特徴をキャプチャします。特に、実用的な短いビデオアプリケーションでの高効率の要求に向けて、Temporal Information Fusion Network(TIFN)がオブジェクト検出モジュールで提案されています。これは、最先端のビデオオブジェクト検出器と同等の精度と改善された時間効率を示します。 。さらに、短いビデオのトラックレットの断片化された問題を軽減するために、クロスレイヤーポイントワイズシャムネットワーク(CPSN)が追跡モジュールで提案され、外観モデルの堅牢性が強化されます。さらに、提案されたシステムを評価するために、実世界の短いビデオを含む2つのチャレンジデータセットが、ビデオオブジェクトの軌跡抽出と一般的なオブジェクトの再識別のためにそれぞれ構築されます。全体として、各モジュールとシステム全体の広範な実験により、システムの有効性と効率が実証されています。
Short video applications like TikTok and Kwai have been a great hit recently. In order to meet the increasing demands and take full advantage of visual information in short videos, objects in each short video need to be located and analyzed as an upstream task. A question is thus raised -- how to improve the accuracy and robustness of object detection, tracking, and re-identification across tons of short videos with hundreds of categories and complicated visual effects (VFX). To this end, a system composed of a detection module, a tracking module and a generic object re-identification module, is proposed in this paper, which captures features of major objects from short videos. In particular, towards the high efficiency demands in practical short video application, a Temporal Information Fusion Network (TIFN) is proposed in the object detection module, which shows comparable accuracy and improved time efficiency to the state-of-the-art video object detector. Furthermore, in order to mitigate the fragmented issue of tracklets in short videos, a Cross-Layer Pointwise Siamese Network (CPSN) is proposed in the tracking module to enhance the robustness of the appearance model. Moreover, in order to evaluate the proposed system, two challenge datasets containing real-world short videos are built for video object trajectory extraction and generic object re-identification respectively. Overall, extensive experiments for each module and the whole system demonstrate the effectiveness and efficiency of our system.