arXiv reaDer
RGB イベントトランスフォーマートラッカーのためのクロスモーダル直交高ランク拡張
Cross-modal Orthogonal High-rank Augmentation for RGB-Event Transformer-trackers
この論文では、RGB ビデオとイベント データからのクロスモーダル オブジェクト追跡の問題を扱います。複雑なクロスモーダルフュージョンネットワークを構築するのではなく、事前にトレーニングされたビジョントランスフォーマー(ViT)の大きな可能性を探求します。特に、私たちは、ViT が 2 つのモダリティ間の膨大な配信ギャップを埋めることを促進するプラグアンドプレイのトレーニング拡張を繊細に研究し、包括的なクロスモーダル情報インタラクションを可能にし、その能力を強化します。具体的には、いくつかのトークンの特定のモダリティをランダムにマスクして、積極的に対話する異なるモダリティのトークン間の相互作用を強制するマスク モデリング戦略を提案します。マスキング戦略に起因するネットワークの振動を緩和し、そのプラスの効果をさらに増幅するために、アテンション行列を正則化する直交高ランク損失を理論的に提案します。広範な実験により、当社のプラグ アンド プレイ トレーニング拡張技術により、追跡精度と成功率の両方の点で最先端の 1 ストリーム トラッカーと 2 ストリーム トラッカーを大幅に向上できることが実証されました。私たちの新しい視点と発見は、強力な事前トレーニング済み ViT を活用してクロスモーダル データをモデル化する分野に洞察をもたらす可能性があります。コードは公開されます。
This paper addresses the problem of cross-modal object tracking from RGB videos and event data. Rather than constructing a complex cross-modal fusion network, we explore the great potential of a pre-trained vision Transformer (ViT). Particularly, we delicately investigate plug-and-play training augmentations that encourage the ViT to bridge the vast distribution gap between the two modalities, enabling comprehensive cross-modal information interaction and thus enhancing its ability. Specifically, we propose a mask modeling strategy that randomly masks a specific modality of some tokens to enforce the interaction between tokens from different modalities interacting proactively. To mitigate network oscillations resulting from the masking strategy and further amplify its positive effect, we then theoretically propose an orthogonal high-rank loss to regularize the attention matrix. Extensive experiments demonstrate that our plug-and-play training augmentation techniques can significantly boost state-of-the-art one-stream and twostream trackers to a large extent in terms of both tracking precision and success rate. Our new perspective and findings will potentially bring insights to the field of leveraging powerful pre-trained ViTs to model cross-modal data. The code will be publicly available.
updated: Tue Sep 05 2023 02:09:30 GMT+0000 (UTC)
published: Sun Jul 09 2023 08:58:47 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト