arXiv reaDer
大規模な言語モデルにモーメントローカリゼーション用のクエリの再定式化を促す
Prompting Large Language Models to Reformulate Queries for Moment Localization
瞬間ローカリゼーションのタスクは、特定の自然言語クエリに対してトリミングされていないビデオ内の時間的な瞬間をローカライズすることです。トリミングされていないビデオには非常に冗長なコンテンツが含まれているため、瞬間を正確に位置特定するにはクエリの品質が非常に重要です。つまり、位置特定モデルがビデオ内で何を探すべきかを理解できるように、クエリはターゲットの瞬間に関する正確な情報を提供する必要があります。ただし、現在のデータセットの自然言語クエリは、既存のモデルでは理解するのが簡単ではない可能性があります。たとえば、Ego4D データセットは、比較的複雑な瞬間を記述するためのクエリとして質問文を使用します。このような質問文を理解することは人間にとって自然で簡単ですが、2D-TAN のような主流の瞬間位置特定モデルにとっては困難です。大規模言語モデルの最近の成功、特に複雑な自然言語コンテンツを理解して生成する能力に触発されて、この拡張要約では、大規模言語モデルを使用してモーメントクエリを一連の命令に再定式化し、それらをより使いやすくするという初期の試みを行います。ローカリゼーションモデルに。
The task of moment localization is to localize a temporal moment in an untrimmed video for a given natural language query. Since untrimmed video contains highly redundant contents, the quality of the query is crucial for accurately localizing moments, i.e., the query should provide precise information about the target moment so that the localization model can understand what to look for in the videos. However, the natural language queries in current datasets may not be easy to understand for existing models. For example, the Ego4D dataset uses question sentences as the query to describe relatively complex moments. While being natural and straightforward for humans, understanding such question sentences are challenging for mainstream moment localization models like 2D-TAN. Inspired by the recent success of large language models, especially their ability of understanding and generating complex natural language contents, in this extended abstract, we make early attempts at reformulating the moment queries into a set of instructions using large language models and making them more friendly to the localization models.
updated: Tue Jun 06 2023 05:48:09 GMT+0000 (UTC)
published: Tue Jun 06 2023 05:48:09 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト