arXiv reaDer
テキストプロンプト学習による合成画像検索の双方向トレーニング
Bi-directional Training for Composed Image Retrieval via Text Prompt Learning
合成画像検索は、参照画像と目的の変更を説明する変更テキストで構成されるマルチモーダル ユーザー クエリに基づいて、ターゲット画像を検索します。この困難なタスクを解決するための既存のアプローチは、(参照画像、変更テキスト) ペアから画像埋め込みへのマッピングを学習し、それを大規模な画像コーパスと照合します。まだ調査されていない領域の 1 つは逆方向です。これは、テキストで説明されているように変更されたときに、どの参照画像が特定のターゲット画像を生成するかという質問をします。この作業では、このような逆クエリを活用し、既存の合成画像検索アーキテクチャに適用できる双方向トレーニング スキームを提案します。双方向クエリをエンコードするには、クエリの方向を指定する変更テキストに学習可能なトークンを追加し、テキスト埋め込みモジュールのパラメーターを微調整します。ネットワーク アーキテクチャにその他の変更を加えることはありません。 2 つの標準的なデータセットでの実験は、私たちの新しいアプローチが、それ自体が既に最先端のパフォーマンスを達成しているベースラインの BLIP ベースのモデルよりも改善されたパフォーマンスを達成することを示しています。
Composed image retrieval searches for a target image based on a multi-modal user query comprised of a reference image and modification text describing the desired changes. Existing approaches to solving this challenging task learn a mapping from the (reference image, modification text)-pair to an image embedding that is then matched against a large image corpus. One area that has not yet been explored is the reverse direction, which asks the question, what reference image when modified as describe by the text would produce the given target image? In this work we propose a bi-directional training scheme that leverages such reversed queries and can be applied to existing composed image retrieval architectures. To encode the bi-directional query we prepend a learnable token to the modification text that designates the direction of the query and then finetune the parameters of the text embedding module. We make no other changes to the network architecture. Experiments on two standard datasets show that our novel approach achieves improved performance over a baseline BLIP-based model that itself already achieves state-of-the-art performance.
updated: Wed Mar 29 2023 11:37:41 GMT+0000 (UTC)
published: Wed Mar 29 2023 11:37:41 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト