arXiv reaDer
テキストから画像への拡散モデルによる人間とオブジェクトのインタラクション検出の強化
Boosting Human-Object Interaction Detection with Text-to-Image Diffusion Model
この論文では、現在の HOI 検出方法の問題を調査し、事前トレーニングされたテキスト画像拡散モデルに基づいた新しい HOI 検出スキームである DiffHOI を紹介します。これは、データの多様性と HOI 表現の改善によって検出器のパフォーマンスを向上させます。我々は、凍結されたテキストから画像への拡散モデルの内部表現空間が、動詞の概念とそれに対応する文脈に高度に関連していることを実証します。したがって、我々は、凍結拡散モデルとCLIPモデルからさまざまな意味論的関連表現を抽出し、事前学習された検出器からの人間とオブジェクトの表現を強化し、インタラクション予測の曖昧さをさらに低減するアダプタースタイルの調整方法を提案します。さらに、HOI データセットのギャップを埋めるために、完全なトリプレット アノテーションを備えた 140,000 を超える HOI 画像を含むクラスバランス、大規模、高多様性の合成データセットである SynHOI を提案します。これは、多様で高精度の HOI アノテーション付きデータの生成をスケールアップするように設計された、自動でスケーラブルなパイプラインを使用して構築されています。 SynHOI は、既存のデータセットにおけるロングテールの問題を効果的に軽減し、相互作用表現の学習を容易にすることができます。広範な実験により、DiffHOI は通常の検出 (つまり 41.50 mAP) およびゼロショット検出において最先端技術を大幅に上回っていることが実証されています。さらに、SynHOI は、モデルに依存しない、バックボーンに依存しない HOI 検出のパフォーマンスを向上させることができ、特にレアクラスで 11.55% の顕著な mAP 改善を示します。
This paper investigates the problem of the current HOI detection methods and introduces DiffHOI, a novel HOI detection scheme grounded on a pre-trained text-image diffusion model, which enhances the detector's performance via improved data diversity and HOI representation. We demonstrate that the internal representation space of a frozen text-to-image diffusion model is highly relevant to verb concepts and their corresponding context. Accordingly, we propose an adapter-style tuning method to extract the various semantic associated representation from a frozen diffusion model and CLIP model to enhance the human and object representations from the pre-trained detector, further reducing the ambiguity in interaction prediction. Moreover, to fill in the gaps of HOI datasets, we propose SynHOI, a class-balance, large-scale, and high-diversity synthetic dataset containing over 140K HOI images with fully triplet annotations. It is built using an automatic and scalable pipeline designed to scale up the generation of diverse and high-precision HOI-annotated data. SynHOI could effectively relieve the long-tail issue in existing datasets and facilitate learning interaction representations. Extensive experiments demonstrate that DiffHOI significantly outperforms the state-of-the-art in regular detection (i.e., 41.50 mAP) and zero-shot detection. Furthermore, SynHOI can improve the performance of model-agnostic and backbone-agnostic HOI detection, particularly exhibiting an outstanding 11.55% mAP improvement in rare classes.
updated: Sat May 20 2023 17:59:23 GMT+0000 (UTC)
published: Sat May 20 2023 17:59:23 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト