arXiv reaDer
クラスおよびレイヤーごとのVAEを介した多様化するセマンティック画像の合成と編集
Diversifying Semantic Image Synthesis and Editing via Class- and Layer-wise VAEs
セマンティック画像合成は、単一のセマンティックマスクからフォトリアリスティックな画像を生成するプロセスです。マルチモーダル画像合成の多様性を豊かにするために、以前の方法は、単一の潜在空間を学習することによって出力画像の全体的な外観を制御していました。ただし、オブジェクトの外観は複数の要因に依存するため、単一の潜在コードではさまざまなオブジェクトスタイルをキャプチャするには不十分なことがよくあります。オブジェクトスタイルを決定する個々の要因を処理するために、複数の潜在空間を学習することにより、ローカルレベルからグローバルレベルで各オブジェクトクラスを柔軟に制御できる、変分オートエンコーダ(VAE)フレームワークのクラスおよびレイヤーごとの拡張を提案します。さらに、3つの異なるドメインの実際のデータセットと合成データセットを使用した広範な実験を通じて、私たちの方法が最先端の方法と比較してもっともらしく、より多様な画像を生成することを示します。また、私たちの方法が画像合成および編集タスクで幅広いアプリケーションを可能にすることを示します。
Semantic image synthesis is a process for generating photorealistic images from a single semantic mask. To enrich the diversity of multimodal image synthesis, previous methods have controlled the global appearance of an output image by learning a single latent space. However, a single latent code is often insufficient for capturing various object styles because object appearance depends on multiple factors. To handle individual factors that determine object styles, we propose a class- and layer-wise extension to the variational autoencoder (VAE) framework that allows flexible control over each object class at the local to global levels by learning multiple latent spaces. Furthermore, we demonstrate that our method generates images that are both plausible and more diverse compared to state-of-the-art methods via extensive experiments with real and synthetic datasets inthree different domains. We also show that our method enables a wide range of applications in image synthesis and editing tasks.
updated: Tue Jun 29 2021 06:56:09 GMT+0000 (UTC)
published: Fri Jun 25 2021 04:12:05 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト