StyleVideoGAN: A Temporal Generative Model using a Pretrained StyleGAN
生成的敵対的モデル(GAN)は、静止画像の視覚的品質と時間的相関の学習の面で進歩を生み出し続けています。ただし、ビデオコンテンツの合成のために、これら2つの興味深い機能を組み合わせることができる作品はほとんどありません。ほとんどの方法では、出力フレームの解像度と視覚的品質にかなり制限がありますが、時間的相関を学習するために広範なトレーニングデータセットが必要です。この論文では、ビデオ合成問題への新しいアプローチを提示します。これは、視覚品質を大幅に改善し、ビデオコンテンツの生成に必要なトレーニングデータとリソースの量を大幅に削減するのに役立ちます。私たちの定式化は、個々のフレームが合成される空間ドメインを、モーションが生成される時間ドメインから分離します。空間ドメインでは、事前にトレーニングされたStyleGANネットワークを利用します。このネットワークの潜在空間により、トレーニング対象のオブジェクトの外観を制御できます。このモデルの表現力により、StyleGAN潜在空間にトレーニングビデオを埋め込むことができます。次に、時間アーキテクチャは、RGBフレームのシーケンスではなく、StyleGAN潜在コードのシーケンスでトレーニングされます。 StyleGAN空間の有利な特性により、時間的相関の発見が簡単になります。 1人の被験者のわずか10分の映像で約6時間、時間的アーキテクチャをトレーニングするだけで十分であることを示します。トレーニング後、モデルはトレーニング対象の新しいポートレートビデオを生成できるだけでなく、StyleGANスペースに埋め込むことができる任意のランダムな対象に対しても生成できます。
Generative adversarial models (GANs) continue to produce advances in terms of the visual quality of still images, as well as the learning of temporal correlations. However, few works manage to combine these two interesting capabilities for the synthesis of video content: Most methods require an extensive training dataset in order to learn temporal correlations, while being rather limited in the resolution and visual quality of their output frames. In this paper, we present a novel approach to the video synthesis problem that helps to greatly improve visual quality and drastically reduce the amount of training data and resources necessary for generating video content. Our formulation separates the spatial domain, in which individual frames are synthesized, from the temporal domain, in which motion is generated. For the spatial domain we make use of a pre-trained StyleGAN network, the latent space of which allows control over the appearance of the objects it was trained for. The expressive power of this model allows us to embed our training videos in the StyleGAN latent space. Our temporal architecture is then trained not on sequences of RGB frames, but on sequences of StyleGAN latent codes. The advantageous properties of the StyleGAN space simplify the discovery of temporal correlations. We demonstrate that it suffices to train our temporal architecture on only 10 minutes of footage of 1 subject for about 6 hours. After training, our model can not only generate new portrait videos for the training subject, but also for any random subject which can be embedded in the StyleGAN space.
updated: Thu Jul 15 2021 09:58:15 GMT+0000 (UTC)
published: Thu Jul 15 2021 09:58:15 GMT+0000 (UTC)
