Inception-inspired LSTM for Next-frame Video Prediction
 ビデオフレーム予測の問題は、自律型車両やロボットなどの多くのコンピュータービジョンアプリケーションとの関連性が高いため、大きな関心を集めています。ビデオフレーム予測のための教師あり手法は、常に利用できるとは限らないラベル付きデータに依存しています。このホワイトペーパーでは、ビデオフレーム予測用のInception-based LSTMと呼ばれる新しい教師なしディープラーニング手法を提供します。開始ネットワークの一般的な考え方は、より深いネットワークではなく、より広いネットワークを実装することです。このネットワーク設計は、画像分類のパフォーマンスを向上させることが示されています。提案された方法は、Inception-v1構造とInception-v2構造の両方で評価されます。提案されたInception LSTMメソッドは、KITTIおよびKTHデータセットの両方にPredNet予測コーディングフレームワークを使用して適用されるときに、畳み込みLSTMと比較されます。 InceptionベースのLSTMは、畳み込みLSTMよりも優れていることがわかりました。また、Inception LSTMはInception v2 LSTMと比較して予測パフォーマンスが優れています。ただし、Inception v2 LSTMは、Inception LSTMと比較して計算コストが低くなります。
The problem of video frame prediction has received much interest due to its relevance to many computer vision applications such as autonomous vehicles or robotics. Supervised methods for video frame prediction rely on labeled data, which may not always be available. In this paper, we provide a novel unsupervised deep-learning method called Inception-based LSTM for video frame prediction. The general idea of inception networks is to implement wider networks instead of deeper networks. This network design was shown to improve the performance of image classification. The proposed method is evaluated on both Inception-v1 and Inception-v2 structures. The proposed Inception LSTM methods are compared with convolutional LSTM when applied using PredNet predictive coding framework for both the KITTI and KTH data sets. We observed that the Inception based LSTM outperforms the convolutional LSTM. Also, Inception LSTM has better prediction performance compared to Inception v2 LSTM. However, Inception v2 LSTM has a lower computational cost compared to Inception LSTM.
updated: Fri Apr 24 2020 17:06:36 GMT+0000 (UTC)
published: Wed Aug 28 2019 03:49:07 GMT+0000 (UTC)
