Look and Modify: Modification Networks for Image Captioning
 注意ベースのニューラルエンコーダ/デコーダフレームワークは、画像キャプションに広く使用されています。これらのフレームワークの多くは、画像機能またはオブジェクト検出地域機能のみに依存することで、キャプションをゼロから生成することに全焦点を置いています。このホワイトペーパーでは、残余情報をモデル化することにより、特定のフレームワークから既存のキャプションを変更することを学習する新しいフレームワークを紹介します。 「予測対象」ではなく「変更対象」。いくつかの画像キャプションフレームワーク上で訓練されたCOCOデータセットでメソッドを評価し、モデルがキャプションを正常に変更し、より良い評価スコアを持つより良いキャプションを生成することを示します。
Attention-based neural encoder-decoder frameworks have been widely used for image captioning. Many of these frameworks deploy their full focus on generating the caption from scratch by relying solely on the image features or the object detection regional features. In this paper, we introduce a novel framework that learns to modify existing captions from a given framework by modeling the residual information, where at each timestep the model learns what to keep, remove or add to the existing caption allowing the model to fully focus on "what to modify" rather than on "what to predict". We evaluate our method on the COCO dataset, trained on top of several image captioning frameworks and show that our model successfully modifies captions yielding better ones with better evaluation scores.
updated: Mon Mar 09 2020 06:20:49 GMT+0000 (UTC)
published: Sat Sep 07 2019 02:15:24 GMT+0000 (UTC)
