この論文では、自律型水中ビークル(AUV)と人間のダイバーの間の非言語的コミュニケーションを可能にするモーションベースのロボットコミュニケーションフレームワークを紹介します。通常の無線周波数、光、または音声ベースのAUV通信とは異なり、ダイバーが会話を観察することで簡単に理解できるAUV-AUV通信用のジェスチャ言語を設計します。 AUVが別のAUVからのジェスチャを視覚的に理解できるようにするために、自己注意メカニズムを活用して、最大限に識別可能な時空間特徴を抽出することにより、各メッセージの認識を学習するディープネットワーク(RRCommNet)を提案します。このネットワークは、さまざまなシミュレーションデータと実際のデータでトレーニングされます。シミュレーションと閉鎖水ロボット試験の両方での実験的評価は、提案されたRRCommNetアーキテクチャが、シミュレーションデータで88〜94%、実際のデータで73〜83%の平均精度でジェスチャベースのメッセージを解読できることを示しています(使用するモデルのバージョンによって異なります)。さらに、人間の参加者とメッセージの書き起こし研究を行うことにより、提案された言語が人間によって理解され、全体的な書き起こしの精度が88%であることも示しています。最後に、フィールドでボードAUVでリアルタイムに使用するための、組み込みGPUハードウェアでのRRCommNetの推論ランタイムについて説明します。
In this paper, we present a motion-based robotic communication framework that enables non-verbal communication among autonomous underwater vehicles (AUVs) and human divers. We design a gestural language for AUV-to-AUV communication which can be easily understood by divers observing the conversation unlike typical radio frequency, light, or audio based AUV communication. To allow AUVs to visually understand a gesture from another AUV, we propose a deep network (RRCommNet) which exploits a self-attention mechanism to learn to recognize each message by extracting maximally discriminative spatio-temporal features. We train this network on diverse simulated and real-world data. Our experimental evaluations, both in simulation and in closed-water robot trials, demonstrate that the proposed RRCommNet architecture is able to decipher gesture-based messages with an average accuracy of 88-94% on simulated data, 73-83% on real data (depending on the version of the model used). Further, by performing a message transcription study with human participants, we also show that the proposed language can be understood by humans, with an overall transcription accuracy of 88%. Finally, we discuss the inference runtime of RRCommNet on embedded GPU hardware, for real-time use on board AUVs in the field.