arXiv reaDer
Text2Pos:テキストからポイントクラウドへのクロスモーダルローカリゼーション
Text2Pos: Text-to-Point-Cloud Cross-Modal Localization
モバイルデバイスや家電製品との自然言語ベースの通信はますます普及しており、将来的にはモバイルロボットとの通信に自然になる可能性があります。この目標に向けて、たとえば、車両の集荷場所や商品の配達場所を指定できる、クロスモーダルなテキストからポイントクラウドへのローカリゼーションを調査します。特に、Text2Posを提案します。これは、テキストの説明をローカリゼーションの手がかりに粗くから細かく調整することを学習するクロスモーダルローカリゼーションモジュールです。環境の点群が与えられると、Text2Posは、自然言語ベースの周囲の記述を介して指定された位置を特定します。 Text2Posをトレーニングし、そのパフォーマンスを調査するために、最近導入されたKITTI360データセットに基づいて、このタスクの最初のデータセットであるKITTI360Poseを構築します。私たちの実験では、15mの距離内にあるテキストクエリの65%を、検索された上位10の場所のクエリの場所にローカライズできることが示されています。これは、言語ベースのナビゲーションに向けた将来の発展のきっかけとなることを願っている出発点です。
Natural language-based communication with mobile devices and home appliances is becoming increasingly popular and has the potential to become natural for communicating with mobile robots in the future. Towards this goal, we investigate cross-modal text-to-point-cloud localization that will allow us to specify, for example, a vehicle pick-up or goods delivery location. In particular, we propose Text2Pos, a cross-modal localization module that learns to align textual descriptions with localization cues in a coarse- to-fine manner. Given a point cloud of the environment, Text2Pos locates a position that is specified via a natural language-based description of the immediate surroundings. To train Text2Pos and study its performance, we construct KITTI360Pose, the first dataset for this task based on the recently introduced KITTI360 dataset. Our experiments show that we can localize 65% of textual queries within 15m distance to query locations for top-10 retrieved locations. This is a starting point that we hope will spark future developments towards language-based navigation.
updated: Mon Mar 28 2022 22:06:00 GMT+0000 (UTC)
published: Mon Mar 28 2022 22:06:00 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト