Automatic Identification and Data Extraction from 2-Dimensional Plots in Digital Documents
 ほとんどの検索エンジンは、デジタルライブラリのドキュメントのテキストコンテンツにインデックスを付けます。ただし、学術論文では、視覚的なインパクトについて図で重要な発見を頻繁に報告しており、これらの図の内容は索引付けされていません。これらのコンテンツは、自分の研究と直接比較するために、多くの場合、さまざまな分野の研究者にとって非常に貴重です。したがって、図の検索と図データの抽出は重要な問題です。私たちの知る限り、デジタル文書の図からデータを自動的に抽出するツールはありません。これらの画像からデータを自動的に抽出してデータベースに保存できる場合、エンドユーザーは複数のデジタルドキュメントのデータを同時に効率的に照会および結合できます。 2次元プロット画像から情報を抽出し、データベースに保存するために、画像解析と機械学習に基づくフレームワークを提案します。提案されたアルゴリズムは、2次元プロットを識別し、2次元プロットから軸ラベル、凡例、およびデータポイントを抽出します。また、異なるデータポイントに対応する重なり合う形状を分離します。生成された画像と実際の画像の組み合わせを使用して、個々のアルゴリズムのパフォーマンスを実証します。
Most search engines index the textual content of documents in digital libraries. However, scholarly articles frequently report important findings in figures for visual impact and the contents of these figures are not indexed. These contents are often invaluable to the researcher in various fields, for the purposes of direct comparison with their own work. Therefore, searching for figures and extracting figure data are important problems. To the best of our knowledge, there exists no tool to automatically extract data from figures in digital documents. If we can extract data from these images automatically and store them in a database, an end-user can query and combine data from multiple digital documents simultaneously and efficiently. We propose a framework based on image analysis and machine learning to extract information from 2-D plot images and store them in a database. The proposed algorithm identifies a 2-D plot and extracts the axis labels, legend and the data points from the 2-D plot. We also segregate overlapping shapes that correspond to different data points. We demonstrate performance of individual algorithms, using a combination of generated and real-life images.
updated: Wed Sep 10 2008 14:43:37 GMT+0000 (UTC)
published: Wed Sep 10 2008 14:43:37 GMT+0000 (UTC)
