arXiv reaDer
デジタルホログラフィ用の畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)
Convolutional Neural Network (CNN) vs Vision Transformer (ViT) for Digital Holography
デジタルホログラフィ(DH)では、振幅と位相を再構築するために、ホログラムから物体距離を抽出することが重要です。このステップはオートフォーカスと呼ばれ、従来は、最初に画像のスタックを再構成し、次にエントロピーや分散などのフォーカスメトリックを使用して再構成された各画像をシャープにすることで解決されます。最も鮮明な画像に対応する距離が焦点位置と見なされます。このアプローチは効果的ですが、計算量が多く、時間がかかります。この論文では、距離の決定はディープラーニング(DL)によって実行されます。 2つのディープラーニング(DL)アーキテクチャが比較されます:畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)。 ViTとCNNは、分類問題としてのオートフォーカスの問題に対処するために使用されます。 2つの連続するクラス間の距離が100μmであった最初の試み[11]と比較して、私たちの提案では、この距離を1μmに大幅に減らすことができます。さらに、ViTは同様の精度に達し、CNNよりも堅牢です。
In Digital Holography (DH), it is crucial to extract the object distance from a hologram in order to reconstruct its amplitude and phase. This step is called auto-focusing and it is conventionally solved by first reconstructing a stack of images and then by sharpening each reconstructed image using a focus metric such as entropy or variance. The distance corresponding to the sharpest image is considered the focal position. This approach, while effective, is computationally demanding and time-consuming. In this paper, the determination of the distance is performed by Deep Learning (DL). Two deep learning (DL) architectures are compared: Convolutional Neural Network (CNN) and Vision Transformer (ViT). ViT and CNN are used to cope with the problem of auto-focusing as a classification problem. Compared to a first attempt [11] in which the distance between two consecutive classes was 100μm, our proposal allows us to drastically reduce this distance to 1μm. Moreover, ViT reaches similar accuracy and is more robust than CNN.
updated: Mon Nov 01 2021 16:05:52 GMT+0000 (UTC)
published: Fri Aug 20 2021 12:37:51 GMT+0000 (UTC)
参考文献 (このサイトで利用可能なもの) / References (only if available on this site)
被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)
Amazon.co.jpアソシエイト