MT-TransUNet: Mediating Multi-Task Tokens in Transformers for Skin Lesion Segmentation and Classification

Jingye Chen; Jieneng Chen; Zongwei Zhou; Bin Li; Alan Yuille; Yongyi Lu

MT-TransUNet：皮膚病変のセグメンテーションと分類のためのトランスフォーマーでのマルチタスクトークンの仲介

自動皮膚がん診断の最近の進歩により、理事会認定の皮膚科医と同等のパフォーマンスが得られています。ただし、これらのアプローチは、単純な分類タスクとして皮膚がんの診断を定式化し、病変のセグメンテーションからの潜在的な利点を却下します。正確な病変セグメンテーションは、非対称性、境界、強度、物理的サイズなどの追加の病変情報で分類タスクを補足できると主張します。次に、忠実な病変分類は、識別可能な病変の特徴を備えたセグメンテーションタスクをサポートできます。この目的のために、この論文では、トランスフォーマーでマルチタスクトークンを仲介することにより、皮膚病変を共同でセグメント化および分類できるMT-TransUNetという名前の新しいマルチタスクフレームワークを提案します。さらに、ピクセルレベルの注釈なしでこれらの画像を利用するために、デュアルタスクと出席領域の一貫性の損失を導入し、拡張を考慮して同じ画像に遭遇したときのモデルの堅牢性を確保します。私たちのMT-TransUNetは、ISIC-2017およびPH2の病変のセグメンテーションおよび分類タスクに関して、これまでの最先端技術を上回っています。さらに重要なことに、モデルパラメータ（48M〜vs。〜130M）と推論速度（画像あたり0.17s〜vs。〜2.02s）に関する説得力のある計算効率を維持します。コードはhttps://github.com/JingyeChen/MT-TransUNetで入手できます。

Recent advances in automated skin cancer diagnosis have yielded performance on par with board-certified dermatologists. However, these approaches formulated skin cancer diagnosis as a simple classification task, dismissing the potential benefit from lesion segmentation. We argue that an accurate lesion segmentation can supplement the classification task with additive lesion information, such as asymmetry, border, intensity, and physical size; in turn, a faithful lesion classification can support the segmentation task with discriminant lesion features. To this end, this paper proposes a new multi-task framework, named MT-TransUNet, which is capable of segmenting and classifying skin lesions collaboratively by mediating multi-task tokens in Transformers. Furthermore, we have introduced dual-task and attended region consistency losses to take advantage of those images without pixel-level annotation, ensuring the model's robustness when it encounters the same image with an account of augmentation. Our MT-TransUNet exceeds the previous state of the art for lesion segmentation and classification tasks in ISIC-2017 and PH2; more importantly, it preserves compelling computational efficiency regarding model parameters (48M~vs.~130M) and inference speed (0.17s~vs.~2.02s per image). Code will be available at https://github.com/JingyeChen/MT-TransUNet.

updated: Fri Dec 03 2021 07:51:13 GMT+0000 (UTC)

published: Fri Dec 03 2021 07:51:13 GMT+0000 (UTC)

arXiv

参考文献 (このサイトで利用可能なもの) / References (only if available on this site)

被参照文献 (このサイトで利用可能なものを新しい順に) / Citations (only if available on this site, in order of most recent)

Amazon.co.jpアソシエイト