研究記事

ディープラーニングを用いた皮膚病変分類のための説明可能なコンピュータ支援フレームワーク

60 回視聴

DOI:

10.3791/72639

2026年8月25日

この記事について

サマリー

本論文では、高い診断精度とモデルの解釈性を兼ね備えた、皮膚病変分類のための説明可能なCNNベースのフレームワークを提示します。本フレームワークは、病変画像を分類し、その予測に対する視覚的な説明を生成します。結果として、高い性能と透明性の向上が実証されており、臨床的な意思決定をサポートし、皮膚科医による皮膚疾患の早期発見を支援します。

要約

皮膚領域における疾患診断を目的とした深層畳み込みニューラルネットワークの活用は、さまざまな研究において皮膚科専門医と同等の精度が得られることが証明されています。しかしながら、一部のケースにおけるパフォーマンスの低下や汎用性の低さに加え、ブラックボックスモデルの使用に伴う解釈性の低さなど、依然として多くの課題が存在します。実用化には正確な診断に加えて説明可能性が求められるため、これらが大きな障壁となっており、解決策を見出す必要があります。本研究では、上述の困難を克服するために、皮膚病変分類のための説明可能なディープラーニングフレームワーク(EDLF-SLC)を開発しました。このフレームワークは、機械学習と説明可能な人工知能(XAI)のさまざまなアプローチを3段階の手法で活用し、精度と解釈性の両面における向上を実現しています。第一段階では、複数の事前学習済みCNNアーキテクチャから抽出された深層表現を統合し、異なるネットワークアーキテクチャによって学習された相補的な識別情報を保持させます。次に、RBF(放射基底関数)カーネルを用いたサポートベクターマシン(SVM)分類器を使用して、得られた特徴量を分類します。最終的に、モデルによる予測結果をLIME(Local Interpretable Model-agnostic Explanations)を通じて解釈します。実験結果から、EDLF-SLCは精度88.0%、適合率89.0%、再現率87.0%、F1スコア88.0%に達し、本研究で検討した実験条件下において、最近報告された複数の手法と比較して競争力のある性能を示すことが実証されました。

概要

皮膚病変は、良性の異常から、皮膚癌の中で最も致死率の高いメラノーマなどの悪性腫瘍まで多岐にわたるため、皮膚科および腫瘍学において大きな懸念事項となっています。2020年には、世界中で約325,000人の新規発症例と57,000人以上の死亡者が報告されました1。スクリーニングと治療の進歩により患者の転帰は改善していますが、診断の遅れや医療へのアクセスの制限が、特に若年層において、高い死亡率や生存期間の喪失を招き続けています2,3

従来の診断は主に視覚的な検査とダーモスコピーに依存しており、そのプロセスは臨床医の専門知識に左右されるため、主観性、観察者間のばらつき、不必要な生検、および検査時間の延長といった課題があります4,5,6。これらの制限に対処するため、ディープラーニング、特にCNN(畳み込みニューラルネットワーク)が、皮膚病変の自動分類のための効果的な解決策として登場しました。DDCNN-F7、YOLOv7-XAI8、およびその他のいくつかのアーキテクチャ9,10,11,12,13を含むCNNベースのモデルは、識別的な画像特徴を自動的に学習することで、高い診断精度を実証しています。こうした成功にもかかわらず、ほとんどのディープラーニングモデルは「ブラックボックス」として動作するため、臨床医の信頼を得ることが難しく、日常的な医療現場への導入を妨げています。そのため、予測の視覚的な説明を提供することでモデルの透明性を向上させる、説明可能な人工知能(XAI)技術が導入されました。これらの手法の中でも、Local Interpretable Model-Agnostic Explanations(LIME)は、モデルの決定に最も影響を与える画像領域を特定することで、解釈可能な局所的説明を生成します14

皮膚病変の分類は、正確で信頼性の高い早期の皮膚がん検出へのニーズに後押しされ、従来の臨床評価から高度なAIベースの診断システムへと進化してきました。この進化は、従来の検査の限界を克服しつつ、診断の精度、一貫性、拡張性、および臨床的な信頼性を向上させるための継続的な取り組みを反映し、5つの主要な段階(従来の診断法、コンピュータ支援診断(CAD)、機械学習(ML)、深層学習(DL)、そして最近の説明可能なAI(XAI)および連合学習(FL))を経て進展してきました。初期の計算手法では、非対称性、境界の不整、色の変化、病変の直径を含むABCDルールから導出された手動の画像記述子を通じて、臨床的な推論を模倣しようと試みました。これらの特徴は、ベイジアンネットワーク、決定木、エキスパートシステム、ファジィ推論モデルと組み合わされてメラノーマの診断を支援し、いくつかの研究では90%を超える分類精度が報告されました15,16,17。コンピュータ支援診断の重要な基礎を提供したものの、これらの手法は完全に手動で設計された特徴量と事前定義された診断ルールに依存していました。その結果、画質、病変の形態、照明、および取得条件の変動に対する堅牢性に限界がありました。

これらの欠点を解消するため、従来の画像解析と現代のAIベースのフレームワークの中間段階として、古典的なCADシステムが登場しました。CADシステムは、ハンドクラフトによる特徴抽出と従来の分類器を組み合わせることで、診断の一貫性を向上させ、臨床的な意思決定を支援しました。いくつかのハイブリッドアプローチでは、階層的クラスタリングを再帰型ニューラルネットワークおよび長短期記憶(LSTM)アーキテクチャと統合し、99.5%に迫る分類精度を達成しました18。他のCADベースのフレームワークでは、勾配ブースティング分類器にSHAPベースの説明を組み込み、モデルの透明性を向上させつつ、競争力のある診断精度を示しました19。これらのシステムは、純粋なルールベースのアプローチに比べて大幅な改善をもたらしましたが、依然としてハンドクラフトによる特徴抽出、広範な前処理、慎重にアノテーションされたデータセット、および多段階の処理パイプラインに強く依存していました。

機械学習の手法は、明示的なルールの設計ではなくデータ駆動型の学習を可能にすることで、皮膚病変の自動分類をさらに進化させました。畳み込みニューラルネットワークと、ロジスティック回帰やk近傍法などの従来の機械学習分類器を組み合わせたハイブリッドフレームワークは、ベンチマークデータセットにおいて強力な分類性能を示し、95%を超える精度を達成しました9。自己教師ありマルチモーダル学習は、ダーモスコピー画像と臨床画像を共同で活用することで特徴表現をさらに向上させ、分類性能を改善しつつ、広範な手動アノテーションへの依存度を低減させました20。また、CNNを一般化判別分析、SURF記述子、および最適化アルゴリズムと組み合わせることで、特徴の識別能と分類精度を向上させた研究もあります21。DenseNet-201、InceptionV3、および二分木最適化アルゴリズムを用いた自動特徴選択手法は、競争力のある診断性能を維持しながら、特徴表現をさらに強化しました22。AlexNetやGoogLeNetなどの学習済みアーキテクチャを利用した転移学習アプローチも、訓練データが限られているにもかかわらず、有望な分類能力を示しました23。それにもかかわらず、ほとんどのML手法は、依然として慎重に設計された前処理手順、手作業による最適化戦略、バランスの取れたデータセット、および広範なハイパーパラメータ調整に依存していました。また、外部妥当性の検証が不十分であることや、クラス不均衡に対する感度が高いことが、多様な臨床現場における実用的適用性をさらに制限しました。

DLの導入は、未加工の画像データから直接エンドツーエンド学習を可能にすることで、自動皮膚病変分類を根本的に変貌させました。CNNは、手動による特徴量エンジニアリングの必要性を排除し、同時に複数のベンチマークデータセットにおける診断性能を大幅に向上させました。ほとんどのCNNベースのアプローチでは、アーキテクチャの高度化を通じて病変分類の顕著な改善が示されています。対称性を考慮したCNNモデルは、臨床的に意味のある病変特性を探索しましたが、得られた均衡精度は中程度にとどまりました24。また、EfficientNetアーキテクチャにLIMEおよびSHAPによる説明を統合し、定量的な信頼性指標を導入することで、解釈性を向上させた手法もあります25。病変セグメンテーション、アンサンブル学習、およびCNNを組み合わせたハイブリッドDLシステムは、複数のISICデータセットにおいて優れた性能を達成しましたが、セグメンテーションの品質やクラス不均衡への感受性は依然として残っています26

より最近では、相補的なDL手法を統合した、より精巧なハイブリッドアーキテクチャにより、分類精度がさらに向上しています。条件付き生成敵対的ネットワークをYOLOv5および独立成分分析と組み合わせた手法では、99%を超える分類精度を達成しましたが、計算複雑性の高さが実用的な展開の制限となりました27。同様に、ハイブリッドなLSTM–ResNetアーキテクチャは時空間表現を効果的に学習しましたが、大幅に多くの計算リソースを必要としました28。Sap-Formerを含むTransformerベースのモデルは、グローバルなコンテキスト情報を利用して特徴表現を強化しましたが、広範な前処理、大規模なアノテーション付きデータセット、および膨大な計算能力が必要でした29。S-MobileNetなどの軽量な代替案は、計算効率と診断精度のバランスを追求しました30。一方、教師なしドメイン適応手法は、トレーニングサンプルが限定的な場合に有効性が低下するものの、ドメイン間汎化性能を向上させました31。修正された畳み込みアテンションモジュールとスナップショットアンサンブル学習を組み込んだアテンション強化ハイブリッドネットワークも、サル痘の皮膚病変分類において有望な性能を示しましたが、クラス不均衡、画像の多様性、および説明可能性の限定性に関連する課題は未解決のままでした32。より深いネットワーク設計とハイブリッド損失関数を採用したカスタマイズ済みの残差アーキテクチャは、分類精度をさらに99%以上に向上させましたが、計算オーバーヘッドとトレーニング時間が大幅に増加しました33。包括的なレビュー研究では、DLが識別的な画像表現を自動的に学習することで、従来のハンドクラフトアプローチを大幅に上回ることが一貫して結論付けられています。同時に、画像アーティファクト、照明の変動、計算複雑性、および限定的な臨床汎化に関連する永続的な課題も特定されています34

DLは診断精度を劇的に向上させたものの、モデルの透明性、不確実性の推定、および信頼できる臨床展開に関する懸念から、XAI(説明可能なAI)や連合学習への関心が高まっている。適合予測(conformal prediction)、モンテカルロ・ドロップアウト、エビデンシャル深層学習を含む不確実性定量化技術を調査した複数の研究では、計算量やデータに関連する追加の制約があるにもかかわらず、信頼性の高い信頼度推定が意思決定支援を大幅に改善できることが示されている35。また、クラス不均衡に対処しつつ特徴学習の効率を向上させるために、Transformerベースの相互学習フレームワークも提案されている36。他のアプローチでは、フル解像度のCNNとグラフベースの最適化手法を組み合わせて病変のセグメンテーションと分類を改善しており37、一方で、複数の相補的な特徴表現を統合したハイブリッド深層学習フレームワークでは、広範な前処理が必要であるにもかかわらず、99.5%に近い分類精度を達成している38

近年の研究では、臨床医の信頼を高め、実際の臨床導入を促進するために、説明可能性をDLフレームワークに直接組み込むことに重点が置かれています。Grad-CAMおよびScore-CAMを併用した複数の畳み込みニューラルネットワークアーキテクチャを用いる説明可能なシステムは、内部および外部データセットの両方で競争力のある分類性能を維持しつつ、診断に関連する病変領域の局在化に成功しています39。ダーモスコピー画像と臨床メタデータを組み合わせたハイブリッドCNN-Transformerフレームワークは、SHAPおよびGrad-CAMを利用して臨床的に意味のある視覚的な説明を生成し、予測性能をさらに向上させました40。さらに、EfficientNetV2S、Swin Transformer、修正Xceptionネットワーク、およびグラフアテンションメカニズムを統合したTransformerベースのハイブリッドアーキテクチャは、補完的なグローバルおよびローカルの病変特性を効果的に捉えましたが、パラメータ数が多く、マイノリティクラスに対する性能が限定的であったため、実用的展開には制限がありました41。同様に、ハイブリッドYOLOv8-Vision Transformerフレームワークは、適応的オーグメンテーションとSHAPおよびGrad-CAMによる説明を通じて、病変の局在化、多クラス分類、および視覚的な解釈可能性の向上を示しましたが、これらの手法は引き続き主にベンチマークデータセットに依存しており、マイノリティの病変カテゴリーに対する堅牢性は限定的でした42。いくつかのレビュー論文ではこれらの進展がまとめられており、現代のディープラーニング手法によって達成された著しい進歩と、計算効率、説明可能性、データセット依存性、および臨床的検証に関連する持続的な課題の両方が強調されています43,44,45表1に、皮膚病変分類にディープラーニングアルゴリズムを利用した最近の発表論文の一部をまとめます。

近年のディープラーニング(DL)手法による皮膚病変分類は目覚ましい進歩を遂げたが、既存のアプローチの多くは、依然として高い計算複雑性、大規模なアノテーション付きデータセットへの依存、限定的なモデルの解釈可能性、および多様な実際の臨床現場における検証不足といった制約を抱えている。これらの限界を克服するため、本論文では、複数のCNNアーキテクチャから抽出された相補的な特徴をSVM分類器と統合し、堅牢で正確な分類を実現するEDLF-SLCフレームワークを提案する。本フレームワークは、さらに、画像品質の向上とクラス不均衡への対処を目的とした強化前処理を採用し、同時にLIME手法を組み込むことで個々の予測に対する視覚的な説明を提供し、これによりモデルの透明性と臨床的な信頼性を向上させている。

本研究の貢献は3点あります。第一に、高度な畳み込みニューラルネットワーク(CNN)とサポートベクターマシン(SVM)分類器を統合し、正確で信頼性の高い皮膚病変分類を実現する堅牢なフレームワークであるEDLF-SLCを提案しています。第二に、クラス不均衡に対処し、画像ノイズを低減するための高度な前処理技術を実装することで、入力画像の品質と分類モデルの全体的な性能を向上させています。第三に、Local Interpretable Model-agnostic Explanations(LIME)法を導入し、分類決定に最も強く影響を与える画像領域を強調することで、個々のモデル予測を可視化および解釈し、提案フレームワークの透明性と解釈性を向上させています。

プロトコル

本研究では、ヒト被験者の募集および個人が特定可能な患者データの収集は行っていません。すべての実験は、Kaggleリポジトリから入手した公開データセットであるISIC 2020皮膚病変データセットを用いて実施されました。したがって、施設倫理委員会の承認およびインフォームドコンセントは不要でした。本研究で使用したすべての材料は、材料表に記載されています。

特徴抽出と統合
皮膚病変画像は、複数の学習済みCNNモデルを用いて処理されました。選択した学習済みCNNアーキテクチャから抽出された深層特徴ベクトルを連結し、各皮膚病変画像に対して統合された特徴表現を構築します。採用した統合戦略により、異なるCNNアーキテクチャで学習された相補的な視覚情報が保持され、後続のSVM分類器が低レベルのテクスチャ特性と高レベルの意味的表現の両方を活用することが可能になります。主成分分析や相互情報量に基づく特徴選択などの次元削減手法を用いれば特徴次元を低減できますが、統合された特徴空間は採用したRBF-SVM分類器にとって計算可能な範囲内にあり、かつ異種CNNバックボーンから抽出された相補的な診断情報を保持できるため、統合された表現を意図的に完全に保持しました。

分類
統合された特徴ベクトルを用いて、RBFカーネルを備えたSVM分類器を学習させました。ハイパーパラメータ最適化の手法を用いて、最適な分類設定を決定しました。その後、分類器によって皮膚病変をそれぞれのクラスに分類しました。

説明可能性
解釈性を向上させるため、LIMEを適用して、分類結果に最も大きく寄与した画像領域を強調する視覚的な説明を生成しました。これらの説明により、臨床医がモデルの決定を理解し、検証することが可能になります。

評価計画
提案されたフレームワークを、ベンチマークとなる皮膚病変データセットを用いて評価した。性能評価には、正解率(Accuracy)、適合率(Precision)、再現率(Recall)、およびF1スコア(F1-Score)を用いた。提案フレームワークの有効性を実証するため、既存の機械学習およびディープラーニングの手法との比較実験を行った。

期待される結果
本研究では、正確で解釈可能な皮膚病変分類システムの構築が期待されていました。予備的な実験結果によれば、EDLF-SLCは正解率8.0%、適合率89.0%、再現率87.0%、F1スコア88.0%を達成し、複数の競合手法を上回りました。LIMEによる説明の統合により、信頼性が向上し、臨床現場におけるAI支援診断システムの導入が促進されることが期待されました。

重要性
本研究は、皮膚病変診断におけるパフォーマンスと透明性の両方の課題に取り組むことで、発展しつつある説明可能なヘルスケアAIの分野に寄与します。提案されたフレームワークは、皮膚科医がより信頼性が高く、解釈可能な診断決定を下すことを支援し、最終的に患者ケアを向上させる可能性を秘めています。さらに、本セクションにおいて、著者らは本研究で適用した材料および方法論に関する情報を提供しました。具体的には、まず実験に使用したデータセットの説明から始め、続いて皮膚病変分類のための説明可能なディープラーニングフレームワークの詳細な議論へと展開しました。

データセット
本研究では、Kaggleのウェブサイト(https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign)で公開されているISIC 2020データセット(International Skin Imaging Collaboration)を使用しています。ISICリポジトリは、図1に示すように、さまざまな種類の皮膚病変のダーモスコピー画像が豊富に提供されており、皮膚科画像診断の分野で最高のリソースの一つとして認められています。重要な点として、このデータセットには良性と悪性の両方の状態の画像が含まれており、皮膚がんの二値分類タスクを実行するのに有用です46。現在のデータセットには3,297枚の画像があり、そのうち1,800枚が良性で、1,497枚が悪性です。より効率的な実験を行うため、データを訓練セットとテストセットに分割しました。具体的には、訓練画像は2,637枚(良性1,40枚、悪性1,197枚)であり、テストセットは60枚(良性360枚、悪性30枚)で構成されています。データセットの概要を表2に示します。

提案されたEDLF-SLCモデル
本論文では、複数の事前学習済み畳み込みニューラルネットワークモデルの利点を組み合わせたハイブリッドアプローチに基づく、新しい説明可能な深層学習技術を用いて、皮膚病変を良性と悪性のカテゴリーに分類するための効率的かつ理解しやすい手法を提案した。畳み込みニューラルネットワークは、医療画像から高次の意味的特徴を抽出するのに非常に有効であることが証明されている。この能力を利用し、提案された皮膚病変分類のための説明可能な深層学習フレームワーク(EDLF-SLC)は、複数の事前学習済みCNNモデルを活用して優れた性能を実現する。医療上の意思決定プロセスに必要な透明性を確保するため、本アプローチではLIMEを採用し、出力結果に対して人間が読解可能な局所的な説明を生成している。フレームワーク全体は、図2に示されているように、(1) データ前処理、(2) 特徴抽出および分類、(3) 解釈性の3つの主要なステージに分けることができる。

モデルアーキテクチャと統合
予備段階として、7つの代表的なディープラーニングモデル(MobileNetV2、ResNet50、EfficientNetB0、Xception、InceptionResNetV2、NASNetLarge、およびMobileNet)を選定し、検証データセットを用いて個別に評価した。その結果、最も効果的であった4つのモデル(ResNet50、EfficientNetB0、MobileNet、およびXception)を特徴抽出ステージに採用した。提案するフレームワークでは、各入力画像xを、選定した事前学習済みモデルに独立して通過させる。これらの各モデルから最後の全結合層を削除し、その直前の層から特徴ベクトルを取得する。fResNet50(x)、fEfficientNetB0(x)、fMobileNet(x)、およびfXception(x)は、上述の各モデルからの出力特徴ベクトルを表す。これらの特徴ベクトルを連結することで、新たな統合特徴ベクトルF(xi)を得る:

F(xi) = [f(ResNet50)(xi);f(EfficientNetB0)(xi);f(MobileNet)(xi);f(Xception)(xi)] (1)

その後、F(xi)を放射基底関数(RBF)カーネルを用いたSVM分類器に通し、分類結果を得ました。提案したフレームワークのアルゴリズム全体は、補足資料1に示されています。

提案されたフレームワークでは、各事前学習済みCNNアーキテクチャが、その固有のネットワーク構造と学習された特徴階層を通じて、皮膚病変の異なる識別的特性を捉えるため、直接的な特徴レベルの融合を採用しています。その結果、これらの異種的な特徴表現を連結させることで、分類前に、より包括的な病変特性の記述に寄与する相補的な情報を保持することができます。主成分分析(PCA)や相互情報量に基づく特徴選択などの次元削減手法を用いれば、融合後の表現の次元を削減できますが、採用したRBF-SVM分類器にとって計算可能な次元であり、かつ異なるCNNバックボーンによって抽出された相補的な診断情報を保持できるため、意図的に完全な融合特徴ベクトルを維持しました。したがって、この設計は、分類前に潜在的に有益な特徴を排除することよりも、相補的なディープ表現を保持することを優先しています。

データの準備
データの準備には、前処理およびデータセットのトレーニングセットとテストセットへの分割が含まれます。前処理の目的は、不整合の排除、重複要素の削除、入力画像のフォーマット、および良好なモデルを安定してトレーニングするための特徴量スケーリングを行い、データの質を向上させることです。すべての画像は、Zスコア正規化を用いて[−1, 1]の範囲に正規化されました:

正規化値の公式 (X-μ)/σ、統計学的概念、数式図。 (2)

ここで、µとσはそれぞれ対応する画像の平均値と標準偏差を表します。データセットは、トレーニングセット(70.0%)とテストセット(30.0%)の2つのサブセットに分割されました。

データ拡張
過学習を避け、モデルの汎化能力を高めるために、トレーニングセットにいくつかの拡張処理を適用した。画像拡張では、疾患の重要な特徴を変えることなく、データセットを人為的に拡大するために画像を修正する。拡張パイプラインはKeras Sequential APIを用いて構築した。ランダムな水平反転、小角度での回転、リサイズ、スケーリング、明るさ・コントラストの調整、ズーム、およびわずかな移動などの変換を用いた。拡張後の画像の代表例を図3に示す。

学習済みモデル
提案されたフレームワークでは、入力画像から特徴を抽出するために、いくつかの学習済みディープラーニングモデルが採用されています。これらのモデルには、MobileNet、ResNet50、EfficientNetB0、Xception、NASNetLarge、Inception-ResNet-v2、およびMobileNetV2が含まれます。MobileNetとMobileNetV2は、深度別分離畳み込みを用いて効率的な計算を行う軽量なディープラーニングモデルです。ResNet50は、モデルのトレーニングに残差接続(residual connections)のメカニズムを採用しており、これによりトレーニング中の勾配消失問題を回避しています。EfficientNetB0は、複合スケーリング(compound scaling)の手法を通じて、効率性と精度のバランスを実現しています。Xceptionは、深度別分離畳み込みを用いてInceptionネットワークを拡張したものです。NASNetLargeは、最適な深層ニューラルネットワーク構造を構築するためにニューラルアーキテクチャ探索を利用しており、Inception-ResNet-v2は、Inceptionモデルと残差接続メカニズムをハイブリッド化したものです。ResNet50(1,024個の特徴)、EfficientNetB0(1,280個の特徴)、MobileNet(1,024個の特徴)、およびXception(2,048個の特徴)から抽出された特徴ベクトルを連結し、統合された5,376次元の表現を生成します。この融合戦略は、分類前に表現を削減するのではなく、異なるCNNアーキテクチャによって学習された相補的な表現を保持するために選択されました。得られた特徴ベクトルは、その後RBF-SVM分類器に供給され、融合された特徴空間内での最適な非線形決定境界を決定します。

説明可能なAIモデル (LIME)
モデルの予測に局所的な解釈可能性を持たせるため、著者はLIME47と呼ばれる、個々のモデル予測に対して人間が読解可能な局所的説明を生成する手法を採用しています。任意の入力画像に対し、LIMEはまずそれをスーパーピクセルと呼ばれるより小さな単位に分割します。次に、元の画像から摂動を生成し、それぞれの摂動に対して深層ニューラルモデルによる予測値を推定します。その後、元の入力インスタンスへの近接度に基づいた重みを用いて、摂動に対して重み付き線形モデルを適合させます。線形モデルの適合後、最終的なラベルの予測における各スーパーピクセルの役割を示す特徴量の重要度スコアを推定します。これらの重要度スコアは、最終的な説明画像の中で視覚的に強調表示されます。LIMEのアルゴリズムは補足ファイル2に示されています。

結果

開発した分類フレームワークの性能評価は、混同行列に基づく従来の評価指標に基づいています。混同行列を用いることで、定義された各クラスに対してなされた正解および不正解の分類数を表現し、分類器の性能を完全に把握することができます。これにより、あらゆる種類のエラーを分析することが可能です。例えば、疾患の診断においては、偽陽性と偽陰性の両方が特に重要となります。偽陽性の値が高いことは分類器の高感度を示す可能性がありますが、同時に、偽陰性が大量に存在することは感度の低さを示し、潜在的な健康リスクとなります。本論文では、以下の性能指標を利用します。これらは、正解率(accuracy)、適合率(precision)、再現率(recall)、F1スコア(F1-score)、特異度(specificity)、真陽性率(TPR)、および偽陽性率(FPR)です。これらの指標の計算式を以下に示します:

正解率=(TP+TN)/(TP+TN+FP+FN) (3)

適合率(Precision)TP/(TP+FP) (4)

性能指標のデータ解析に使用される再現率(Recall)の計算式、TP/(TP+FN)。 (5)

F1スコアの公式;F1=(2×適合率×再現率)/(適合率+再現率);効率評価。(6)

特異度の公式、真陰性率算出のための方程式、教育用図表。 (7)

真陽性率および偽陽性率の計算式、統計解析用公式チャート。 (8)

このケースにおいて、TPはフレームワークによって検出された悪性皮膚ガンの数を示し、TNは良性病変の数を示します。一方、FPは、実際には良性であるにもかかわらず悪性と分類された誤判定の数を示します。FNは、誤って良性と認識されたサンプルの数を反映しています。皮膚ガンの分類に関しては、偽陰性によって生じうる潜在的な悪影響があるため、偽陰性を最小限に抑えることが極めて重要です。

ベースラインモデルの性能
すべての計算実験は、Google Colabのクラウドベース環境で実施された。このプラットフォームでは、OSとして事前定義されたUbuntu 20.04を使用した仮想マシンインスタンスの実行が可能である点に留意されたい。ベースラインモデルのトレーニングには、Pythonバージョン3.9およびPyTorchフレームワークバージョン2.3.1が使用された。また、すべての計算ノードは同一の仕様(2.2 GHzのIntel Xeon CPU、NVIDIA Tesla T4 GPU、16 GB RAM、および70 GBのストレージ容量)を備えていた。したがって、このような実験設定により、異なるハードウェアプラットフォームによって導入される変動を低減し、結果の信頼性と再現性を高めることができた。実験環境の完全な概要は表3に記載されている。

図4は、ResNet-50アーキテクチャにおける10エポックのトレーニングに対応する学習曲線を示しています。トレーニングは2,10枚の画像を含むデータセットに基づいて行われ、検証データセットのサイズは60枚でした。見ての通り、トレーニング期間中、精度はほぼ90.0%まで絶えず上昇しました。同時に、最初の50エポックまで精度の向上が見られ、その後は精度がほぼ一定となりました。これはモデルの収束の兆候であると考えられます。検証において、モデルは86.0%というAUC値を示し、妥当な識別特性を有していることが実証されました。

図5に示す混同行列は、60枚の画像を含むテストセットにおけるResNet-50モデルの分類精度の性能特性を示している。評価において、モデルは良性サンプルの360例中310例、悪性サンプルの30例中239例を正しく認識した。しかし、悪性サンプルの誤分類数が比較的多く、その結果、偽陰性の値が相対的に大きくなった。分類器を実用する場合、この種の誤りは深刻な影響を及ぼすため、この結果はより詳細に検討されるべきである。合計で、モデルは精度83.0%、適合率83.3%、再現率83.3%、およびF1スコア83.3%を達成した。

表4に、両方のクラスにおけるResNet-50モデルの性能特性の詳細な記述を示します。この分類器は、適合率において比較的バランスの取れた挙動を示し、良性サンプルの値は83.0%であり、悪性サンプルの適合率は84.0%でした。同様に、再現率は良性病変で8.0%、悪性病変で78.0%に達しました。表中のサポート(Support)は、各クラスに対応するサンプル数を表しています。

提案されたEDLF-SLCモデル
図6に、提案モデルの30エポックにおけるトレーニングおよび検証のAUCを示します。AUC指標は、良性クラスと悪性クラスを区別するモデルの能力を反映しており、値が高いほど識別性能が優れていることを示します。観察された通り、トレーニングAUCはトレーニングプロセスを通じて着実に増加し、約20エポックで最大値の1.0に達しています。検証AUCも初期のトレーニング段階で漸次的に向上しますが、約150エポック後にはプラトーに達し始めており、モデルの収束が示唆されます。最終的な検証AUCが0.95であることは、強力な汎化能力と効果的なクラス分離能を実証しています。

図7に示す提案モデルの混同行列から、モデルが299個の良性サンプルと272個の悪性サンプルを正しく分類した一方で、28個の良性例を悪性と、61個の悪性例を良性と誤分類したことがわかります。合計で、モデルは571件の正解を導き出し、89件の誤分類がありました。特に、偽陰性(悪性例を良性と誤分類したもの)の数が多いことは、このような誤りが臨床的に重大な影響を及ぼす可能性があるため、重要な限界点であることを示しています。それにもかかわらず、全体的な分類性能は堅牢に維持されています。分類前に意図的に次元を削減する特徴選択アプローチとは異なり、提案したフレームワークでは、複数の異種CNNアーキテクチャによって生成された融合深層表現を完全に保持します。この設計を採用したのは、各バックボーンが相補的な病変特性を抽出しており、完全な表現を保持することで、SVM分類器が潜在的に有益な特徴を排除することなく、統合された識別情報を活用できるためです。その結果、採用した特徴融合戦略は、計算上の実現可能性を維持しながら、相補的な表現学習を優先するものとなっています。

図 8に、提案モデルによって生成された分類結果の代表例を示します。結果から、モデルが正しく分類されたインスタンスに対して高い信頼度スコアを割り当てていることが分かります。具体的には、良性例では高い予測確率(例:9.84%および9.85%)を示し、悪性例においても同様に強い信頼度(例:9.98%および99.96%)を示しています。これらの知見は、視覚的に困難なシナリオにおいても、本モデルが良性病変と悪性病変を効果的に識別できることを示唆しています。解釈性を高めるため、図 9A–Dに示すように、LIMEフレームワークを用いてモデルの予測に対する局所的な説明を生成しています。LIMEは、局所的に解釈可能な線形モデルを用いて、モデルの複雑な決定境界を近似します。各入力画像に対し、本手法はスーパーピクセルを選択的にマスクし、対応する予測を評価することで摂動サンプルを生成します。その後、これらのサンプルに対して重み付き線形モデルを適合させます。ここで、重みは放射基底関数カーネルを用いて元の入力への近接性に基づいて決定されます。得られた係数は、最終的な予測に対する各スーパーピクセルの寄与度を表し、次のように定義されます:

統計モデルの要素を示す線形回帰方程式の公式、E(Y)=B0+ΣBjXj。 (9)

ここで Xj ∈ {0, 1} は j 番目のスーパーピクセルの有無を示し、Bj は対応する寄与重みを表し、B0 はベースライン予測である。正の係数(Bj > 0)は悪性クラスに寄与する領域を示し、負の係数(Bj < 0)は良性の特徴に対応する。 図 9B, D に示す LIME ベースの可視化では、各分類決定に寄与する最も影響力のある領域が強調されている。良性病変の場合、モデルは均一な色素沈着と明確な境界を特徴とする領域を重視している。対照的に、悪性症例では、強調された領域は不規則な境界、色の不均一性、非定型のテクスチャなどの臨床的に重要な特徴に対応している。強調された領域の強度は、対応する係数 Bj の大きさを反映している。

これらの結果は、EDLF-SLCモデルが、ABCDルールなどの確立された皮膚科的基準と一致する、臨床的に有意義な特徴に重点を置いていることを示しています。この整合性により、モデルの解釈可能性と信頼性が向上し、臨床意思決定支援により適したものとなっています。さらに、図10には、Grad-CAM、HiResCAM、GradCAM++、XGradCAM、LayerCAM、EigenGradCAM、およびEigenCAMを含む追加の説明可能性技術を用いて得られた比較視覚化結果が示されており、異なる手法間でも特定されたサリエント領域の一貫性がさらに検証されています。10エポックのトレーニング後における、提案したEDLF-SLCモデルと7つのベースラインモデルの性能に関する比較は、表5で確認できます。EDLF-SLCは、実験的コンテキストに基づいて評価されたベースラインアーキテクチャと比較して、評価した各指標で0.88という競争力のある性能を得ました。EfficientNetB0とResNet50も良好な結果を示し、精度はそれぞれ0.85および0.83でした。対照的に、Inception-ResNetV2は評価したモデルの中で最悪の分類性能を示しました。一方で、分類精度は相対的に低かったものの、その計算効率は依然としてベースラインモデルと同等でした。提案したEDLF-SLCモデルは、採用した実験条件下において、評価したベースラインモデルに対して競争力のある性能を実証しました。

提案したフレームワークの性能を既存の手法と比較して評価するため、Table 6に皮膚病変分類における代表的な最新手法との比較を示す。例えば、47では0.86の正解率が報告されており、一方で48ではアンサンブルベースのモデルを採用し、正解率は同等であったが、適合率、再現率、およびF1スコアはより低い値であった。アンサンブル学習と複数のCNNアーキテクチャに基づいた近年の研究25,49では、最大0.87の正解率が報告されている。採用した実験条件下において、提案するEDLF-SLCフレームワークは、病変セグメンテーションモデルなどの追加コンポーネントを必要としない統一された説明可能なアーキテクチャを用いながら、0.8の正解率を達成した。

データの可用性
本研究の結果を裏付けるデータは、Kaggleの https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign で公開されています。

皮膚病変分析、メラノーマ分類;診断画像、ダーモスコピー検査結果
図 1本研究で使用した2つの診断クラスを示す、ISICデータセットからの代表的なダーモスコピー画像。 サンプルは良性(0)および悪性(1)としてラベル付けされており、データセット全体における病変の形態、色、および質感の多様性が強調されている。 この図の拡大版を表示するには、ここをクリックしてください。

皮膚病変データセットの解析ワークフロー;CNNベースの特徴抽出、SVM分類図。
図2提案されたEDLF-SLCフレームワークの完全なワークフロー。 本プロトコルは、ISIC 2020の画像取得から始まり、前処理、データ拡張、データセットの分割、4つの学習済みCNNアーキテクチャを用いた深層特徴抽出、特徴融合、SVM分類、性能評価、そしてLIMEに基づく説明生成の順に構成される。 こちらの図を拡大して表示するには、ここをクリックしてください。

皮膚病変パターンを調べる顕微鏡技術、多視点拡大画像、医学的分析。
図 3データ拡張技術を用いて生成された、拡張後の皮膚病変画像の例。 これには、水平および垂直方向の反転、回転、スケーリング、および輝度調整が含まれます。これらの変換により、データセットの多様性が高まり、モデルの堅牢性が向上し、学習時の過学習のリスクが軽減されます。 この図の拡大版を表示するには、ここをクリックしてください。

ROC曲線学習結果、AUC対エポック、モデルの検証および学習精度の推移を示す図。
図410エポックのトレーニングにおけるResNet-50モデルのトレーニングおよび検証用受信動作特性曲線下面積(ROC-AUC)。 青色の曲線はトレーニングAUCを、橙色の曲線はバリデーションAUCを表している。これらの曲線は、トレーニングの初期エポックにおいて急速な収束を示し、その後、一貫して高いバリデーション性能を維持しながら安定した最適化が行われていることを示しており、効果的な学習とバリデーションデータセットに対する十分な汎化性能が得られていることを示唆している。 この図の拡大版を表示するには、ここをクリックしてください。

良性病変と悪性病変の分類解析におけるResNet-50の混同行列図。
図5テストデータセットにおけるResNet-50モデルの混同行列。 行は正解クラスラベル(0 = 良性、1 = 悪性)を、列は予測クラスラベルを表しています。対角要素は正しく分類されたサンプル(良性310例、悪性239例)を示し、非対角要素は誤分類されたサンプル(偽陽性50例、偽陰性61例を含む)を表しています。 この図の拡大版を表示するには、ここをクリックしてください。

ROC-AUC曲線、EDLF-SLCモデル、トレーニング対バリデーション、グラフ、30エポック、データ解析
図6提案されたEDLF-SLCモデルの、30トレーニングエポックにおけるトレーニングおよび検証用受信者動作特性曲線下面積(ROC-AUC)。 青色の曲線はトレーニングAUCを、オレンジ色の曲線は検証AUCを表している。モデルはトレーニング初期のエポックで急速に収束し、その後は残りの全エポックを通じてトレーニングおよび検証AUCの値が一貫して高く、安定した最適化を示している。検証性能が維持されていることは、提案したEDLF-SLCフレームワークが検証データセットに対して良好な汎化能力と安定した学習挙動を有していることを証明している。. この図の拡大表示をご覧になるには、こちらをクリックしてください。

良性と悪性病変の分類精度を示すEDLF-SLCモデルの混同行列図。
図7テストデータセットにおける提案モデルEDLF-SLCの混同行列行は正解のクラスラベル(0 = 良性、1 = 悪性)を、列は予測されたクラスラベルを表しています。対角要素は正しく分類されたサンプル(良性29例、悪性272例)を示し、非対角要素は誤分類されたサンプル(偽陽性61例、偽陰性28例を含む)に対応しています。 この図の拡大版を表示するには、ここをクリックしてください。

皮膚科解析:皮膚病変の分類(良性か悪性か)の予測を示す画像。
図 8提案されたEDLF-SLCモデルによって生成されたサンプルの予測結果。 この図は、良性および悪性病変における分類の信頼度レベルを示しており、モデルの識別能力を実証している。 こちらの図を拡大して表示するには、ここをクリックしてください。

皮膚病変境界解析。図A~Dは、皮膚科における病変と輪郭の分化プロセスを示す。
図9提案されたEDLF-SLCモデルのLIMEに基づく局所的な説明。 この図は、モデルの分類決定に最も影響を与えたスーパーピクセル領域を強調しています。A) 良性皮膚病変の元のダーモスコピー画像。 (B良性病変に対するLIMEの説明。ハイライトされたスーパーピクセルは、良性と予測される要因として最も寄与した領域を示す。C悪性皮膚病変の元のダーモスコピー画像。D悪性病変のLIMEによる説明。悪性と分類される決定的な要因となった識別的なスーパーピクセル領域を示している。黄色の境界線はLIMEによって特定された影響力のあるスーパーピクセルを画定しており、灰色の領域は予測への寄与が最小限である領域を表している。 この図の拡大版を表示するには、ここをクリックしてください。

GradCAM法を用いた画像解析。視覚的な説明のための生データおよびオーバーレイ結果の図。
図10提案されたEDLF-SLCモデルに適用したクラス活性化写像(CAM)ベースの説明可能性手法の比較。 この図は、同一のダーモスコピー画像に対してGradCAM、HiResCAM、GradCAM++、XGradCAM、LayerCAM、EigenGradCAM、およびEigenCAMによって生成された局在化マップを比較したものである。最初のパネルに元の入力画像を示し、それに続いて各説明可能性手法によって作成された対応する生の活性化マップとヒートマップのオーバーレイを示す。これらの可視化により、空間的局在化の違いが明確になり、提案するEDLF-SLCフレームワークの分類決定に最も強く寄与している画像領域が強調される。 この図の拡大版を表示するには、ここをクリックしてください。

参考文献データセットデータサイズ特徴抽出方法正確度
92022HAM100データセット10,015枚の皮膚病変画像色と形状の特徴MLアルゴリズムおよび畳み込みニューラルネットワークモデル95.1%
192023PH2データセットアノテーション済み画像20枚非対称性、ストリーク(線状のムラ)、ドット/球状粒子、退行領域の特徴MLモデル94.0%
302024HAM100データセット10,00枚の画像色と形状の特徴S-MobileNet97.7%
282025ISIC2020およびHAM100データセットISIC2020(12,670枚の画像)およびHAM10(10,015枚の画像)色と形状残差ネットワーク-長短期記憶 (R-LSTM50)95.7% (ISIC2020); 94.2% (HAM100)
322026エムポックス皮膚病変データセット (MSLD)70枚の画像文脈とテクスチャDenseNet121、Xception、InceptionV3およびCBAM8% (DenseNet121)
392025HAM1038,569枚の画像コンテキストとテクスチャMobileNet、ResNet50、InceptionV3、およびEfficientNet93.6% (MobileNet)
402025ISIC 20192357枚の画像コンテキストおよび空間的解析CNN-Transformerベースのマルチモーダル深層学習98.71%
412026ISIC 201925,00枚の画像コンテクストとテクスチャTransXV2S95.26%
422025HAM1010,015枚の画像色と形状YOLOv8を用いたViT93%

表 1: 文献比較。皮膚病変分類にディープラーニングアルゴリズムを利用した最近の発表論文のまとめ。

データセット良性の悪性の合計
訓練データ144011972637
テストデータ360300660
全データ180014973297

表2:データセットの分布。トレーニング用およびテスト用の分割を含む、ISIC 2020データセットにおける良性と悪性のサンプルの分布。

構成要素仕様書
オペレーティングシステムUbuntu 20.04
プログラミング言語Python 3.9
DLフレームワークPyTorch 2.3.1
オプティマイザーアダム
学習率スケジューリング1e−3
エポック数100/300
中央処理装置2 vCPU 2.2 GHz
GPU(グラフィックス・プロセッシング・ユニット)Tesla T4 (16 GB) × 1
RAM(ランダムアクセスメモリ)16 GB
学習可能パラメータ2,430,353 (9.27 MB)
非学習パラメータ13,434,397 (509.01 MB)

表 3: システム仕様。モデルのトレーニングおよび評価に使用したソフトウェアフレームワークとハードウェアリソースを含む、計算環境の詳細な仕様。

クラス精度再現率F1スコアサポート
良性クラス0.830.880.85360
悪性クラス0.840.780.81300
正確性--0.832660
マクロ平均0.840.830.83660
加重平均0.840.830.83660

表4:分類レポート。テストデータセットにおけるResNet-50モデルの分類性能。各クラスの適合率(precision)、再現率(recall)、F1スコア、およびサポート(support)を示す。

モデル正確度精度再現率F1スコア時間 (s)
NASNetLarge0.770.760.770.762002.47
EfficientNetB00.850.850.850.85734.8
Xception0.80.810.80.8732.23
ResNetV20.630.640.630.6111072.34
MobileNet0.790.80.790.79629.29
MobileNetV20.770.790.770.77660.5
ResNet500.830.830.830.83749.77
EDLF-SLC0.880.890.870.883279.77

表 5: モデル性能の比較。提案されたEDLF-SLCモデルとベースラインのディープラーニングモデルにおける、正解率(accuracy)、適合率(precision)、再現率(recall)、F1スコア、および計算時間の性能比較。

モデル正確度精度再現率F1スコア
ResNet-18 [25]0.850.850.850.85
SVMを用いたResNet-50 [50]0.870.880.980.93
ハイブリッドDLモデル + SVM [48]0.860.840.80.84
ハイブリッドDLモデル + SVM [49]0.860.80.60.68
提案されたEDLF-SLC0.880.890.870.88

表6:モデル比較指標。提案されたEDLF-SLCフレームワークと、皮膚病変分類における最新の最先端アプローチとの性能比較。

補足ファイル 1: アルゴリズム 1. 提案されたEDLF-SLCフレームワークのワークフロー。データの前処理、複数のCNNアーキテクチャを用いた深層特徴抽出、SVMベースの分類、および皮膚病変予測のためのLIMEベースの説明可能性の概要を示す。こちらをクリックしてファイルをダウンロードしてください。

補足ファイル 2:アルゴリズム 2. LIMEベースの局所説明プロセスのワークフロー。スーパーピクセルの生成、摂動サンプリング、代理モデルの構築、および分類決定に最も寄与した画像領域の可視化について示している。 こちらをクリックしてファイルをダウンロードしてください。

ディスカッション

提案された皮膚病変分類のための説明可能なディープラーニングフレームワーク(EDLF-SLC)は、補完的なディープ特徴表現を説明可能な人工知能と組み合わせることで、分類性能とモデルの透明性の両方を向上させることができることを示しています。特徴抽出に複数の事前学習済みCNNアーキテクチャ(ResNet50、EfficientNetB0、MobileNet、Xception)を統合し、最終的な分類にサポートベクターマシン(SVM)を採用することで、このフレームワークは異なる特徴抽出器の強みを活用し、単一のバックボーンネットワークから得られるものよりも豊かで識別力の高い病変表現を生成します。さらに、局所的代用モデルによる説明(LIME)を統合することで、局所的な視覚的説明が可能となり、臨床医が各予測に最も寄与している画像領域を理解でき、モデルの診断決定に対する信頼性が高まります。

実験結果により、EDLF-SLCがMobileNet、Xception、ResNet50を含むベースラインのCNNモデルと比較して競争力のある性能を達成することが示され、相補的特徴融合とSVMに基づく分類の有効性が強調されました。最近の最先端の手法との比較により、提案フレームワークの競争力がさらに裏付けられました。例えば、2つの研究48,49では、アンサンブルベースの手法を用いて約0.86の精度が報告されており、他のハイブリッドCNN-SVMフレームワーク25,50,51,52,53では最大0.87の精度を達成していますが、これらはより複雑なアーキテクチャや、追加の前処理またはセグメンテーションモジュールに依存していました。対照的に、提案フレームワークは、明示的な病変セグメンテーションを必要とせず、比較的簡素化されたアーキテクチャを用いて0.88の精度を達成し、同時にLIMEを通じて解釈可能な予測を提供します。これらの結果は、SVM分類の前に相補的なCNN特徴抽出器を組み合わせることで、アーキテクチャの簡潔さと透明性を維持しつつ、診断性能を向上させることができることを示しています。

提案されたフレームワークは分類精度と解釈性を向上させますが、この改善は計算コストの増大という代償を伴います。EDLF-SLCの総トレーニング時間は約3279.77 sであり、ResNet50(749.77 s)やMobileNet(629.29 s)などの個々のCNNモデルよりも大幅に長くなっています。この追加的な計算オーバーヘッドは、複数の事前学習済みCNNをトレーニングし、分類前に特徴融合を行うことから生じます。このようなトレードオフは、高い計算要件をコストとして予測性能の向上を実現するハイブリッド学習やアンサンブル学習のアプローチにおいて一般的に見られる現象です。しかしながら、臨床意思決定支援システムにおいては、診断精度、堅牢性、および信頼性が患者の転帰に直接影響するため、通常はトレーニング効率よりも重要であると考えられています。

提案されたフレームワークのもう一つの重要な利点は、その説明性にある。ブラックボックスとして機能することが多い従来のディープラーニングモデルとは異なり、EDLF-SLCはLIMEを組み込むことで、予測プロセスのケースごとの視覚的な説明を提示する。これらの説明により、臨床医はモデルが臨床的に関連のある病変領域に注目しているかを確認でき、それによって透明性が向上し、臨床的な解釈が裏付けられ、AI支援診断への信頼が高まる。その結果、提案されたフレームワークは予測性能とモデルの解釈性の間で実用的なバランスを実現しており、皮膚病変分類における有望なコンピュータ支援意思決定サポートツールとなる。

これらの心強い結果が得られた一方で、いくつかの限界を認める必要があります。第一に、本フレームワークは公開されているISICデータセットのみを用いて評価されており、異なる臨床条件下で撮影された画像、撮像装置、および患者集団における汎化能力については、依然として検証が必要です。第二に、複数の事前学習済みCNNアーキテクチャを採用することで、単一バックボーンモデルと比較して計算量と学習時間が必然的に増加します。第三に、実験を通じてハイパーパラメータ設定を固定して適用しましたが、さらなる最適化によって、異なるデータセットに対する性能と適応性が向上する可能性があります。最後に、LIMEによってモデルの透明性は向上しますが、その説明は局所的であり、摂動に依存します。つまり、説明の整合性は実行ごとに異なる可能性があり、日常的な臨床導入の前には、皮膚科専門医によるさらなる検証が必要です。

今後の研究では、複数の大規模かつ多施設共同の皮膚病変データセットを用いて提案したフレームワークの検証を行い、軽量な特徴量融合およびモデル圧縮技術による計算効率の最適化、高度なハイパーパラメータ最適化戦略の検討、および多クラス皮膚病変分類へのフレームワークの拡張に焦点を当てる。さらに、追加の説明可能なAI技術の統合および皮膚科医による前向き臨床評価を実施することで、実際の臨床現場における提案フレームワークの信頼性、解釈可能性、および実用的な適用性をさらに強化する。

開示事項

著者は、利益相反がないことを宣言します。

謝辞

著者らは、本研究の遂行を可能にした研究環境および組織的支援を提供してくださったTaif Universityに、心より感謝いたします。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
ISIC 2020 皮膚病変データセット国際皮膚画像コラボレーション (International Skin Imaging Collaboration: ISIC)ISIC 2020 チャレンジデータセットモデルの開発および評価に使用されたダーモスコピー画像データセット。
KerasKeras チームTensorFlowと統合済みディープラーニングモデルの構築と学習。
LIME (Local Interpretable Model-Agnostic Explanations:局所的に解釈可能なモデル非依存の説明)RibeiroらPythonパッケージモデル予測に対する局所的な視覚的説明の生成。
MatplotlibMatplotlib開発者最新の互換バージョン学習曲線、混同行列、および評価プロットの可視化。
NumPyNumPy開発者最新の互換バージョン数値計算および配列操作。
NVIDIA Tesla T4 GPUNVIDIA Corporation16 GB VRAMモデルの学習および推論の高速化。
PandasPandas開発チーム最新の互換バージョンデータ処理および実験結果の管理。
学習済みCNNモデルTensorFlow/KerasアプリケーションResNet50, EfficientNetB0, MobileNet, Xceptionダーモスコピー画像からのディープ特徴抽出。
PythonPython Software Foundationバージョン 3.9実装に使用したプログラミング言語。
PyTorchPyTorch Foundationバージョン 2.3.1特徴抽出およびモデル実装に使用したディープラーニングフレームワーク。
Scikit-learnScikit-learn開発者最新の互換バージョンサポートベクターマシン(SVM)、評価指標、およびデータ前処理。
サポートベクターマシン(RBFカーネル)Scikit-learn上大静脈融合された深層特徴表現の分類。
TensorFlowGoogle LLCバージョン 2.xモデルのトレーニングおよび推論のためのディープラーニングフレームワーク。
UbuntuオペレーティングシステムCanonical Ltd.Ubuntu 20.04実験操作環境

参考文献

  1. Chan S, Reddy V, Myers B, Thibodeaux Q, Brown-Stone N, Liao W. Machine learning in dermatology: current applications, opportunities, and limitations. Dermatol Ther (Heidelb). 2020;10:365-386.
  2. Olsen CM. Global trends in melanoma mortality differ by sex and age. Br J Dermatol. 2020;183(6):985-986.
  3. Sun Y, Shen Y, Liu Q, Zhang H, Jia L, Chai Y, et al. Global trends in melanoma burden: a comprehensive analysis from the Global Burden of Disease Study, 1990-2021. J Am Acad Dermatol. 2025;92(1):100-107.
  4. Monika MK, Vignesh NA, Kumari CU, Kumar M, Lydia EL. Skin cancer detection and classification using machine learning. Mater Today Proc. 2020;33:4266-4270.
  5. Hosny KM, Elshora D, Mohamed ER, Vrochidou E, Papakostas GA. Deep learning and optimization-based methods for skin lesions segmentation: a review. IEEE Access. 2023.
  6. Baghdadi NA, Farghaly Abdelaliem SM, Malki A, Gad I, Ewis A, Atlam ES. Advanced machine learning techniques for cardiovascular disease early detection and diagnosis. J Big Data. 2023;10(1):144.
  7. Veeramani N, Jayaraman P, Krishankumar R, Ravichandran KS, Gandomi AH. DDCNN-F: double decker convolutional neural network feature fusion as a medical image classification framework. Sci Rep. 2024;14(1).
  8. Veeramani N, Jayaraman P. YOLOv7-XAI: multiclass skin lesion diagnosis using explainable artificial intelligence with fair decision making. Int J Imaging Syst Technol. 2024;34(6).
  9. Shetty B, Fernandes R, Rodrigues AP, Chengoden R, Bhattacharya S, Lakshmanna K. Skin lesion classification of dermoscopic images using machine learning and convolutional neural network. Sci Rep. 2022;12(1):18134.
  10. Ali AR, Li J, Yang G, O'Shea SJ. A machine learning approach to automatic detection of irregularity in skin lesion border using dermoscopic images. PeerJ Comput Sci. 2020;6:e268.
  11. Pham TTH, Luu TN, Nguyen TV, Huynh NT, Phan QH, Le TH. Polarimetric imaging combining optical parameters for classification of mice non-melanoma skin cancer tissue using machine learning. Heliyon. 2023;9(11).
  12. Liu N, Rejeesh M, Sundararaj V, Gunasundari B. ACO-KELM: anti coronavirus optimized kernel-based softplus extreme learning machine for classification of skin cancer. Expert Syst Appl. 2023;232:120719.
  13. Masud M, Almars AM, Rokaya MB, Meshref H, Gad I, Atlam ES. A novel lightweight convolutional neural network model to predict Alzheimer's disease applying weighted loss function. J Disabil Res. 2024;3(4):20240042.
  14. Kumar A, Veeraiah V, Gongada TN, Ahamad S, Khan H, Gupta A. Explainable machine learning models for clinical decision support systems. In: 2024 15th International Conference on Computing Communication and Networking Technologies (ICCCNT). Piscataway (NJ): IEEE; 2024. p. 1-6.
  15. Shahzad K, Wasim M, Pires IM, Garcia NM. Multi-classification of skin lesions using a deep learning-based convolutional neural network. Procedia Comput Sci. 2024;241:588-593.
  16. Celebi ME, Kingravi HA, Uddin B, Iyatomi H, Aslandogan YA, Stoecker WV, et al. A methodological approach to the classification of dermoscopy images. Comput Med Imaging Graph. 2007;31(6):362-373.
  17. Li CX, Shen CB, Xue K, Shen X, Jing Y, Wang ZY, et al. Artificial intelligence in dermatology: past, present, and future. Chin Med J (Engl). 2019;132(17):2017-2020.
  18. Ramprasad M, Nagesh S, Sahith V, Lankalapalli RK. Hierarchical agglomerative clustering based skin lesion detection with region-based neural networks classification. Meas Sens. 2023;29:100865.
  19. Khater T, Ansari S, Mahmoud S, Hussain A, Tawfik H. Skin cancer classification using explainable artificial intelligence on pre-extracted image features. Intell Syst Appl. 2023;20:200275.
  20. Wang H, Ahn E, Bi L, Kim J. Self-supervised multi-modality learning for multi-label skin lesion classification. Comput Methods Programs Biomed. 2025;265:108729.
  21. Thapar P, Rakhra M, Alsaadi M, Quraishi A, Deka A, Naga Ramesh JV. A hybrid grasshopper optimization algorithm for skin lesion segmentation and melanoma classification using deep learning. Healthc Anal. 2024;5:100326.
  22. Kumar S, Nath VK, Hazarika D. Blend of deep features and binary tree growth algorithm for skin lesion classification. Symmetry (Basel). 2023;15(12):2213.
  23. Chandrahaas BV, Mohanty SN, Panda SK, et al. An empirical study on classification of monkeypox skin lesion detection. EAI Endorsed Trans Pervasive Health Technol. 2023;9:e4.
  24. Talavera-Martínez L, Bibiloni P, Giacaman A, Taberner R, de Paz Hernando LJD, González-Hidalgo M. A novel approach for skin lesion symmetry classification with a deep learning model. Comput Biol Med. 2022;145:105450.
  25. Ieracitano C, Morabito FC, Hussain A, Suffian M, Mammone N. TIXAI: a trustworthiness index for explainable artificial intelligence in skin lesion classification. Neurocomputing. 2025;630:129701.
  26. Hasan MK, Elahi MTE, Alam MA, Jawad MT, Martí R. DermoExpert: skin lesion classification using a hybrid convolutional neural network through segmentation, transfer learning, and augmentation. Inform Med Unlocked. 2022;28:100819.
  27. Koparde S, Kotwal J, Deshmukh S, Adsure S, Chaudhari P, Kimbahune V. Conditional generative adversarial networks and YOLOv5 Darknet-based skin lesion localization and classification using an independent component analysis model. Inform Med Unlocked. 2024;47:101515.
  28. Padhy S, Dash S, Kumar N, Singh SP, Kumar G, Moral P. Temporal integration of ResNet features with LSTM for enhanced skin lesion classification. Results Eng. 2025;25:104201.
  29. Xin C, Liu Z, Ma Y, Wang D, Zhang J, Li L, et al. Transformer-guided self-adaptive network for multi-scale skin lesion image segmentation. Comput Biol Med. 2024;169:107846.
  30. Sulthana R, Chamola V, Hussain Z, Albalwy F, Hussain A. A novel end-to-end deep convolutional neural network-based skin lesion classification framework. Expert Syst Appl. 2024;246:123056.
  31. Chamarthi S, Fogelberg K, Brinker TJ, Niebling J. Mitigating the influence of domain shift in skin lesion classification: a benchmark study of unsupervised domain adaptation methods. Inform Med Unlocked. 2024;44:101430.
  32. Maity S, Paul S, Guha S, Dasgupta S, Ghosh M. Automated classification of monkeypox skin lesions using a hybrid deep learning model. Biomed Signal Process Control. 2026;126:110955.
  33. Nasir S, Bilal M, Khalidi H. Detection and classification of skin cancer by using CNN-enabled cloud storage data access control algorithm based on blockchain technology. Int J Theor Appl Comput Intell. 2025:145-169.
  34. Saba T. Computer vision for microscopic skin cancer diagnosis using handcrafted and non-handcrafted features. Microsc Res Tech. 2021;84(6):1272-1283.
  35. Fayyad J, Alijani S, Najjaran H. Empirical validation of conformal prediction for trustworthy skin lesion classification. Comput Methods Programs Biomed. 2024;253:108231.
  36. Liu P, Qian W, Li H, Cao J. A relationship-aware mutual learning method for lightweight skin lesion classification. Digit Commun Netw. 2025;11(3):603-612.
  37. Adla D, Reddy GVR, Nayak P, Karuna G. A full-resolution convolutional network with a dynamic graph cut algorithm for skin cancer classification and detection. Healthc Anal. 2023;3:100154.
  38. Thamizhamuthu R, Maniraj SP. Deep learning-based dermoscopic image classification system for robust skin lesion analysis. Trait Signal. 2023;40(3).
  39. Di Giammarco M, Santone A, Cesarelli M, Martinelli F, Mercaldo F. A method for skin lesion detection and localization by means of deep learning and reliable prediction explainability. Image Vis Comput. 2025;162:105675.
  40. Haq IU, Joarder HA, Khan AA, Shi X, Alsayaydeh JAJ, Yusof MFB, et al. XAAI-ledger: an explainable CNN-transformer-based multimodal deep learning framework for early detection of melanoma and non-melanoma skin cancers using dermoscopic and clinical data. Biomed Signal Process Control. 2026;123:110410.
  41. Saeed K, Shehzad M, Malik MGA, Ahmed S, Azar AT. TransXV2S-NET: a novel hybrid deep learning architecture with dual-contextual graph attention for multi-class skin lesion classification. Knowl Based Syst. 2026;337:115407.
  42. AbuAlkebash H, Saleh RAA, Ertunç HM. Automated explainable deep learning framework for multiclass skin cancer detection and classification using hybrid YOLOv8 and vision transformer (ViT). Biomed Signal Process Control. 2025;108:107934.
  43. Hasan MK, Ahamad MA, Yap CH, Yang G. A survey, review, and future trends of skin lesion segmentation and classification. Comput Biol Med. 2023;155:106624.
  44. Li H, Pan Y, Zhao J, Zhang L. Skin disease diagnosis with deep learning: a review. Neurocomputing. 2021;464:364-393.
  45. Wu Y, Chen B, Zeng A, Pan D, Wang R, Zhao S. Skin cancer classification with deep learning: a systematic review. Front Oncol. 2022;12:893972.
  46. Fanconic. Skin cancer: malignant vs benign dataset. Kaggle; 2023. Available from: https://www.kaggle.com/datasets/fanconic/skin-cancer-malignant-vs-benign
  47. Ribeiro MT, Singh S, Guestrin C. "Why should I trust you?": Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD '16). New York (NY): ACM; 2016. p. 1135-1144.
  48. Bassel A, Abdulkareem AB, Alyasseri ZAA, Sani NS, Mohammed HJ. Automatic malignant and benign skin cancer classification using a hybrid deep learning approach. Diagnostics (Basel). 2022;12(10):2472.
  49. Bhardwaj A, Rege PP. Skin lesion classification using deep learning. In: Advances in Signal and Data Processing: Select Proceedings of ICSDP 2019. Singapore: Springer; 2021. p. 575-589.
  50. Keerthana D, Venugopal V, Nath MK, Mishra M. Hybrid convolutional neural networks with SVM classifier for classification of skin cancer. Biomed Eng Adv. 2023;5:100069.
  51. Ahmed A, Siam AI, Atwa MA, Atwa EM, Abdelrahim EM, Atlam ES. An explainable YOLO-based deep learning framework for pneumonia detection from chest X-ray images. Algorithms. 2025;18(11):703.
  52. Farsi M, ZainEldin H, Sayed RF, El-Agamy ES, Atlam SA, Alsaedi M, et al. Deep learning for pathology: YOLOv8 with EigenCAM for reliable colorectal cancer diagnostics. Bioengineering (Basel). 2025;12(11):1203.
  53. Atwa EA, Atlam ES, Ahmed A, Atwa MA, Abdelrahim EM, Siam AI. Interpretable deep learning models for arrhythmia classification based on ECG signals using the PTB-XL dataset. Diagnostics (Basel). 2025;15(15):1950.

再版と許可

タグ

説明可能なAI畳み込みニューラルネットワークサポートベクターマシンモデルの解釈可能性特徴量融合学習済みCNNLIMEによる説明疾患診断