2,280枚の皮膚病変画像を厳選したコレクションを用いて、各画像におけるmpoxの存在を分類するための標準化された二進ディープラーニングワークフローが実現しました。カスタムおよびInceptionV3、ResNetV2、ResNet50、DenseNet121、そしてハイブリッドCNNトランスフォーマーモデルが、共通の前処理およびトレーニングパイプラインの文脈で比較されました。
方法論記事
2,280枚の皮膚病変画像を厳選したコレクションを用いて、各画像におけるmpoxの存在を分類するための標準化された二進ディープラーニングワークフローが実現しました。カスタムおよびInceptionV3、ResNetV2、ResNet50、DenseNet121、そしてハイブリッドCNNトランスフォーマーモデルが、共通の前処理およびトレーニングパイプラインの文脈で比較されました。
サル痘の皮膚病変の視覚的特徴は、他の水疱性および膿性皮膚疾患と類似しているため、まだ十分に確立されていません。本論文では、畳み込み型およびトランス型特徴エンコーダと統合されたハイブリッドディープラーニングモデルが、統一された実験パイプライン内でmpox画像を自動的に分類できるという仮説を検証しました。モデルや報告書間の整合性を確保するため、主な分析は二項タスクとして実施されました:mpoxと同じまたは類似の症状を持つ他の疾患の比較。これらのベンチマークデータは2,280枚の画像で構成されており、そのうち1,020枚はmpox、1,260枚は非mpox病変画像でした。画像は標準入力サイズ150×150ピクセルにダウンサンプリングされ、値は[0, 1]の範囲に入りました。訓練中は、画像に回転、平行移動、せん断、ズーム、水平反転を加えて補強しました。カスタムシーケンシャルCNN、InceptionV3、ResNetV2、ResNet50、DenseNet121、そして提案されたハイブリッドCNNトランスフォーマーアーキテクチャが比較されました。すべてのベースラインモデルは、アダム最適化器とバイナリクロスエントロピー損失を用いて15エポック分の訓練を行いました。トレーニングおよび検証の精度、損失、精度、リコール、F1スコア、受信者の動作特性曲線下面積を測定し、可能な限りパフォーマンス評価を行いました。報告された内部検証の精度はシーケンシャルCNNで観察され、ハイブリッドモデルは98.50の精度、98.50のリコール、98.58のF1スコアを達成し、バランスの取れた識別プロファイルをもたらしました。InceptionV3は過学習の兆候を示しており、ResNetV2は堅牢な一般化テストを支持する十分な検証データを提供できませんでした。全体として、ハイブリッドモデルはすべての基準よりも優れているわけではなく、実現可能でバランスの取れた戦略と見なすことができます。
医療症例におけるmpoxの自動かつ迅速な検出は臨床的に重要です。なぜなら、この疾患は初期の視覚評価時に他のさまざまな小胞性または膿疱性の発疹と類似している可能性があるからです。臨床医は病変の形態だけにあまり注意を払わず、パターン、分布、既往、曝露リスク、疫学的文脈、検査結果を組み合わせています。それでも、計算ツールは画像を活用し、熟練した皮膚科的審査が制限または遅れている環境で有用なトリアージ手順を行うこともできます。特に、発生追跡、テレダーマティックスクリーニング、資源が限られていて多くの症例が確認検査を優先すべき場合に適用されます。
ディープラーニングベースのアプローチも、手動で記述子を作成する必要がなく病変の識別画像を発見できるため、この課題に魅力的とされています。文献で最も人気のあるレビューは、局所的な質感、色域、病変境界認識において有効であることから、依然としてコンボリューショナルネットワークに関するものである。最近の研究では、転移学習、注意メカニズム、トランスフォーマーモジュールの助けを借りて、画像のより大きな空間依存性をモデル化しようと試み、このパラダイムをさらに発展させています。それでも、mpoxに関する文献は高い効果報告があり、注意が必要です。多くの研究が、スパースな公開データセットを用いたり、異なる異種クラスのセットを用いたり、さまざまな前処理や検証体制と結果を比較したりしています。そのため、パフォーマンス向上が真に優れたモデルによるものなのか、望ましい分断によるものなのか、積極的な増強なものなのか、あるいは基盤となるタスクの定式化の不均衡によるものなのかというジレンマがしばしば起こります。
Mpoxは公衆衛生に悪影響を及ぼす重要な感染症の一つであり、皮膚感染症に関わる病変は、初回検査中の眼科検査時に他の小胞性および膿疱性病変と混同される可能性があります。実際には、臨床医は形態学、分布、病歴、疫学、検査確認などが診断決定の要素です。6。それでも、特に皮膚科医の経験が不十分、遅い、または利用できない場合に、画像に基づく計算ツールの助けを借りてトリアージプロセスにおいて有益な役割を果たすことができます。これらはテレダーマコロジー、アウトブレイクをスクリーニングで対処する場合、また優先順位リストにある疑い症例を迅速に対処しなければならない資源の制約がある場所で適用される可能性があります。
深層学習ベースの手法は識別的病変表現を学習できるため、入力画像の特性に応じて手作業の記述子を学習せずに学習できるため、この課題に魅力的です。皮膚画像の分野では、局所的な質感、病変の周辺、そして精巧な形態的意味を符号化する能力を持つ畳み込みニューラルネットワーク(CNN)を画像解析に活用することに熱狂的になっています。後の研究では、転移学習、注意、トランスフォーマーベースのサブモジュールを通じて、より一般的な空間的関係や文脈的傾向を学ぶためのパラダイムが提供されています。それでも、mpox画像に関する文献は依然として多様です。性能がアーキテクチャの選択だけでなく、データセット構造、拡張計画、クラス定義、検証構造10にも基づいていると報告されることは珍しくありません。したがって、良い見出しのパフォーマンスが必ずしも一般化の増加を意味するわけではありません。
現在の研究では、この問題をより知覚しやすく内部的に一貫した二値mpox画像分類ベンチマーク11を用いることで解決されています。CNNトランスフォーマー手法は文献中にすでに散りばめられているため、まったく新しいハイブリッドアーキテクチャを提案する形式での貢献については論じていません。むしろ、実験は明示的な一次二分分解との標準的な比較を導入し、追加のマルチクラス証拠、前処理・訓練、モデル性能をプロトコルに配慮した形で考慮し、モデル性能は実験環境13と比べて保守的に考慮しています。このパラダイムにおいては、CNNトランスフォーマーモデルは局所病変情報を最適に捉える構造であるため、機能的に重要な役割を果たします。一方、トランス変換モデルは皮膚科で関心のある長距離空間構造を表現する可能性もあります。
最近のmpox画像分類研究は、方法論に基づく大きく分けて3つの研究分野に分けられます。後者は成熟度、計算速度、病変特異的なテクスチャーの再現性により、従来のCNNと転移学習に基づいています14。後者は注意ベースモデルやトランスフォーマーモデルを探求し、全体的な病変の文脈をより学習するのに適しています。3つ目は、ハイブリッドパイプラインで巻き込みと注意を統合し、局所感度を維持しつつ、より大きなボディコンテキストモデリングを用います。いくつかの研究は高いパフォーマンスを報告していますが、データセットの規模、キュレーション戦略、クラスの構造、前処理、検証プロトコルが異なるため、直接比較は容易ではありません。これらは二元分類志向で、多クラス皮膚科的識別志向であり、評価基準が同じとは限りません。公開されているMpox画像データセットには、ほぼ重複または非常に類似した画像が含まれることもあり、分割制御が不十分な場合には見かけのパフォーマンスを誇張する必要があります。
この分析は、皮膚病変の写真2,280枚、mpoxの写真1,020枚、その他1,260枚の写真からなる管理された二進法に基づいています。他のカテゴリーは肉眼で見られる非MPOX病変と重なり、完全な皮膚病局所システムと比べて臨床的に興味深い初期トリアージの定式化となります17。画像はすべてリサイズ、正規化、標準化、補強され、典型的な内部トレーニング検証パイプラインで評価されました。主な目的は、従来のディープラーニングモデルとハイブリッド型ディープラーニングモデルの挙動を透明なベンチマークで比較し、提案されたハイブリッドアーキテクチャが一般的なベースラインと比較して判別性と解釈可能性のバランスが優れているかどうかの結論を出すことでした。
したがって、現在の改訂版が明確に埋めているギャップは、ハイブリッドモデルの提示だけでなく、ハイブリッドCNNトランスフォーマーの戦略はすでに文献で取り上げられています。むしろ、必要なのは、主要な二元タスクや探索的マルチクラス出力を無視し、前処理およびトレーニングパイプラインを再現性のある形で特徴付け、新規性や臨床準備度を過大評価しない形でモデルのパフォーマンスを示す、より明確で内部的に一貫した指標が必要だったことです.この点で、CNNは局所的特徴抽出に優れており、トランスフォーマーのような注意は理論上、グローバル病変の配置や長距離空間的接続をモデル化し、視覚診断を助けることができるため、ハイブリッドアーキテクチャを検討する価値があります。実務的な問いは、ハイブリッド設計が同じキュレーションされたデータ側面の典型的なベースラインと比べて識別力、安定性、解釈性のバランスが良好かどうかではなく、課税、安定性、解釈可能性のバランスが良好であるかどうかにあります。
mpox画像解析に関する最新の研究は、手法の研究において三つの一般的な流れに分けることができます。前者は成熟度、計算効率、病変特異的なテクスチャーや局所的な形態的特徴を学習できる能力から、従来のCNNや移移学習アーキテクチャを用いています。第二の流れは、視覚トランスフォーマーや注意強化モデルを提供し、特にテクスチャパッチが文脈的な病変分布で構成されている場合、病変フィールド全体の広い空間的連合を捉えることができるため、個々のテクスチャパッチと同じくらい重要である場合に特化します。第三の流れは、CNNの局所感度を維持しつつ、注意ブロックの文脈モデリング能力を活用するために、畳み込みとハイブリッドパイプラインのサポートを加えています。
これらの研究の多くは優れた精度を謳っていますが、データセット間の規模、キュレーション戦略、クラス構成、検証設計の違いにより、クロススタディ比較は容易ではありません。二元差別を評価する論文や、多分類皮膚科分類を評価する論文もあります。報告の正確さや記憶力のバランスが取れたものもあれば、正確さに焦点を当てたものもあります。また、報告されたmpoxデータセットはオンライン画像コレクション、キュレーションコレクション、拡張サブセットに基づくことができ、トレイン検証の漏れやほぼ重複画像の管理が不十分な場合に報告されたパフォーマンスを向上させることができます。したがって 、表1 は単なる過去の研究の要約としてではなく、モデルファミリー、データセット制約、そして本研究で利用可能な手法がもたらす機会の概略的マップとして扱われています。
与えられた研究の方法論的価値は、より限定的で擁護可能な形で反映されています。本論文では、提供された厳選データセットを活用して透明な二値ベンチマークの必要性を論じ、前処理および訓練手順を報告し、提案されたハイブリッドモデルを一般的なベースラインと直接比較します。これらの変更はまた、主要な二項実験と補足マルチクラスエビデンスを分離し、パフォーマンス主張を適切な実験的文脈に関連付けることを可能にします。この違いは、モデルの実行、報告された指標、実用性の談話分析に決定的な違いをもたらします。
このスクリプトの主な実験は、手作業でキュレーションされた2280枚の皮膚病変画像を使った二値分類実験です。このデータセットでは、mpoxと特定された画像は1,020枚、その他に分類された画像は1,260枚でした。もう一つのカテゴリーは、mpoxに関連しない皮膚科的症状の提示であり、主に病変で、原稿では水痘やはしか様病変と記載されています。この二重の命名法により、この二項分類は原始的なスクリーニング定式化として臨床的に重要です。なぜなら、モデルは疑わしいmpoxや視覚的に混乱を招く代替案を分解できるかどうかを調査する一方で、完全な多分類皮膚科ベンチマークよりも複雑さが少ないからです。
モデルの訓練は標準化され、すべての画像は訓練前に事前処理されていました。また、サイズ変更、強度正規化、増強、カテゴリからバイナリへの変換も論文で言及されています。しかし、更新された意味では、これらのステップは再現可能なパイプラインの構成要素と見なされ、周辺で書かれたメモとはみなされません。その配列はさらに、ディレクトリからなるトレーニングおよび検証のサブセットに分割されており、前述のパフォーマンス指標は完全に独立した外部テストグループの指標ではなく、内部検証パフォーマンスへの影響として捉えるべきです。より明確にするために、この2,280枚の画像コレクションは、主要な分析が行われる公式データとして採用されます。二値的なフレーミングが選ばれたのは、初期のトリアージの質問を反映しているからです。すなわち、疑わしい病変の画像は他の視覚的に似た状態よりもmpoxである可能性が高いのか?この枠組みは広範な皮膚科診断と比べると限られていますが、比較ベンチマーキングの有効かつ技術的に解釈可能な初期出発点として有効です。
データセットの更新説明では、異なるクラス構造や図 1A–Iに示される強化された部分集合の助けを借りて得られた追加出力が含まれていることも考慮されています。これらの資料を削除する代わりに、原稿はそれらを直接文脈化し、読者がバイナリーベンチマークの一部と二次実験の一部となる結果を閲覧できるようにしています。この方法は本研究の全記録を維持しますが、互換性のない実験を単一の主張に統合することはできません。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
注意:メイン実験には、原稿で説明されているキュレーションされたバイナリmpox画像データセットを使用してください。このデータセットには2,280枚の皮膚病変画像が含まれており、そのうち1,020枚はmpox画像、1,260枚はその他とラベル付けされています。二次画像解析のみを使用;このワークフローの一環として、直接的な患者募集、臨床介入、動物実験、新規生物標本の生成は行わないでください。
1. データセットの取得とキュレーション
2. 画像のサイズ変更と正規化
3. トレーニング画像の補強
4. ラベルをエンコードし、データセットを分割する
5. 基礎的なCNNモデルを構築する
6. ハイブリッドCNNトランスモデルの定義
7. 研修プロセスと鑑定実務
8. 実験的解析
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
見出しの正確さを超えた比較
これらの結果は、医療画像解析におけるモデルの比較は、単に見出しの正確さだけでなく、複数の指標や異なる実験環境におけるアーキテクチャの挙動にも注目すべきであることを示しています。実験を通じて、モデルは同様の挙動を示しませんでした。単純な逐次CNNは内部検証スプリットで非常に高い性能を示し、InceptionV3は過学習、ResNetV2は検証報告が不十分、DenseNet121は性能面では相対的ですが圧倒的ではありませんでした。提案されたハイブリッドCNN-トランスフォーマーモデルは、さまざまな指標で堅牢かつバランスの取れた性能プロファイルを示しました。この違いこそが、単一の精度の最良値に依存するのではなく、トレーニング、検証、評価条件に関する報告の内部一貫性の重要性を強調しています。全体的なトレーニング検証損失および精度の傾向は図2Aおよび図2B
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
本研究の重要な結果は、mpoxと視覚的に類似した病変の二元分類(自動分類)が、本研究で使用された厳選データセットで可能であるという点であるが、その成功は主に証拠の解釈に依存している(27)。実験を適切に分離し、論文は従来型と提案されたハイブリッドアーキテクチャの両方が強力な性能を実現できるという証拠を示しています。したがって、ハイブリッドモデルをすべての状況に対する普遍的解決策と見るのは適切ではありません。ハイブリッドモデルはバランスの取れた有望な解決策だからです。
また、重要な制限もいくつかあります。第一に、主な発見は、1つのキュレーションデータセットの内部検証であり、機関、機器、患者の人口統計、画像キャプチャ状態においてまだ堅牢であることは証明されていません。第二に、二分法モデルは、他の中間的な病変クラスや不安定な症状が関与する皮膚科の異なる診断の臨床的イメージを簡素化...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者らは、この原稿で報告された研究に影響を与えた可能性のある競合する財政的または非財務的利害関係は知られていないと述べています。
著者らは、研究開発基金(RDF)助成金番号のもと、ヴェルテック・ランガラジャン博士サグンタラ科学技術研究所から受けた財政的支援に感謝いたします。VTU/RDF/FY2026-27/009。この支援は、この研究活動の成功を円滑に進める上で重要な役割を果たしました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| データセット | キュレーションされたmpox画像データセット;メインバイナリベンチマーク用に2,280枚の画像(1,020枚のmpoxと1,260枚のその他) | 一次トレーニングおよび内部検証のソース | |
| タスク定義 | コアスタディの二項分類;補足のマルチクラスおよび拡張要約は別途保持 | 報告された指標の一貫した解釈を保証します | |
| プログラミング環境 | Pythonベースのノートブックワークフロー | データ処理、モデルトレーニング、プロット | |
| ディープラーニングフレームワーク | 提出コードで報告されたTensorFlow / Kerasの実装 | モデル開発と最適化 | |
| イメージユーティリティ | リスケーリングと拡張機能を備えたImageDataGenerator;訓練曲線のための図書ライブラリ | 前処理、増強、視覚的報告 | |
| ベースラインアーキテクチャ | シーケンシャルCNN、InceptionV3、ResNetV2、ResNet50、DenseNet121 | 比較ベンチマーキング | |
| 提案された建築 | ハイブリッドCNNトランス分類器 | 主要な方法論的貢献 | |
| トレーニング環境 | 入力サイズは150 x 150;バッチサイズは32;アダム最適化器;二項クロスエントロピー;提供されたベースラインコードに対して報告された15のエポック | コアワークフローの再現性 | |
| 計算環境 | GPU対応計算システム;物語の中で一般化されたハードウェアの詳細 | トレーニング中のモデル加速度 |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト