本研究でVision Transformersを用いることで、CT画像から肺がんを分類でき、1,190回のスキャンで98.18%の精度を達成しています。このモデルは、消費者向け健康診断アプリケーションにおいて、ノイズやぼやけた画像に対しても、ノイズやぼやけた画像に対して80〜88%の精度を満足のいくレベルで維持しました。
研究記事
本研究でVision Transformersを用いることで、CT画像から肺がんを分類でき、1,190回のスキャンで98.18%の精度を達成しています。このモデルは、消費者向け健康診断アプリケーションにおいて、ノイズやぼやけた画像に対しても、ノイズやぼやけた画像に対して80〜88%の精度を満足のいくレベルで維持しました。
肺がんの診断は、画像診断で良性と悪性の微妙な違いがあるため、依然として困難です。従来の畳み込みニューラルネットワーク(CNN)は医療画像解析の主流でしたが、依然としてイメージング手法の多様性に伴い適用性や堅牢性は限定的です。機械学習の進歩は、消費者向け医療技術における従来の診断方法を変革し、アクセスのしやすさや患者個別ケアのプロセスを変えています。本論文では、CTスキャンを用いた肺がん分類のためのビジョントランスフォーマー(ViT)の利用法を説明し、消費者向け医療応用に関連しています。Vision Transformerモデルは1,190枚のCT画像の完全なデータセットで訓練され、分類率98.18%、マシューズ相関係数は0.9676を達成しました。さらに、モデルの性能はリアルタイムノイズやぼかしデータセットを用いたシミュレーションリアルタイムシナリオで検証されました。検証手法を高い診断精度で維持しつつ、データセット全体でViTモデルは、ノイズのある画像とぼやけた画像を区別する精度が80〜88%に達し、従来の検証手法を上回る性能を示しました。初期結果は画像変動を扱う際のViTの堅牢性に関する有望な情報を提供しますが、評価研究が比較的小規模なデータセットとシミュレーション環境で行われたため、結果の文脈化には慎重なアプローチが必要です。将来の研究では、より正確な臨床状態を代表する大規模なデータセットや臨床的に検証されたデータセットを用いて、ViTが腫瘍診断の臨床的同定に有利か、早期発見を改善するかどうかを判断することが価値があります。
肺がんは世界的に大きな負担を抱えており、毎年何百万もの命に影響を与えています。がんの攻撃的な性質と頻繁な遅発症状のため、肺がんに関連する死亡率は高いです。早期発見は治療の効果と生存率を大幅に向上させるため不可欠です。予備的なスクリーニングと診断の従来の方法は、肺構造をより詳細に可視化するためにコンピュータ断層撮影(CT)を活用することです。しかし、CT画像の評価は複雑であり、放射線科医としての審査員に完全に依存しています。腫瘍の大きさ、形状、密度などの特性の変動も、人間の観察の信頼性を低下させます。環境要因は、人間の分析に基づく意思決定の正確さや再現性に挑戦することがあります。
これらの制約を踏まえ、近年の文献では人工知能(AI)の医療画像への応用が強く推進されており、特に深層学習(DL)モデルに重点が置かれています。DLは特に畳み込みニューラルネットワーク(CNN)を用いて、画像解析の方法を変えることで医療画像の観測パターンを乱しました。CNNは腫瘍学における診断プロセスを大幅に強化し、人間の目では判別できないような画像データの微妙で複雑な特徴を識別する能力を示しています。これらの進歩にもかかわらず、CNNは小規模なデータセットでの過学習、可変取得条件下での堅牢性の低下、局所的な受容野への依存によりグローバル依存性を見逃すなどの制約に直面しています。ハイブリッドCNN-トランスフォーマー手法は、コンボリューションの事前分布と注意メカニズムを組み合わせようとしますが、それでもコンボリューションアーキテクチャのバイアスを遺伝しています。 図1 は、データセットから異なるクラスを示すいくつかのインスタンスを示しています。

図1:正常、良性、悪性肺の代表的なCTスキャン断片を示す異なるクラスの視覚図で、類似点と相違点を強調しています。 この図の拡大版はこちらをクリックしてご覧いただけます。
正常、良性、悪性の各症例の代表的なCT画像が示されます。識別領域の明示的なマーキングは視覚的解釈を助けるものの、手作業による注釈は専門の放射線科医を必要とし、本研究の範囲外でした。
自然画像分類3のために元々導入されたビジョントランスフォーマー(ViT)は有望な代替手段です。CNNやCNN-トランスフォーマーのハイブリッドとは異なり、ViTは全画像にわたるグローバルな文脈情報を捉える完全な注意駆動型フレームワークを採用しています。この研究は特にCT画像において重要です。腫瘍の特徴の拡散性や不規則性が局所的な受容野に限定されるのではなく、領域全体に広がる可能性があります。CNN-トランスフォーマーのハイブリッドネットワークが畳み込み帰納バイアスを安定化するのに対し、ビジョントランスフォーマー(ViT)は完全に注意ベースのアーキテクチャを実装しており、ViTモデルはCT画像全体にわたる長距離依存関係を捉えることを可能にします。これは、びまん性や不整形肺腫瘍の特性を評価する際の利点です。
医療画像分野におけるトランスフォーマーベースのモデルの登場は最近のことで、ソフト放射線学や組織病理学の例がいくつかあり、これらは従来のCNNシステムよりもノイズ、ぼかし、スキャナー間変動に対する堅牢性という顕著な利点を示しており、ViTを臨床文脈で新奇性を過度に強調することなく正当化する役割を果たしています。肺がん画像診断に対するより厳密なアプローチと消費者向け医療応用の比較を踏まえ、本研究はエビデンスに基づく医療の堅牢な分野で実用性を正当化しつつ、トランスフォーマーとその応用に関する最近入手可能であったあまり圧倒的でない文献の中に位置づけています。過去の文献では、CNN診断モダリティの正確性は獲得変動7により急激に低下し、対応するViTが同じ摂動でより良い結果を出すことが示されており、これは評価モダリティにViTを用い、診断ワークフローの再現性向上の選択肢を提供するという考え方を支持しています。さらに、必要なデータセットサイズ、計算負荷、異なる臨床環境への一般化といった実用的な課題も、データ拡張、転移学習、効率的なViTバリアント9,10などの手法を用いて、実際の利用における潜在的な課題に対応することで明確に示されています。
本研究は、CT画像データを用いて肺がん病期測定のためのViTを実装し、実際の画像問題が存在する場合におけるモデルの堅牢性と一般化可能性を検証することで、この進展を基盤としています。CTデータには、アーティファクト、ノイズ、ぼやけなどが一般的に含まれ、臨床医にとって意味のある特徴が見えにくくなる可能性があります。これらの画像変化に対するレジリエンスを検証することで、本研究はケアや治療に関する意思決定を行う際に実践に依拠できる追加のステージング枠組みを提供することを目指しています。
本研究の貢献は、i) IQ-OTH/NCCD データセット内のCT画像から、Vision Transformerモデルの性能を用いて特定的に肺がんを検出すること、ii) ノイズやぼやけなどCTデータに共通する実際の臨床画像シナリオでのモデルの性能評価;iii) 従来のCNNモデルの代替として、ViTの精度、感度、特異度の比較。
本論文の残りの構成は以下の通りです。第II部では、ディープラーニング技術を用いた肺がん検出に関する先行研究やCNNからViTなどのより高度なアーキテクチャへの進展を紹介する文献レビューを紹介します。第III節では、データ前処理、モデルアーキテクチャ情報、トレーニング手順の詳細を含むこの作業のアプローチを紹介します。第IV節では、ViTの臨床的処方的特徴に特化した研究結果と、それが肺がん検診の正確性と信頼性を高める可能性について紹介します。第V節では、医療環境におけるディープラーニングの文脈における発見と実践への貢献をまとめ、今後の方向性について論じています。
関連作品:
ディープラーニング(DL)は過去10年間で医療画像技術に革命をもたらし、特に肺がんの診断において顕著です。当初、この分野はサポートベクターマシン(SVM)や意思決定木のような従来の機械学習技術に依存していましたが、これらは適切に構築され、適切に得られた特徴量の制約がありました。これらの特集は医療写真の複雑さをうまく扱いきれず、しばしば主観性を注入していました。
巻込みニューラルネットワーク(CNN)の発明により、データ11から階層的特徴を自動的に抽出可能となり、大きな変化がもたらされました。CNNはCTスキャンに基づくがん病期診断、結節検出、良性または悪性の分類に広く用いられています。CNNは成功していますが、限界もあります。これには画像収集環境の違いや、プライバシーの問題や医療注釈の労力集約的な性質のために入手困難な大規模注釈付きデータセットの必要性が含まれます。表1 12,13,14,15,16,17,18,19,20は、肺がん診断分野で行われた最近の研究の概要を示しています。
| クラスタ、ラヴィナ・ジーン、ルパル・ニーマ、アルウィン・ロシャン・パイス(2024年)[20] | CT画像を用いた肺がんの検出および分類のための新しいディープラーニングフレームワークを提示すること[20]。 | 本論文では、セグメンテーション用の3D-VNetと分類のための3D-ResNetを導入し、従来の手法に比べて精度と堅牢性の向上を示しています。 |
| クラスタ、ラヴィナ・ジーン、ルパル・ニーマ、アルウィン・ロシャン・パイス(2024年)[20] | CT画像を用いた肺がんの検出および分類のための新しいディープラーニングフレームワークを提示すること[20]。 | 本論文では、セグメンテーション用の3D-VNetと分類のための3D-ResNetを導入し、従来の手法に比べて精度と堅牢性の向上を示しています。 |
表1:最近の研究の概要であり、使用された技術と報告されたパフォーマンスの文脈をまとめたものです。
画像の全体的な文脈を同時に考慮する自己注意プロセスを用いることで、ビジョントランスフォーマー(ViT)は画像関連のタスクにおいてCNNに代わる競争的な選択肢として台頭し始めています。ViTは医療画像において特に有望です。なぜなら、一部の領域の重要性は、そのグローバルな処理能力により遠方の画像部分に依存する可能性があるからです。しかし、ViTはスキャンで複数の疾患指標間の相関を認識するような複雑な作業を扱う能力があるにもかかわらず、医療画像分野ではまだ十分に研究されていません。
ViTは消費者中心の医療機器分野ではあまり深く探求されていません。本研究は、消費者中心の医療機器が高性能かつリアルタイムで正確な予測を提供できる場合、高い精度と低遅延のギャップを埋めることを目指しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
データセットには110件の症例から合計1,190件のCTスキャン断片が含まれており、正常(55件)、良性(15件)、悪性(40件)の3つのカテゴリーに分類されています。各症例は複数のCTスライス(約80〜200枚のスライス)で構成され、胸部領域の多様な軸方向の観察を提供します。CT画像は、SOMATOMスキャナーを用いて標準的な画像パラメータ(チューブ電圧=120 kV、スライス厚さ=1 mm、ウィンドウ幅=350–1,200 Hounsfield Unit(HU)、ウィンドウ中心値=50–600 HU)を用いて、完全な吸気呼吸中に取得されました。
分析前にすべての画像は完全に匿名化され、個人識別情報(PII)を除去しました。このデータセットは参加医療センターの機関審査委員会によって倫理的に承認され、監督審査委員会から書面による同意は放棄されました。これらの症例には、政府職員、農民、バグダッド、ワシット、ディヤラ、サラフッディン、バビロンなど複数のイラク州の住民など、性別、年齢、教育レベル、生活状況の多様性を持つ多様な背景の個人が含まれていました。
データセットは公開されており非特定化されているため、本研究での使用に追加の倫理的承認は必要ありませんでした。このデータセットは、元の貢献者およびホスティングプラットフォームによって定められた利用規約に準拠しています。
本研究の方法論は、IQ-OTH/NCCD 肺がんデータセットを活用して予測モデルを作成するための多段階プロセスを用いています。この手法は、遅延が少なくて済む消費者中心の医療機器にとって強力な基盤を築き、より高い精度を実現できます。 図2 は提案モデルの動作機構を示しています。

図2:提案モデルのワークフロー図で、前処理、増強、ビジョントランスフォーマー分類、評価ステップを示しています。この図の拡大版はこちらをクリックしてご覧ください。
1. データセットの説明
IQ-OTH/NCCD肺がんデータセットは、2019年秋にイラク腫瘍教育病院/国立がん疾患センターで収集されました。使用されたデータセットのトレーニング部分には1,097枚の画像が含まれており、その説明は 表2に示されており、異なるクラスのサンプルインスタンス数を示しています。
| クラス | 画像の数 |
| 正常 | 416 |
| 良性 | 120 |
| 潑 | 561 |
表2:データセットからの正常、良性、悪性CT画像のサンプル例。
IQ-OTH/NCCD 肺がんデータセットは、正常、良性、悪性のCTスキャンを包括的に表現しているため選ばれました。LIDC-IDRIやNSCLC-Radiomicsなどの他のデータセットも存在しますが、これらは主に結節検出に焦点を当てているか、良性症例のサンプルが十分に不足しています。IQ-OTH/NCCDデータセットは、Vision Transformerが3つのクラスすべてにわたる識別特徴を学習できるため、肺CT画像の微妙なパターンを強力に分類できるため、本研究に特に適しています。
2. データ前処理
前処理は、ニューラルネットワークで処理されるデータの一貫性と適切な調整を通じてモデル性能を向上させる重要なステップです。ニューラルネットワークの入力サイズの一貫性を確保するため、すべての画像を256×256ピクセルの同じ寸法にスケールし、データを0から1の間のピクセル値に正規化して、モデルの訓練と収束性の向上を目指しました。 表3は 増強技術の値を含んでいます。
| 技術 | 価値 |
| 正常化 | - |
| サイズ | image_size x image_size |
| ランダムローテーション | 係数=0.02 |
| ランダムズーム | height_factor=0.2, width_factor=0.2 |
表3:パラメータ範囲を用いた拡張技術の応用。
過学習に対するモデルの堅牢性を高め、一般化能力を向上させるために、ランダム回転やズームなどのデータ拡張技術を用い、異なる患者に現れる肺がんのさまざまな角度や大きさをシミュレートします。本研究では、0.02ラジアンから角度を均一にサンプリングしたランダム回転と、高さ・幅の因子が異なるランダムズーム変換を適用しました。増強後の画像は 図3に示されています。

図3:拡張後のCT画像で、モデルの一般化を改善するための回転、ズーム、正規化の実演。 この図の拡大版はこちらをクリックしてご覧ください。
これらの前処理技術は必要であり、モデルの堅牢性を確保するためにすべてのクラスで拡張が用いられています。
3. モデルアーキテクチャ
複雑な画像データを効果的に扱うために新しいVision Transformer(ViT)フレームワークを適応させたモデルアーキテクチャは、CTスキャンを正常、良性、悪性の3つのカテゴリーに分類することを意図しています。この方法では、256×256ピクセルの入力画像が処理されます。一貫性を保証し、より効率的なモデル学習を促進するために、各画像はサイズ変更や正規化などの複数の前処理処理を受けます。画像のスケールや向きの変化に対するモデルの耐性を高めるため、設計は正規化、リサイズ、0.02ラジアンのランダム回転、最大20%のランダムズームなどの手法を用いたデータ拡張レイヤーから始まります。拡張後、モデルはすべての画像から16×16ピクセルのパッチを取り除き、つまり1枚の画像に256パッチが入ります。
アルゴリズム1は、提案モデルのワークフローと構築方法、モデルに対して行われる微調整を定義します。
アルゴリズム1:Vision Transformersを用いた肺がん分類
入力:IQ-OTH/NCCD データセットからのCT画像Iのセット
出力:結果Cを正常、良性、悪性のカテゴリーに分類
前処理:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
モデルセットアップ:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
訓練:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
検証:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
評価:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
パッチ間の空間関係を保持するために、これらのパッチは768次元ベクトルに平坦化されます(式1)。各パッチは16 x 16 x 3 = 768であるためです。その後パッチエンコーディング層に送られます。この層は位置埋め込みを積分して各ベクトルを64次元空間に投影します。アーキテクチャのコアは8つのトランスフォーマー層で構成されており、それぞれに6つのヘッドを持つマルチヘッドの注意機構が搭載されており、モデルが画像の異なる部分に同時にフォーカスし、幅広い特徴を捉えることができます。これは式2、3、4で表されます。

ここでμは平均、σ2 は入力xの分散、εはゼロ割り算を防ぐ小さな定数です。

ここで、Qはクエリ行列、Kは鍵行列、Vは値行列、dk は鍵ベクトルの次元です。


ここで WiQ、WiK、WiV はそれぞれクエリ、キー、値の学習された重み行列であり、WO は出力の重み行列です。
提案モデルのブロック図は 図4に示されています。

図4:MLPヘッドを持つVision Transformerモデルのブロック図で、主要な処理層とアーキテクチャの詳細を示しています。 この図の拡大版はこちらをクリックしてご覧ください。
各トランス層には多層知覚(MLP)が含まれており、隠れたユニットは最初に128に拡大し、その後64まで縮小され、複雑な依存関係を効果的に拡大・圧縮して情報フローを捉えます。
ドロップアウトは、注意メカニズムやMLP内で0.1の比率で戦略的に適用され、過学習を防ぐ。トランスエンコーダからの出力は、2層の密度の高いMLPヘッド(それぞれ2,048ユニットと1,024ユニット)を通過し、活性化にはガウス誤差線形単位(GELU)が用いられています。これはディープラーニング応用で優れた性能を示すことが示されています。これは式5を用いて達成されます。

ここでW1 とW2 は重み行列、b1 とb2 はバイアス、GELUは活性化関数です。
トランス層では0.1のドロップアウトが用いられ、重要な特徴情報を失わずに過学習を防ぐために使われました。GELU活性化関数は、トランスモデルにおける勾配フローと収束を促進する滑らかな非線形特性のために利用されました。ドロップアウトは式6を用いて正則化されます。
ここでpはドロップアウト率(例:0.1または0.5)であり、ドロップアウト層はトレーニング中に入力単位の一部pをランダムにゼロに設定します。
これらの層でのドロップアウト率0.5は、過学習の緩和にさらに役立ちます。モデルの最終層はロジット層(式7)で、正常、良性、悪性のカテゴリーに対応する3つのクラスロギットを出力します。これはこの多クラス分類設定に適したスパースカテゴリカルクロスエントロピー損失関数(式8)を用います。


ここで zi はクラス i のロジットベクトル、SoftMax(zi)) は予測確率を表し、yi は真のクラスラベルを表します。
モデルはAdamWオプティマイザ(式9、10、11、12、13)でコンパイルされており、これはAdamオプティマイザーの拡張で、学習率0.001、重み減衰0.0001で、学習速度とモデルの安定性を最適化します。





ここでm、t 、vt は勾配の第1モーメントと第2モーメント、
と
はバイアス補正モーメント、ηは学習率、εはゼロ分割を防ぐための小さな定数です。
このモデルは、学習時に32のバッチサイズを用いてGPU加速を活かし、より高速な計算を行い、100エポックの学習範囲で設定されています。
しかし、トレーニングには検証損失を早期に停止させるメカニズムがあり、モデルの改善が止まった時点で訓練を制限し、計算資源を節約し、5つの連続したエポックの過剰訓練を回避します。モデルのパフォーマンスは、スパースカテゴリ精度やトップ2精度などの指標で追跡され、最も予測可能なカテゴリーにおける分類能力を判断します。モデルトレーニングのコールバックにはチェックポイントが含まれ、検証精度に応じて最も性能の高いモデルを保存し、トレーニング終了後も最も成功したバージョンを保持します。この堅牢で計画されたアーキテクチャは、トランスフォーマーの能力を活用して医療画像データを処理し、現代のAI手法を活用して医療診断の主要な応用に応用しています。
4. 研修と検証
モデルはNVIDIA P100 GPUを用いてKaggle環境で訓練され、トレーニング過程ではバッチサイズ32のミニバッチ勾配降下法が使用されました。トレーニング中に使用されたオプティマイザーはAdamWで、学習率0.001、ウェイト減衰0.0001でした。これは迅速な収束とある程度の正則化の良いバランスでした。モデルは100エポックを対象に訓練されましたが、検証損失時の早期停止を5エポックの忍耐で使用しました。簡単に言えば、トレーニングが5つの連続したエポックで検証損失を改善しなければ、オーバーフィットと計算効率のためにトレーニングは停止します。ほとんどの場合、このモデルは検証損失が最も少ないエポックの重みを復元し、最適性能を示し、100エポック全体を実行する必要がないことを示しました。モデルのトレーニングに合計で約32分かかりました。
トレーニング中、指標にはスパースカテゴリ精度とトップ2精度が含まれ、トレーニングセットと検証セットの両方でモニタリングされました。これらの指標は、モデルが正しいクラスをどのくらいの頻度で予測しているか、また正しいクラスが上位2つの予測内にあるかどうかを判断する手がかりを提供し、医療応用においては高い信頼度の誤分類が重大な影響を及ぼす可能性があるため重要です。損失と精度の学習曲線は 図5に示されています。
.
図5:50エポックにわたるトレーニングおよび検証精度と損失曲線。安定した学習と最小限の過学習を示しています。この図の拡大版はこちらをクリックしてご覧ください。
本研究ではクロスバリデーションは行われていません。この構成により、トランス層やMLPヘッドのサイズの調整を含むモデルアーキテクチャの効率的な実験が可能となり、見えない検証データ上でモデルが良好に一般化されることが保証されました。
5. 統計分析
Vision Transformerモデルの性能は、IQ-OTH/NCCD 肺がんデータセットに基づき統計的に解析されました。精度、想起率、F1スコア、精度はそれぞれ式14、15、16、17を用いて計算されました。これら4つは分類タスクで用いられる従来の指標とされており、各クラスごとに分類・分類する際のモデルのパフォーマンス情報を明らかにできます。




想起はモデルがクラス内の関連するすべてのインスタンスを識別できる能力の指標であり、正確さは実際に正しい肯定的識別の割合です。F1スコアは、呼び戻しと正確さの両方が重要な場合にバランスを取っています。
この課題で使用されたパフォーマンス指標は、マシューズ相関係数(MCC)式18とコーエンのカッパ方程式19でした。


ここで P0 は観測された一致、Pe は期待される一致です。
MCCは、真陽性と陰性、偽陽性、偽陰性の両方を考慮した分類性能の包括的な測定です。その値は-1から1の間で、1は完全予測、0はランダム予測、-1は予測ラベルと真ラベルの完全な不一致を示します。MCCは、不均衡なデータセットに適用した際、異なるモデル性能の比較に価値があり、クラスの規模の違いに関わらずバランスの取れた指標を提供しました。
追加の統計解析の一環として、想起を優先したF2スコアが式20で示されるように算出されました。

モデルの性能は、平均二乗誤差(MSE)、平均二乗誤差(RMSE)、平均絶対誤差(MAE)を用いて定量化されました。これらは通常回帰分析タスクの測定ですが、分類タスクでは誤差の平均的な大きさを方向に関係なく定量化するために修正されています。
消費者向け医療機器にViTを統合することが実用的かどうかを判断するため、モデルの時間的効率性のみに焦点を当てた広範な性能評価結果を実施しました。私たちは、1枚または複数枚の画像を予測するのにかかる時間を報告する関数を作成しました。これはリアルタイムアプリケーションにおいて特に重要となるためです。各画像に対して、予測を始める前に、まずデータはモデルが望む入力画像の形状に事前処理されます。予測開始時間と完了時間を記録し、時間と遅延の結果を得ました。時間と平均レイテンシーはそれぞれ式21と式22を用いて計算されました。


どこ:
さらに、画像に追加のノイズやぼかしを体系的に導入することで、提案したVision Transformerモデルの堅牢性を評価する実験も行われました。ガウスノイズはノイズファクター0.4のピクセルに加えられ、ピクセル値は[0,1]の範囲でクリッピングされました。ぼかし係数はガウスブラーによって減少し、核サイズは45×45でした。これらの実験は、知覚画像品質の劣化をシミュレートした状況下でモデルを包括的に評価することを目的としています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
Vision Transformerモデルは、IQ-OTH/NCCD 肺がんデータセットの複数の評価指標において卓越した結果を示し、正常、良性、悪性のCT画像を効果的に区別しました。220枚の画像からなるテストデータセット全体で、モデル全体の性能は98.18%という高い精度に達しました。この非常に高い精度は、モデルが非常に効果的に一般化できることを示し、臨床現場でも活用できることを示しています。
良性症例に関しては、モデルは精度100%、リコール率89.47%、F1スコア94.44%を記録しました。
悪性症例に関しては、モデルは精度100%、リコール率98.37%、F1スコア99.18%を記録しました。モデルは正常症例を95.12%の精度、100%のリコール率、97...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
IQ-OTH/NCCD肺がんデータセットにおけるVision Transformerモデルの評価と実装において、高い精度で顕著な成果を達成しています。このモデルを用いると、CTスキャンを正常、良性、悪性に分類する一般的な精度は98.18%です。
この優れた精度は、悪性症例検出における100%の精度など、他の主要スコアでのモデルのパフォーマンスによっても証明されており、これは早期診断や管理において非常に重要です。
詳細な分析の結果、モデルは精度の面で優れたパフォーマンスを示すだけでなく、非常に優れたリコール率とF1スコアを示し、偽陰性を最小限に抑えていることが示されました。これは医療診断において非常に重要な要素であり、見逃した状態のコストは致命的になり得ます。プロトコルのいくつかの構成要素がこれらの発見に貢献しました。例えば、リサイズ、正規化、増強(ランダムな回転やズーム)などの前処理技術は一貫性の向上と過学習リスクの低減に寄与しました。
ViTを用いた転...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者たちは利益相反がないと宣言しています。
この研究は、サウジアラビア・リヤドのヌーラ・ビント・アブドゥルラフマン大学研究支援プロジェクト番号(PNURSP2025R432)のヌーラ・ビント・アブドゥルラフマン王女の支援を受けました。 著者らは、ナジュラン大学大学院・科学研究部長が成長資金プログラム助成コード(NU/GP/SERC/13/575-6)の下でこの研究に資金を提供してくださったことに感謝しています。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| A100 GPU(CUDA) | NVIDIA | CUDA バージョン 11.6 | モデルの学習と評価のためのGPUアクセラレーション。 |
| AMD EPYC-7502P CPU | AMD | 該当なし | 高性能計算に使われるプロセッサ。 |
| ギガビットイーサネット | インテル | 該当なし | CPSにおけるピアツーピアの安全な通信のためのネットワーキング。 |
| Matplotlib | Pythonソフトウェア財団 | バージョン3.5 | 結果をプロットするための可視化ライブラリ。 |
| パイリエ暗号システム | オープンソース(TenSEALによる実装) | 該当なし | 勾配上の加法準同型暗号を可能にします。 |
| PySyft | オープンマインド | バージョン 0.6.0 | 差別的プライバシーとフェデレーテッドラーニングライブラリ。 |
| Python(Anacondaディストリビューション) | アナコンダ社 | バージョン3.9 | プリインストール済みのパッケージや環境管理ツールを含み、スクリプト作成やフレームワーク開発に使用されます。 |
| パイトーチ | メタAI | バージョン1.12 | モデルトレーニング用のディープラーニングフレームワーク。 |
| RAM | コルセア | 256ギガバイト(GB) | 集中的なトレーニングのための高い記憶力サポート。 |
| Scikit-learn(シキット学習) | Pythonソフトウェア財団 | バージョン1.1 | パフォーマンス評価のための機械学習ツール。 |
| シーボーン | Pythonソフトウェア財団 | バージョン 0.11 | 統計データ可視化ライブラリ。 |
| SSDストレージ | シーゲート | 1テラバイト(TB) | 高速なデータ保存と検索のために。 |
| テンシール | オープンマインド | バージョン0.3 | 安全な集約のための準同型暗号ライブラリ。 |
| テンソルフロー | グーグル | バージョン2.9 | 拡散モデルのためのディープラーニングフレームワーク。 |
| Ubuntu OS | 正典 | バージョン20.04 LTS | すべての実験に使用されるオペレーティングシステム。 |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト