연구 논문

폐암 발견을 위한 CT 스캔 분석을 위한 AI 비전 트랜스포머를 활용한 새로운 접근법

DOI:

10.3791/69302

2025년 11월 28일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구에서 Vision Transformers를 사용하여 CT 영상을 통해 폐암을 분류할 수 있으며, 1,190건의 스캔에서 98.18%의 정확도를 달성했습니다. 이 모델은 소비자 건강 진단 응용 분야에서 노이즈와 흐림이 있는 이미지에서도 80–88% 사이의 정확도를 만족스럽게 유지했습니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

영상 검사에서 양성 질환과 악성 질환 간의 미묘한 차이로 인해 폐암 진단은 여전히 어렵습니다. 전통적인 합성곱 신경망(CNN)이 의료 영상 분석의 주축이었지만, 여전히 적용 가능성은 제한적이고 영상 기법의 다양성에 비해 견고성을 가지고 있습니다. 머신러닝의 발전은 소비자 대상 의료 기술에서 전통적인 진단 방식을 변화시키며, 접근성과 개인 맞춤형 환자 진료 프로세스를 변화시키고 있습니다. 이 논문은 소비자 건강 분야와 관련된 CT 스캔을 통한 폐암 분류 작업에 Vision Transformers(ViT)를 활용한 사례를 설명합니다. Vision Transformer 모델은 1,190장의 CT 이미지 전체 데이터셋을 기반으로 학습되었으며, 매튜스 상관계수 0.9676의 98.18%를 달성했습니다. 또한, 실시간 노이즈와 흐림 데이터셋을 사용한 시뮬레이션된 실시간 시나리오에서 모델 성능이 검증되었습니다. 검증 방법을 높은 진단 정확도로 유지하면서도, 전체 데이터셋에서 ViT 모델은 노이즈 이미지와 흐릿한 이미지를 구분하는 정확도가 80-88%에 달하는 기존 검증 방법보다 우수한 성능을 보였습니다. 초기 결과는 이미지 변동을 다룰 때 ViT의 견고성에 대해 유망한 정보를 제공하지만, 평가 연구가 비교적 작은 데이터셋과 시뮬레이션 환경에서 완료되었기 때문에 결과를 맥락화하는 데 있어 신중한 접근이 필요합니다. 향후 연구에서는 실제 임상 상태를 더 대표하는 더 큰 데이터셋과 임상적으로 검증된 데이터셋을 사용하여 ViT가 종양 진단의 임상적 식별과 조기 발견 향상에 유리한지 판단하는 것이 매우 중요할 것입니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

폐암은 전 세계적으로 상당한 부담을 안고 있으며, 매년 수백만 명의 생명에 영향을 미칩니다. 암의 공격성과 빈번한 후기 발현 상태 때문에 폐암과 관련된 사망률이 높습니다. 조기 발견은 치료의 효과와 생존율을 크게 향상시킬 수 있기 때문에 필수적입니다. 기존의 예비 선별 및 진단 방법은 폐 구조를 보다 세밀하게 시각화하기 위해 컴퓨터 단층촬영(CT)을 사용하는 것입니다. 하지만 CT 영상 평가는 복잡하며, 전적으로 방사선 전문의인 심사관에 의존합니다. 크기, 형태, 밀도와 같은 특성의 종양 변이성도 인간 관찰의 신뢰성을 떨어뜨립니다. 환경 요인은 인간 분석에 기반한 의사결정의 정확성과 재현성을 도전할 수 있습니다.
이러한 제한 요인을 고려할 때, 최근 문헌들은 인공지능(AI)을 의료 영상에 적용하는 것을 강력히 추진하고 있으며, 특히 딥러닝(DL) 모델에 더 많은 초점을 맞추고 있습니다. 특히 합성곱신경망(CNN)과 함께하는 DL은 영상 분석 방식을 변경함으로써 의료 영상에서의 관측 패턴을 뒤흔들었습니다2. CNN은 종양학 진단 과정을 크게 향상시켜, 인간의 눈에 구분할 수 없는 미묘하고 복잡한 영상 데이터의 특징을 식별할 수 있음을 입증했습니다. 이러한 발전에도 불구하고, CNN은 작은 데이터셋에서의 과적합, 가변적인 획득 조건에서의 견고성 저하, 그리고 전역 의존성을 놓칠 수 있는 국소 수용 필드에 의존하는 한계에 직면해 있습니다. 하이브리드 CNN-트랜스포머 접근법은 합성곱 사전에 주의 메커니즘을 결합하려 하지만, 여전히 합성곱 구조의 편향을 물려받습니다. 그림 1 은 데이터셋에서 서로 다른 클래스를 보여주는 몇 가지 사례를 보여줍니다.

figure-introduction-1
그림 1: 정상, 양성, 악성 폐의 대표적인 CT 스캔 단면을 보여주는 다양한 분류의 시각적 일러스트로, 이들의 유사점과 차이점을 강조합니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭해 주세요.

정상, 양성, 악성 사례에 대한 대표적인 CT 이미지가 제시됩니다. 구별 영역의 명시적 표시는 시각적 해석에 도움이 되지만, 수동 주석은 전문 방사선 전문의가 필요하며 본 연구의 범위를 벗어났습니다.

자연 이미지분류 3을 위해 처음 도입된 Vision Transformers(ViT)는 유망한 대안을 제시합니다. CNN이나 CNN-트랜스포머 하이브리드와 달리, ViT는 전체 이미지 전반에 걸쳐 전 지구적 맥락 정보를 포착하는 완전한 주의 중심 프레임워크를 사용합니다. 이 연구는 CT 영상에 특히 중요한데, 종양 특성의 확산되고 불규칙한 특성이 국소 수용 영역에만 국한되지 않고 영역 전체로 확장될 수 있기 때문입니다. CNN-트랜스포머 하이브리드 네트워크가 합성곱 귀납 편향을 안정화하는 반면, 비전 트랜스포머(ViT)는 완전히 주의 기반 아키텍처를 구현하여 ViT 모델이 전체 CT 이미지 전반에 걸쳐 장거리 의존성을 포착할 수 있게 하여, 확산성 또는 불규칙한 폐종양 특성을 평가할 때 이점을 제공합니다.

의료 영상 분야에서 트랜스포머 기반 모델의 등장은 최근에 이루어졌으며, 소프트 방사선학과 조직병리학 분야에서 일부 사례가 있는데, 이들은 기존 CNN 시스템보다 노이즈, 흐림, 스캐너 간 변동성에 대한 견고성에서 ViT의 신선성을 과도하게 강조하지 않으면서도 이를 뒷받침하는 데 있어 주목할 만한 장점을 보여주었습니다. 폐암 영상에 대해 소비자 건강 응용 분야보다 엄격한 접근을 고려할 때, 본 연구는 근거 기반 의학의 견고한 분야에서 실용성을 입증하고, 최근 트랜스포머와 그 응용에 관한 방대한 문헌 중 하나에 자리 잡는 것을 목표로 합니다. 이전 문헌들은 획득 변동성으로 인해 CNN 진단 방식의 정확도가 급격히 떨어진다는 것을 보여주었으며, 이는 동일한 교란에서 대응하는 ViT가 더 나은 결과를 내는 것으로 보이며, 이는 평가 방식에서 ViT를 사용하는 개념과 진단 워크플로우의 재현성 향상 옵션을 제시하는 데 신빙성을 부여합니다. 더불어, 데이터 증강, 전이 학습, 효율적인 ViT 변형 9,10 등 실제 사용 문제를 해결하기 위해 필요한 데이터셋 크기, 계산 부담, 다양한 임상 환경에 대한 일반화 가능성 등 실질적인 문제들이 명확히 제시되었습니다.

본 연구는 CT 영상 데이터를 이용한 폐암 병기 분류에 ViT를 구현하고, 실제 영상 문제 속에서도 모델의 견고성과 일반화 가능성을 검토함으로써 이 발전을 바탕으로 합니다. CT 데이터는 임상의에게 의미 있는 특징을 가릴 수 있는 공공화, 노이즈, 흐림 현상을 포함할 수 있습니다. 이러한 영상 변화에 대한 회복력을 조사함으로써, 본 연구는 치료 및 치료 관련 의사결정을 내릴 때 실제로 신뢰할 수 있는 추가적인 병기 체계를 제시하고자 합니다.

본 연구의 기여는 다음과 같습니다: i) IQ-OTH/NCCD 데이터셋의 CT 영상을 통해 Vision Transformer 모델을 사용하고 성능을 분석하여 폐암을 구체적으로 탐지하는 것; ii) 노이즈와 흐림 등 CT 데이터에 흔히 사용되는 실제 임상 영상 시나리오에서 모델의 성능을 평가하는 것; iii) 전통적인 CNN 모델의 대안으로서 ViT의 정확도, 민감도, 특이성 비교.

이 논문의 나머지 부분의 구성은 다음과 같습니다: 2절은 딥러닝 기법을 이용한 폐암 탐지와 CNN에서 ViT와 같은 더 발전된 아키텍처로의 발전과 관련된 이전 연구를 검토합니다. 제3장에서는 데이터 전처리, 모델 아키텍처 정보 및 훈련 절차 세부 사항을 포함한 이 작업을 위한 접근 방식을 제시합니다. 제4부에서는 ViT가 임상 방법으로서 처방적 특징을 구체적으로 다루고, 폐암 검진의 정확성과 신뢰성을 어떻게 향상시킬 수 있는지에 대한 연구 결과를 제시합니다. V장은 연구 결과와 실무에 대한 기여를 요약하고, 의료 환경에서의 딥러닝 맥락에서의 향후 방향을 논의합니다.

관련 연구:

딥러닝(DL)은 지난 10년간 특히 폐암 진단에서 의료 영상에 혁신을 가져왔습니다. 초기에는 지원 벡터 머신(SVM)과 결정 트리와 같은 기존 기계 학습 기법에 의존했으며, 이는 잘 구축되고 적절히 얻어진 특징의 필요성에 제약을 받았습니다. 이 특집들은 의료 사진의 복잡함을 제대로 다루지 못했고, 종종 주관성을 주입했다.

합성곱신경망(CNN)의 발명으로 중요한 변화가 일어났는데, 이는 데이터11에서 계층적 특성을 자동으로 추출할 수 있게 되었습니다. CNN은 CT 스캔 기반 암 병기 진단, 결절 발견, 양성 또는 악성 분류에 널리 사용되어 왔습니다. CNN은 성공적이지만 한계가 있습니다. 여기에는 이미지 수집 환경의 차이와, 개인정보 보호 문제와 의료 주석의 노동 집약적 특성 때문에 구하기 어려운 대규모 주석 데이터셋의 필요성이 포함됩니다. 표 1 12,13,14,15,16,17,18,19,20은 폐암 진단 분야에서 수행된 최근 연구들의 요약을 제공합니다.

크라스타, 라비나 진, 루팔 니마, 알윈 로샨 파이스 (2024) [20]CT 영상을 이용한 폐암 탐지 및 분류를 위한 새로운 딥러닝 프레임워크를 제시하는 것[20].이 논문은 세분화를 위한 3D-VNet과 분류를 위한 3D-ResNet을 도입하여 이전 방법들에 비해 정확도와 견고성이 향상되었음을 보여줍니다.
크라스타, 라비나 진, 루팔 니마, 알윈 로샨 파이스 (2024) [20]CT 영상을 이용한 폐암 탐지 및 분류를 위한 새로운 딥러닝 프레임워크를 제시하는 것[20].이 논문은 세분화를 위한 3D-VNet과 분류를 위한 3D-ResNet을 도입하여 이전 방법들에 비해 정확도와 견고성이 향상되었음을 보여줍니다.

표 1: 맥락을 위한 최근 연구 요약, 사용된 기법과 보고된 수행 기법.

이미지의 전체 맥락을 동시에 고려하는 자기 주의 과정을 사용함으로써, Vision Transformers(ViT)는 이미지 관련 작업에서 CNN에 대한 경쟁력 있는 대안으로 부상하기 시작했습니다. ViT는 특히 의료 영상에 유망한데, 일부 영역의 중요성은 전역 처리 능력 때문에 사진의 먼 부분에 따라 달라질 수 있기 때문입니다. 하지만 ViT는 스캔에서 여러 질병 지표 간의 상관관계를 인식하는 등 복잡한 작업을 처리할 수 있음에도 불구하고, 의료 영상 분야에서는 아직 충분히 연구되지 못하고 있습니다.

ViT는 소비자 중심 의료 기기 분야에서 아직 충분히 탐구되지 않았습니다. 이 연구는 소비자 중심 의료 기기가 우수한 성능을 내고 실시간으로 정확한 예측을 할 수 있도록 높은 정확도와 낮은 지연 시간 간의 간극을 메우는 것을 목표로 합니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

데이터셋에는 총 1,190건의 CT 스캔 단편이 포함되어 있으며, 정상(55건), 양성(15건), 악성(40건)의 세 가지 범주로 분류되어 있습니다. 각 사례는 약 80개에서 200개 사이의 여러 CT 절편으로 구성되어 흉부 부위의 다양한 축방향 시각을 제공합니다. CT 이미지는 SOMATOM 스캐너를 사용해 DICOM에서 표준 영상 매개변수(튜브 전압 = 120 kV, 슬라이스 두께 = 1 mm, 창 폭 = 350–1,200 하운스필드 유닛, 창 중심값 = 50–600 HU)를 사용하여 완전한 흡기 호흡 참기 상태에서 얻었습니다.

분석 전에 모든 이미지는 개인 식별 정보(PII)를 제거하기 위해 완전히 식별 해제되었습니다. 이 데이터셋은 참여 의료기관의 기관 심사 위원회에서 윤리적으로 승인되었으며, 감독 심사 위원회는 서면 동의를 포기했습니다. 사례에는 정부 직원, 농민, 바그다드, 와싯, 디얄라, 살라후딘, 바빌론 등 여러 이라크 지방 거주자들 등 다양한 배경의 인물들이 포함되었으며, 성별, 연령, 교육 수준, 생활 상태가 다양했다.

데이터셋이 공개되어 있고 식별 해제되었기 때문에, 이 연구에서의 사용에 추가적인 윤리적 승인이 필요하지 않았습니다. 이 데이터셋은 원래 기여자와 호스팅 플랫폼이 명시한 약관을 준수합니다.

이 연구 방법론은 IQ-OTH/NCCD 폐암 데이터셋을 활용해 예측 모델을 생성하기 위해 설계된 다단계 과정을사용합니다. 이 방법론은 소비자 중심의 의료 기기에 강력한 기반을 마련하며, 지연 시간이 적어 더 나은 정확도를 제공할 수 있습니다. 그림 2 는 제안된 모델의 작동 메커니즘을 보여줍니다.

figure-protocol-1
그림 2: 제안된 모델의 워크플로우 다이어그램으로, 전처리, 증강, 비전 트랜스포머 분류 및 평가 단계를 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

1. 데이터셋 설명

IQ-OTH/NCCD 폐암 데이터셋은 2019년 가을 이라크 종양학 교육 병원/국립 암 질환 센터에서 수집되었습니다. 사용된 데이터셋의 훈련 부분에는 1,097장의 이미지가 포함되어 있으며, 표 2에 설명이 나와 있어 서로 다른 클래스의 샘플 인스턴스 수를 보여줍니다.

수업이미지 수
보통416
양성120
악성561

표 2: 데이터셋에서 정상, 양성, 악성 CT 이미지 샘플.

IQ-OTH/NCCD 폐암 데이터셋은 정상, 양성, 악성 CT 스캔을 포괄적으로 표현한 것으로 선정되었습니다. LIDC-IDRI와 NSCLC-Radiomics와 같은 다른 데이터셋도 있지만, 이들은 주로 결절 검출에 집중하거나 양성 사례 샘플이 충분하지 않습니다. IQ-OTH/NCCD 데이터셋은 Vision Transformer가 세 가지 클래스 모두에서 판별적 특징을 학습할 수 있게 해주어 폐 CT 영상의 미묘한 패턴을 견고하게 분류할 수 있게 해주기 때문에 우리 연구에 특히 적합합니다.

2. 데이터 전처리

전처리는 신경망을 통해 처리될 데이터의 일관성과 적절한 조정을 통해 모델 성능을 향상시키는 중요한 단계입니다. 신경망 입력 크기의 일관성을 보장하기 위해, 모든 이미지를 256 x 256 픽셀의 동일한 크기로 스케일링하고, 데이터를 0에서 1 사이의 픽셀 값으로 정규화하여 모델 훈련과 수렴을 개선하려 했습니다. 표 3은 증강 기법 값들을 포함하고 있습니다.

기술
표준화-
크기 조정image_size x image_size
랜덤 로테이션인자=0.02
랜덤줌height_factor=0.2, width_factor=0.2

표 3: 매개변수 범위에 적용된 증강 기법.

모델의 과적합 방지 견고성을 높이고 일반화 능력을 향상시키기 위해 무작위 회전과 줌과 같은 데이터 증강 기법을 적용하여 다양한 환자에서 나타날 수 있는 폐암 증상의 각도와 크기를 시뮬레이션합니다. 0.02 라디안에서 균일하게 샘플링한 무작위 회전과 높이 및 너비 계수가 다른 무작위 줌 변환을 적용했습니다. 증강 이후의 이미지는 그림 3에 표시되어 있습니다.

figure-protocol-2
그림 3: 보강 후 CT 이미지에서 회전, 확대, 정규화 과정을 보여주어 모델 일반화 향상을 도모합니다. 이 그림의 확대 버전을 보시려면 여기를 클릭하세요.

이러한 전처리 기법은 필수이며, 모델의 견고성을 보장하기 위해 모든 클래스에서 증강이 사용되었습니다.

3. 모델 아키텍처

복잡한 영상 데이터를 효과적으로 처리할 수 있도록 새로운 Vision Transformer(ViT) 프레임워크를 적용한 이 모델 아키텍처는 CT 스캔을 정상, 양성, 악성의 세 가지 범주로 분류하도록 설계되었습니다. 이 방법으로 256 x 256 픽셀 입력 이미지가 처리됩니다. 일관성을 보장하고 더 효율적인 모델 학습을 촉진하기 위해 각 이미지는 크기 조정과 정규화 같은 여러 전처리 작업을 거칩니다. 이미지의 축척과 방향 변화에 대한 복원력을 높이기 위해, 설계는 정규화, 크기 조정, 0.02 라디안 무작위 회전, 최대 20%의 무작위 줌 등 다양한 방법을 사용하는 데이터 증강 레이어로 시작합니다. 증강 후에는 모델이 모든 사진에서 16 x 16 픽셀 패치를 제거하므로, 모든 이미지는 256개의 패치를 갖게 됩니다.

알고리즘 1은 제안된 모델의 워크플로우와 구축 방식, 그리고 모델에 대해 수행하는 미세 조정을 정의합니다.

알고리즘 1: Vision Transformer를 이용한 폐암 분류
입력: IQ-OTH/NCCD 데이터셋에서 추출한 CT 이미지 집합 I
결과: 분류 결과 C를 정상, 양성, 악성
전처리:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

모델 구성:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

훈련:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

유효성 검사:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

평가:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

패치 간의 공간적 관계를 보존하기 위해, 이 패치들은 768차원 벡터로 평탄화됩니다(방정식 1), 각 패치는 16 x 16 x 3 = 768이기 때문입니다. 그리고 패치 인코딩 계층을 통과하여 위치 임베딩을 적분하여 각 벡터를 64차원 공간으로 투영합니다. 아키텍처의 핵심은 8개의 트랜스포머 레이어로 구성되어 있으며, 각 레이어는 6개의 헤드를 가진 다중 헤드 주의 메커니즘을 갖추고 있어 모델이 이미지의 서로 다른 부분에 동시에 초점을 맞추고 다양한 특징을 포착할 수 있습니다. 방정식 2, 3, 4로 표현됩니다.

figure-protocol-3

여기서 μ는 평균이고 σ2 는 입력 x의 분산이며, ε는 0으로 나누는 것을 막기 위한 작은 상수입니다.

figure-protocol-4

여기서 Q는 쿼리 행렬, K는 키 행렬, V는 가치 행렬, dk 는 키 벡터의 차원입니다.

figure-protocol-5
figure-protocol-6

여기서 WiQ,W iK, WiV 는 각각 쿼리, 키, 값에 대한 학습된 가중치 행렬이며, WO 는 출력 가중치 행렬이다.

제안된 모델의 블록 다이어그램은 그림 4에 나타났습니다.

figure-protocol-7
그림 4: MLP 헤드가 포함된 Vision Transformer 모델의 블록 다이어그램으로, 주요 처리 계층과 아키텍처를 상세히 설명합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.

각 트랜스포머 계층은 다중 계층 인식(MLP)을 포함하며, 숨겨진 유닛은 처음에 128로 확대되었다가 다시 64로 축소되어 복잡한 의존성을 효과적으로 포착하기 위해 정보 흐름을 확장하고 압축합니다.

과적합을 방지하기 위해 주의 메커니즘과 MLP에서 0.1의 비율로 전략적으로 적용됩니다. 변압기 인코더의 출력은 각각 2,048과 1,024 단위로 구성된 두 개의 밀집된 층으로 구성된 MLP 헤드를 통해 처리되며, 활성화를 위해 가우시안 오차 선형 단위(GELU)를 사용하여 딥러닝 응용 분야에서 우수한 성능을 보입니다. 이는 식(式5)을 사용하여 달성됩니다.

figure-protocol-8

여기서 W1 과 W2 는 가중치 행렬이고, b1b 2 는 편향이며, GELU는 활성화 함수입니다.

변압기 층에서는 0.1의 드롭아웃이 사용되어 중요한 특징 정보를 잃지 않으면서 과적합을 방지했습니다. GELU 활성화 함수는 트랜스포머 기반 모델에서 구배 흐름과 수렴을 촉진하는 부드러운 비선형 특성 때문에 활용되었습니다. 드롭아웃은 식6을 사용하여 정규화됩니다.figure-protocol-9

여기서 p는 중도 감소율(예: 0.1 또는 0.5)이며, 중도 중간에 학습 중 입력 단위의 일부를 무작위로 0으로 설정합니다.

이 층들에서 0.5의 드롭아웃률은 과적합 완화에 더욱 도움이 됩니다. 모델의 마지막 층은 로짓 층(식 7)으로, 정상, 양성, 악성 범주에 해당하는 세 가지 클래스 로그트를 출력하며, 이 다중 분류 설정에 적합한 희소한 범주 교차 엔트로피 손실 함수(방정식 8)를 사용합니다.

figure-protocol-10

figure-protocol-11

여기서 zi 는 클래스 i의 로짓 벡터이고, SoftMax(zi))는 예측된 확률을, yi 는 진정한 클래스 레이블입니다.

이 모델은 AdamW 옵티마이저(식 9, 10, 11, 12, 13)를 사용하여 컴파일되는데, 이는 아담 옵티마이저의 확장으로, 가중치 감소를 보다 효과적으로 처리하며, 학습 속도와 모델 안정성을 모두 최적화합니다.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

여기서 mt 와 vt 는 기울기의 1, 2번째 모멘트이고, figure-protocol-17 figure-protocol-18 η는 학습률이며, ε는 0으로 나누어지는 것을 막기 위한 작은 상수입니다.

이 모델은 학습 시 GPU 가속을 활용해 빠른 계산을 위해 배치 크기를 32로 사용하며, 100에이포크를 학습하도록 설정되어 있습니다.

하지만 훈련에는 모델이 개선을 멈출 때 훈련을 제한하는 초기 정지 메커니즘이 있어 계산 자원을 절약하고 5년 연속 에포크의 과훈련을 방지합니다. 모델 성과는 희소 범주 정확도와 상위 2개 정확도와 같은 지표로 추적되며, 이는 가장 가능성 높은 예측 범주에서 모델의 분류 능력을 알려줍니다. 모델 학습 콜백은 검증 정확도에 따라 가장 높은 성능을 내는 모델을 저장하는 체크포인트를 포함하며, 학습 과정이 끝난 후에도 가장 성공적인 버전을 유지할 수 있도록 합니다. 이 견고하고 잘 계획된 아키텍처는 트랜스포머의 역량을 활용해 의료 영상 데이터를 처리하며, 의료 진단 분야의 주요 응용 분야에 현대적 AI 방법을 활용하는 고도로 발전된 접근법을 활용합니다.

4. 교육 및 검증

이 모델은 NVIDIA P100 GPU를 사용해 Kaggle 환경에서 훈련되었으며, 훈련 과정에서는 배치 크기가 32인 미니 배치 그라디언트 하강 방식을 사용했습니다. 훈련 중 사용된 옵티마이저는 학습률 0.001과 무게 감소 0.0001의 AdamW였으며; 이는 빠른 수렴과 일정한 정규화 사이의 좋은 균형이었습니다. 모델은 100 에포크를 대상으로 훈련되었으나, 검증 손실 시 조기 종료를 5 에포크의 인내심으로 사용했습니다. 간단히 말해, 만약 훈련이 5개의 연속 에포흐 동안 검증 손실을 개선하지 못한다면, 과적합과 계산 효율성 때문에 훈련이 중단될 것입니다. 대부분의 경우, 이 모델은 검증 손실이 가장 적은 에포크의 가중치를 복원하여 최적의 성능을 보여주었고 100 에포크 전체를 실행할 필요가 없음을 나타냅니다. 모델 훈련에 총 약 32분 정도 걸렸습니다.

훈련 기간 동안 측정 지표는 희소한 범주 정확도와 상위 2위 정확도를 포함했으며, 훈련 및 검증 세트 모두에서 모니터링되었습니다. 이 지표들은 모델이 올바른 분류를 얼마나 자주 예측하는지, 그리고 올바른 분류가 상위 두 예측 안에 있는지 여부를 파악하는 통찰을 제공하며, 이는 의료 분야에서 매우 중요합니다. 왜냐하면 높은 신뢰도의 오분류가 중대한 결과를 초래할 수 있기 때문입니다. 손실과 정확도의 학습 곡선은 그림 5에 시각화되어 있습니다.

.figure-protocol-19

그림 5: 50 에포크에 걸친 훈련 및 검증 정확도와 손실 곡선, 안정된 학습과 최소한의 과적합을 보여줍니다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

본 연구에서는 교차 검증이 이루어지지 않았습니다. 이 구조는 트랜스포머 계층과 MLP 헤드 크기 조정 등 모델 아키텍처를 효율적으로 실험할 수 있게 했으며, 보이지 않는 검증 데이터에서도 모델이 잘 일반화되도록 했습니다.

5. 통계 분석

Vision Transformer 모델의 성능은 IQ-OTH/NCCD 폐암 데이터셋을 기반으로 통계적으로 분석되었습니다. 정확도, 회상력, F1 점수, 정확도는 각각 14, 15, 16, 17 식을 사용해 계산되었습니다. 이 네 가지 지표는 분류 작업에 사용되는 일반적인 지표로 간주되며, 각 클래스별로 분류 및 분류 수행 시 모델의 성능을 파악할 수 있습니다.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

회상은 모델이 클래스 내 모든 관련 사례를 식별할 수 있는 능력을 나타내는 척도이며, 정밀도는 실제로 올바른 긍정적 식별 비율을 의미합니다. F1 점수는 기억력과 정확성을 균형 있게 맞추는데, 두 가지가 중요할 때는 모두 중요합니다.
이 과제에 사용된 성과 측정은 매튜스 상관계수(MCC) 방정식 18과 코헨의 카파 방정식 19였습니다.

figure-protocol-24
figure-protocol-25

여기서 P0 은 관찰된 합의, Pe 는 기대 합의입니다.

MCC는 진양성과 음성, 거짓 양성, 거짓 음성을 모두 고려하는 포괄적인 분류 성능 측정입니다. 값은 -1에서 1 사이일 수 있으며, 1은 완벽한 예측, 0은 무작위 예측, -1은 예측된 라벨과 진짜 라벨 간의 완전한 불일치를 의미합니다. MCC는 불균형 데이터셋에 적용할 때 서로 다른 모델 성능 비교에 유용했으며, 학급 규모 차이와 관계없이 균형 잡힌 척도를 제공했습니다.

추가 통계 분석의 일환으로, 회상을 우선시한 F2 점수는 20식 기준으로 계산되었습니다.

figure-protocol-26

모델 성능은 평균 제곱 오차(MSE), 평균 평균제곱 오차(RMSE), 평균 절대 오차(MAE)를 사용해 정량화되었는데, 이들은 일반적으로 회귀 작업에서 측정되지만, 분류 작업에서는 방향과 상관없이 오차의 평균적 크기를 정량화하는 데 수정되었습니다.

소비자 중심 의료 기기에 ViT를 통합하는 것이 실용적인지 판단하기 위해, 우리는 모델의 시간적 효율성에만 초점을 맞춘 광범위한 성능 평가 결과를 수행했습니다. 우리는 단일 또는 여러 이미지를 예측하는 데 걸리는 시간을 보고하는 함수를 만들었는데, 이는 실시간 응용에 특히 중요해졌습니다. 각 이미지에 대해 예측을 시작하기 전에 데이터가 먼저 모델이 원하는 입력 이미지 형태로 미리 처리됩니다. 예측이 시작된 시간과 예측이 완료된 시간을 기록하여 시간과 지연 시간을 산출했습니다. 시간과 평균 잠복 시간은 각각 식(式 21)과 식(式 22)를 사용하여 계산하였습니다.

figure-protocol-27
figure-protocol-28

어디:

  • N은 이미지(샘플)의 수입니다.
  • 텐더는 i번째 이미지를 예측한 후 기록된 시간입니다.
  • tstart는 i번째 이미지를 예측하기 전에 기록된 시간입니다.

추가로 추가 노이즈와 흐림을 이미지에 도입하여 제안한 Vision Transformer 모델의 견고성을 평가하는 추가 실험이 수행되었습니다. 가우시안 노이즈는 잡음 계수가 0.4인 모든 픽셀에 추가되었고, [0,1] 범위의 픽셀 값은 클리핑되었습니다. 흐림 계수는 가우시안 흐림 기법을 통해 45× 45의 핵 크기를 가우시아 감소시켰다. 이 실험들은 시뮬레이션된 인지 이미지 품질 저하 하에서 모델을 포괄적으로 평가하도록 설계되었습니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vision Transformer 모델은 IQ-OTH/NCCD 폐암 데이터셋에서 다중 평가 지표에서 뛰어난 결과를 보여주었으며, 정상, 양성, 악성 CT 이미지를 효과적으로 구분하였습니다. 전체 모델 성능은 220장의 이미지로 구성된 테스트 데이터셋에서 98.18%의 높은 정확도를 기록했습니다. 이 매우 높은 정확도는 모델이 매우 효과적으로 일반화할 수 있음을 나타내며, 임상 환경에서 활용할 수 있음을 의미합니다.

양성 사례에 관해서는 100%의 정밀도, 89.47%의 리콜율, 94.44%의 F1 점수를 달성했습니다.

악성 사례 기준으로는 정확도 100%, 리콜율 98.37%, F1 점수 99.1...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구소는 IQ-OTH/NCCD 폐암 데이터셋에서 Vision Transformer 모델을 평가하고 높은 정확도로 구현하는 데 있어 뛰어난 성과를 거두었습니다. 이 모델을 사용하면 CT 스캔을 정상, 양성, 악성으로 분류하는 일반적인 정확도는 98.18%입니다.

이 우수한 정확도는 악성 사례 발견에서 100% 정확도를 달성하는 등 다른 주요 점수에서도 모델의 성능으로 더욱 입증되며, 이는 조기 진단과 관리에 매우 중요합니다.

심층 분석 결과, 이 모델은 정밀도 면에서도 우수할 뿐만 아니라 기억 능력과 F1 점수도 매우 우수하여 오음성이 최소화되도록 보장했는데, 이는 의료 진단에서 매우 중요한 요소입니다. 왜냐하면 놓친 상태의 비용이 치명적일 수 있기 때문입니다. 프로토콜의 여러 구성 요소가 이러한 발견에 기여했습니다. 예를 들어, 크기 조정, 정규화, 증강(무작위 회전...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충이 없다고 선언한다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 사우디아라비아 리야드에 위치한 누라 빈트 압둘라흐만 공주 공주 연구자 지원 프로젝트 번호(PNURSP2025R432)의 지원을 받았습니다.  저자들은 성장 자금 지원 프로그램 보조금 코드(NU/GP/SERC/13/575-6)에 따라 이 연구를 지원해 주신 나즈란 대학교 대학원 및 과학 연구 학장에 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
A100 GPU (CUDA)엔비디아CUDA 버전 11.6모델 학습 및 평가를 위한 GPU 가속.
AMD EPYC-7502P CPUAMD해당 없음고성능 컴퓨팅에 사용되는 프로세서입니다.
기가비트 이더넷인텔해당 없음CPS에서 피어 투 피어 간 안전한 통신을 위한 네트워킹.
매트플롯립파이썬 소프트웨어 재단버전 3.5결과 도화를 위한 시각화 라이브러리.
파이리에 암호 시스템오픈 소스 (TenSEAL을 통해 구현됨)해당 없음그라디언트에 대한 가산 준동형 암호화를 가능하게 합니다.
파이시프트오픈마이닝드버전 0.6.0차별적 프라이버시와 연합 학습 라이브러리.
파이썬 (아나콘다 배포판)아나콘다 주식회사버전 3.9사전 설치된 패키지와 환경 관리 도구를 포함하며, 스크립팅과 프레임워크 개발에 사용됩니다.
파이토치메타 AI버전 1.12학습 모델을 위한 딥러닝 프레임워크.
코르세어256 기가바이트 (GB) 집중 훈련을 위한 높은 기억력 지원.
Scikit-learn파이썬 소프트웨어 재단버전 1.1성과 평가를 위한 머신러닝 도구들.
씨본파이썬 소프트웨어 재단버전 0.11통계 데이터 시각화 라이브러리.
SSD 저장장치시게이트1 테라바이트 (TB)빠른 데이터 저장과 검색을 위해서입니다.
텐실오픈마이닝드버전 0.3안전한 집계를 위한 동형 암호화 라이브러리.
텐서플로우구글버전 2.9확산 모델을 위한 딥러닝 프레임워크.
우분투 OS정경버전 20.04 LTS모든 실험에 사용되는 운영체제.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

AI

관련 논문