연구 논문

갑상선 결절의 머신러닝 기반 분류를 위한 정량적 초고해상도 초음파 미세혈관 특징들

69 조회수

2026년 9월 11일

* These authors contributed equally

이 논문에서

요약

본 연구에서는 초고해상도 초음파 특징을 이용하여 갑상선 결절 분류를 위한 5가지 머신러닝 알고리즘을 비교하였습니다. 분석 결과 SVM이 가장 우수한 성능(정확도 68.6%, AUC 0.690)을 보였으며, 미세석회화와 조영 후 크기 증가가 주요 기여 요인으로 확인되었습니다. 다만, 임상 적용 전 외부 검증이 필요합니다.

초록

본 연구에서는 일반 초음파, 조영 증강 초음파(CEUS) 및 초고해상도 초음파(SRUS)에서 도출된 정량적 특징을 이용하여 갑상선 결절을 분류하기 위해 다섯 가지 머신러닝 알고리즘인 랜덤 포레스트(RF), 서포트 벡터 머신(SVM), 의사결정 나무(DT), eXtreme Gradient Boosting(XGBoost) 및 그래디언트 부스팅(GB)을 비교하였습니다. 후향적 연구로 진행된 이번 분석에는 63명 환자로부터 얻은 68개의 갑상선 결절(양성 30개, 유두상 갑상선암 [PTC]으로 확진된 결절 38개)이 포함되었으며, 25개의 정량적 특징을 사용하여 5-겹 환자 그룹 교차 검증(five-fold patient-grouped cross-validation)을 통해 분석함으로써 동일 환자의 모든 결절이 동일한 폴드에 할당되도록 하였습니다. 모델 성능은 각 폴드별 결과와 통합된 폴드 외(OOF) 예측값을 통해 요약되었으며, 가장 우수한 성능을 보인 SVM에 대해 순열 기반 설명자를 사용한 집중적인 OOF SHapley Additive exPlanations(SHAP) 분석을 수행하였습니다. SVM은 가장 높은 평균 정확도(0.686 ± 0.120)와 평균 수신자 조작 특성 곡선 아래 면적(ROC-AUC)(0.690 ± 0.164)을 달성하였으며, 통합 OOF 민감도는 0.842, 특이도는 0.500으로 나타났습니다. 또한, 미세석회화와 조영 후 크기 증가가 모델별 SHAP 기여도에서 가장 유의미한 요소로 확인되었습니다. RF는 균형 잡힌 성능(정확도 55.9%, 민감도 55.3%, 특이도 56.7%)을 보인 반면, DT는 정확도 0.429, ROC-AUC 0.447로 무작위 추측에 가까운 낮은 성능을 보였습니다. 본 연구는 정량적 SRUS 측정값이 기존 분류기에 통합될 수 있음을 입증하였으나, 이러한 결과는 탐색적 단계이며 임상 적용 전 더 큰 코호트를 통한 전향적, 다기관 검증이 필요합니다.

서론

갑상선 결절은 매우 흔하게 발견되는 임상적 소견으로, 무증상 집단을 대상으로 초음파 검사를 실시했을 때 검출률이 68%에 달합니다1. 최근의 메타 분석에 따르면, 갑상선 결절의 전 세계적 유병률은 2000-2011년의 21.53%에서 2012-2022년에는 29.29%로 증가하여 일반 인구의 약 4명 중 1명에게 영향을 미치고 있는 것으로 나타났습니다2,3. 이러한 결절 중 7~15%는 최종적으로 갑상선암으로 진단되며, 그중 유두형 갑상선암(PTC)이 지배적인 하위 유형을 차지합니다4,5. PTC는 모든 갑상선 악성 종양의 80~90%를 차지하며, 1975년에서 2012년 사이 발생률이 100,000명당 4.8명에서 14.9명으로 증가하며 가장 빠르게 성장하는 암 유형 중 하나가 되었습니다6.

전통적인 초음파 검사는 비침습적이고 비용 효율적이며 접근성이 뛰어난 진단 방식으로서 갑상선 결절 평가의 핵심적인 역할을 유지하고 있습니다7. 악성 종양을 시사하는 전통적인 초음파 특징으로는 뚜렷한 저에코성, 불규칙한 경계, 미세 석회화, 그리고 가로보다 세로가 긴 모양 등이 있습니다8,9. 하지만 초음파는 기본적으로 음향 회절 한계로 인해 공간 분해능이 약 100 µm로 제한된다는 한계가 있습니다10. 이러한 제한은 미세 혈관을 시각화하고 미세한 혈관 형태를 평가하는 능력을 현저히 저하시키는데, 이는 양성과 악성 갑상선 병변을 구분하는 데 매우 중요한 파라미터입니다11. 컬러 도플러 혈류 영상(CDFI)과 조영 증강 초음파(CEUS)는 혈류 검출 능력을 향상시켰으나, 유속이 1 cm/s를 초과하는 혈관만 시각화할 수 있으며 여전히 회절 한계 분해능의 제약을 받습니다12,13.

혁신적인 기술인 초해상도 초음파(SRUS)는 기존 초음파 시스템의 전통적인 회절 한계를 극복합니다14,15. SRUS는 국소화 및 추적을 위한 점 타겟으로 조영 미세기포를 활용함으로써 마이크론 단위의 공간 해상도를 구현하며, 이를 통해 전례 없는 수준의 세밀함으로 미세혈관을 시각화하고 정량화할 수 있습니다16,17. 이 기술은 미세혈관 밀도(MVD)와 미세혈관 유속(MFR)을 모두 측정할 수 있어, 비침습적 영상법으로는 정확히 달성할 수 없었던 구조적 및 기능적 평가를 제공합니다17,18. 예비 연구에 따르면 양성 갑상선 결절은 악성 결절보다 유의하게 높은 MFR을 보였으며, 평균값은 각각 16.76 ± 6.82 mm/s와 9.86 ± 4.54 mm/s로 나타났습니다19. SRUS 이미지에서 정량적 특성을 고효율로 추출하는 "초음파 미세혈관오믹스(ultrasound microvasculomics)"의 도입은 정밀하고 개인화된 미세혈관 평가의 가능성을 더욱 높여줍니다.

머신러닝(ML)은 의료 영상 분석, 특히 갑상선 결절의 특성 분석 분야에 혁신을 가져왔습니다20,21. 딥러닝 모델, 특히 합성곱 신경망(CNN)은 이전 연구들에서 0.90을 초과하는 ROC-AUC(Receiver Operating Characteristic-Area Under Curve) 값을 달성했습니다22,23,24. Random Forest(RF), Support Vector Machines(SVM), Decision Trees(DT), Gradient Boosting(GB), eXtreme Gradient Boosting(XGBoost) 등 여러 알고리즘을 결합한 앙상블 머신러닝 접근 방식은 이질적인 데이터셋 전반에서 진단 정확도와 강건성을 향상시키는 가능성을 보여주었습니다21. 최근 Habchi 등25이 종합적으로 검토한 바와 같이, 갑상선암을 위한 인공지능(AI) 분야는 시각 변환기, 대규모 언어 모델 및 하이브리드 아키텍처를 포함하는 방향으로 빠르게 확장되었으며, 이는 점점 더 복잡한 영상 기반 진단 프레임워크를 향한 해당 분야의 발전을 반영합니다.

전통적인 초음파 특성은 AI 알고리즘과 결합하여 광범위하게 연구되어 왔으나, 초고해상도 미세혈관 파라미터와 ML 모델의 조합은 여전히 거의 탐구되지 않은 상태입니다. SRUS 기술의 유망한 잠재력과 의료 영상 분야에서 기계 학습 알고리즘의 입증된 효능에도 불구하고, 몇 가지 중요한 질문들이 여전히 해결되지 않은 채 남아 있습니다. 첫째, RF 및 SVM과 같은 전통적인 알고리즘과 XGBoost 및 GB와 같은 고급 앙상블 방법 중 어떤 기계 학습 아키텍처가 SRUS 유래 미세혈관 특성에 적용되었을 때 최적의 성능을 보이는가? 둘째, 양성 갑상선 결절과 악성 결절을 구별하는 민감도, 특이도 및 전반적인 진단 정확도 측면에서 이러한 모델들은 어떻게 비교되는가? 셋째, SRUS 영상에서 추출된 미세혈관 파라미터 중 어떤 것이 분류 성능에 가장 크게 기여하는가? 이러한 질문들에 답하는 것은 SRUS 보조 갑상선 결절 진단의 임상 적용을 위한 증거 기반 프레임워크를 구축하는 데 필수적입니다.

따라서 본 연구는 초고해상도 초음파 미세혈관 영상 데이터를 이용한 갑상선 결절 분류를 위해 5가지 ML 알고리즘(RF, SVM, DT, XGBoost, GB)의 성능을 종합적으로 평가하는 것을 목표로 합니다. 이러한 접근 방식들을 체계적으로 비교하고 가장 정보 가치가 높은 미세혈관 바이오마커를 식별함으로써, 본 조사는 갑상선 결절 특성 분석을 위한 진단 패러다임을 발전시키고 종양 영상 진단에서 SRUS 기술의 임상적 유용성을 뒷받침하는 증거를 확대하는 데 기여하고자 합니다. 연구진은 사전에 지정된 25개의 변수 특징 세트가 양성 결절과 유두상 갑상선암으로 보고된 결절 사이에서 우연 이상의 판별력을 제공할 것이라고 가설을 세웠습니다. 정보 누출을 줄이기 위해 환자 그룹별 교차 검증을 사용하였으며, 선택된 분류기가 측정된 변수들을 어떻게 활용했는지 설명하기 위해 집중적인 SHAP 분석을 추가하였습니다. 두 분석 모두 탐색적으로 수행되었습니다.

프로토콜

연구 설계 및 환자군

본 후향적 연구에서는 2024년 6월 13일부터 2025년 1월 13일 사이에 실시된 갑상선 초음파 검사 결과를 분석하였습니다. 연구 프로토콜은 수도의과대학 베이징 우호병원 윤리위원회의 승인을 받았으며(승인 번호 BFHHZS20240300), 헬싱키 선언에 명시된 윤리 원칙에 따라 수행되었습니다. 후향적 설계 특성상 고지된 동의는 면제되었습니다. 데이터 세트는 63명의 환자로부터 얻은 68개의 갑상선 결절(양성 30개, 악성 38개)로 구성되었으며, 결절을 분석 단위로 설정하였습니다. 참조 진단은 초음파 유도하 세침 흡인 세포검사(FNAC)를 기반으로 하였습니다. 악성 그룹은 FNAC 결과 유두상 갑상선암으로 보고된 38개의 결절로 구성되었습니다.

선정 기준

적격 환자는 다음의 모든 기준을 충족해야 했습니다: (1) 일반적인 그레이스케일 및 도플러 초음파 검사를 거친 후, 후속 미세혈관 혈류 영상 분석이 가능할 정도로 영상 품질이 만족스러운 CEUS를 시행함; (2) 미세침 흡인 생검을 통해 PTC의 세포병리학적 진단을 받았으며, BRAFV600E 돌연변이 검사 양성 여부와 관계없이 확인됨; 또는 Bethesda Category III(의미 불명의 비정형) 세포학 결과를 보였으나 BRAFV600E 돌연변이 검사에서 양성으로 나타남; (3) BRAFV600E 돌연변이 검사 양성 반응 없이, Bethesda Category II의 양성 증식성 결절, 선종성 결절 또는 양성 여포성 결절의 세포병리학적 진단을 받음.

제외 기준

다음 조건 중 어느 하나라도 해당하는 환자는 연구에서 제외되었습니다: (1) CEUS 영상의 품질이 낮거나 미세기포 신호가 불충분하여 신뢰할 수 있는 미세혈관 혈류 평가가 불가능한 경우; (2) 세포학적 또는 병리학적 결과가 없는 경우; (3) 희귀하거나 특수한 아형의 갑상선암(예: 역분화 변이형)으로 조직병리학적 진단을 받은 경우; (4) 돌연변이 상태와 관계없이 여포성 종양(Bethesda Category IV)을 시사하는 세포학적 소견이 있거나 여포성 기원이 불분명한 병변이 있는 경우; (5) 하시모토 갑상선염

초음파, CEUS 및 SRUS 획득

모든 검사는 참조된 초음파 시스템과 선형 배열 트랜스듀서를 사용하여 수행되었습니다. 환자는 목을 신전시킨 상태로 앙와위로 누웠습니다. 대상 결절을 B-모드 초음파로 국소화하고 측정하였으며, 미세석회화 여부를 기록하였습니다. 또한, 동일한 병변 중심의 영상 평면을 사용하여 컬러 도플러로 결절 내 혈관 분포를 평가하였습니다.

정맥 경로가 확보된 후, 시스템을 낮은 기계적 지수(mechanical index)의 CEUS/URM 모드(URM은 Ultra-Resolution Microscopy 이미징을 의미함)로 전환하였습니다. SonoVue 1.2 mL를 정맥 내 볼루스 주입한 직후 5ml의 생리식염수로 플러시하여 CEUS를 수행하였으며, 볼루스 투여와 동시에 화면상의 타이머와 연속 시네 획득을 시작하였습니다. 프로브는 최소한의 압력으로 고정된 평면에 유지하였고, 환자에게는 워시인(wash-in) 및 워시아웃(wash-out) 동안 침을 삼키지 않도록 요청하였습니다.

정량적 CEUS를 위해 병변으로 제한된 관심 영역을 설정하여 시간-강도 파라미터를 도출하였습니다. SRUS의 경우, URM 워크플로우를 통해 모션 제어 후 미세 기포 신호를 국소화 및 추적하여 혈관 비율, 복잡도, 미세혈관 밀도, 관류 지수 및 혈류 속도 측정값을 생성하였습니다. 대표 이미지 내보내기 결과에서는 VSP 4, RES 2, CTR 3, SM 2, VEN 3, CPT 10 s 설정이 표시되었으며, 나머지 검사에서는 해당 설정값을 사용할 수 없었습니다.

25가지 모델 입력 변수는 표 1에 나열되어 있으며, 획득 방식에 따라 다음과 같이 그룹화되었습니다: 연령 및 성별; B-모드 미세석회화; 컬러 도플러 결절 내 혈관 분포; 정성적 CEUS; 정량적 CEUS; 그리고 11가지 SRUS 미세혈관 측정치.

특성 선택

25가지의 모든 정량적 특징을 머신러닝 모델에 유지하였습니다. 수치형 특징만을 사용하였으며, 환자 이름, 등록 번호 및 병변 크기 필드는 제외하였습니다. 데이터 기반의 특징 선택은 수행하지 않았으며, 동일하게 미리 지정된 예측 변수들을 각 분류기에 입력하였습니다.

특성 표준화

교차 검증 전에 변환, 대치 또는 전역 스케일링을 적용하지 않았습니다. 표준화는 StandardScaler 파이프라인을 통해 방사 기저 함수(radial-basis-function) SVM에만 적용되었습니다. 스케일러는 각 폴드(fold)의 훈련 노듈(training nodules)에 대해 피팅된 후, 해당 폴드의 검증 노듈(validation nodules)에 적용되었습니다. 트리 기반 분류기에는 원래의 수치 스케일이 그대로 사용되었습니다.

표준화 공식 \( z = \frac{x - \mu}{\sigma} \) 방정식, 통계적 방법.

여기서 x는 원래의 특성 값이고, µ는 훈련 폴드 평균이며, σ는 훈련 폴드 표준 편차입니다. 폴드별 전처리를 통해 검증 관측치가 SVM 스케일링 파라미터에 영향을 주는 것을 방지했습니다.

데이터 분할

주요 성능 평가는 shuffle = True 및 random_state = 42 설정을 적용한 5-겹 층화 그룹 K-폴드(StratifiedGroupKFold) 교차 검증을 사용하여 수행되었습니다. 환자 식별자를 통해 63개의 그룹을 정의하였으며, 동일한 환자로부터 얻은 모든 결절은 동일한 폴드에 할당되었습니다. 어떠한 환자의 결절도 한 폴드의 훈련 세트와 검증 세트에 동시에 포함되지 않았습니다.

모델 학습 및 검증

훈련 프로토콜

다섯 가지 분류기를 평가하였다: 랜덤 포레스트(100 trees; random_state = 42), 방사 기저 함수 SVM(C = 1.0; gamma = scale; probability = True; StandardScaler 파이프라인; random_state = 42), 결정 트리(Gini 기준; 제한 없는 깊이; random_state = 42), XGBoost(100 estimators; learning_rate = 0.3; max_depth = 6; subsample = 1.0; colsample_bytree = 1.0; random_state = 42), 그리고 그래디언트 부스팅(100 estimators; learning_rate = 0.1; max_depth = 3; random_state = 42). 그리드 탐색, 베이지안 최적화, 임계값 조정 또는 중첩 모델 선택은 수행하지 않았다.

교차 검증

5개의 환자 그룹별 폴드(fold) 각각에 대해, 모델을 나머지 환자 그룹으로 학습시키고 제외된 그룹에서 평가하였습니다. 각 폴드에 대해 정확도, 민감도, 특이도, 정밀도, F1-score 및 ROC-AUC를 계산하고 평균 ± SD로 요약하였습니다. 모든 68개 결절에 대해 OOF 예측값을 통합하여 모델별로 하나의 교차 검증된 ROC 곡선과 하나의 혼동 행렬을 생성하였습니다.

성능 평가

평가 지표

모델 성능은 각 환자 그룹별 검증 폴드 내에서, 그리고 다음의 지표를 이용한 통합 OOF 예측을 통해 평가되었습니다:

정확도: 전체 예측 중 정답의 비율

정확도 공식, ACC=(TP+TN)/(TP+TN+FP+FN), 통계적 측정 방정식.

민감도 (재현율): 실제 악성 결절 중 정확하게 식별된 비율

SEN= 수식이 포함된 분광법 방법; 흡수-방출 도표; 광학 연구 설정.  데이터 분석을 위한 정밀도 수식 (TP/TP+FN).

특이도: 실제 양성 결절을 정확하게 식별한 비율

특이도 공식: SPE = TN/(TN+FP), 방정식, 통계 분석, 진단 성능.

정밀도(양성 예측도): 예측된 악성 사례 중 실제로 악성인 사례의 비율

양성 예측도 공식, PPV 계산, 진양성(TP) 및 위양성(FP)을 이용한 방정식.

F1-Score: 정밀도와 재현율의 조화 평균

F1 스코어 공식 F1=2(Precision×Recall)/(Precision+Recall), 수학 방정식.

수신자 조작 특성 곡선 아래 면적 (ROC-AUC): 모든 분류 임계값에서 양성 결절과 악성 결절을 판별하는 모델의 능력을 측정하는 지표

여기서 TP = 진양성(정확하게 식별된 악성 결절), TN = 진음성(정확하게 식별된 양성 결절), FP = 위양성(악성으로 잘못 분류된 양성 결절), FN = 위음성(양성으로 잘못 분류된 악성 결절)입니다.

혼동 행렬 분석

OOF 혼동 행렬은 해당 환자가 제외된 폴드에서만 생성된 각 결절에 대한 예측값을 통합하여 생성되었습니다. 따라서 각 결절은 다른 환자의 결절들로 학습된 모델로부터 예측값을 제공받았습니다.

특성 중요도 분석

Random Forest 모델의 경우, 모든 결정 트리에 걸친 Gini 불순도(Gini impurity)의 평균 감소량을 기반으로 특성 중요도 점수를 산출하였습니다. 분류 성능에 가장 크게 기여한 미세혈관 파라미터를 결정하기 위해 상위 15개의 가장 중요한 특성을 식별하고 순위를 매겼습니다.

탐색적 SHAP 분석

SVM에 대해 순열 기반 설명자(permutation-based explainer)를 이용한 집중적인 OOF SHAP 분석을 수행하였습니다. 제외된 각 결절에 대해, 해당 훈련 폴드 관측치만을 배경 분포로 사용하였습니다(128가지 대칭 순열; random seed = 20260716). 평균 절대 SHAP 값으로 기여도의 크기를 요약하였으며, 부호가 있는 값으로 방향을 나타냈습니다. 본 분석은 탐색적 분석이며, 인과 관계를 추론하거나 독립적인 바이오마커를 식별하거나 임상적 임계값을 정의하는 데 사용되지 않았습니다.

통계 분석

비교 분석

모델 성능은 5개의 환자 그룹별 검증 폴드와 통합 OOF 예측을 통해 기술적으로 요약되었습니다. 폴드 간의 연관성이 있고 코호트 규모가 작기 때문에, 모델 간의 공식적인 가설 검정이나 P-값 기반의 순위 산정은 수행하지 않았습니다.

기초 그룹 비교를 위해, Shapiro-Wilk 검정을 사용하여 각 결과 그룹 내 연속 변수의 정규성을 평가하였습니다. 두 그룹 모두 정규성을 만족하는 경우에는 Welch's t 검정을 사용하였으며, 그렇지 않은 경우에는 양측 Mann-Whitney U 검정을 사용하였습니다. 범주형 변수는 Pearson의 카이제곱 검정으로 평가하였으며, 데이터가 적은 2 x 2 분할표의 경우 Fisher의 정확 검정을 사용하였습니다. P 값은 양측 검정이며, 탐색적 분석을 위해 보정되지 않은 값(alpha = 0.05)을 사용하였습니다.

재현성

재현성은 특정 환자군 정의, 고정된 랜덤 시드(42), 고정된 분류기 설정 및 폴드별 전처리를 통해 지원되었습니다. 식별자는 그룹화 용도로만 사용되었으며, 예측 변수로 입력되거나 모델 출력값과 함께 내보내지 않았습니다.

결과

환자 특성 및 연구 대상군

총 63명의 환자로부터 얻은 68개의 갑상선 결절이 포함되었으며, 이는 30개의 양성 결절과 38개의 PTC로 구성되었습니다. 분석 단위는 결절로 설정하였으며, 환자 그룹화를 통해 동일 환자의 결절이 훈련 세트와 검증 세트에 동시에 포함되지 않도록 하였습니다. 기초 특성은 표 2에 요약되어 있습니다.

그림 1은 대표적인 양성 결절과 초음파 유도하 세침 흡인 세포검사(FNAC) 결과 유두상 갑상선암(PTC)으로 보고된 결절에서 기술적으로 성공적으로 구현된 병변 제한적 SRUS/URM 재구성 영상을 보여줍니다. 두 예시 모두 병변의 윤곽, 재구성된 미세혈관 지도 및 장치에서 생성된 정량적 오버레이를 나타냅니다. 이러한 예시들은 두 참조 클래스 모두에서 성공적인 획득 및 재구성이 이루어졌음을 보여주지만, 그 자체만으로는 진단적 분리나 모델 성능을 입증하지는 않습니다.

68개 결절 데이터셋에 대해 환자 그룹별 5겹 교차 검증(five-fold patient-grouped cross-validation)을 사용하여 5가지 분류기를 평가했습니다. 성능 지표는 각 폴드(fold)의 평균 ± 표준편차(SD) 및 통합 OOF(Out-of-Fold) 값으로 보고되었습니다. 표 3. 그림 2, 그림 3그림 4 OOF ROC 곡선, 그룹화된 폴드 메트릭 요약 및 OOF 혼동 행렬을 표시하십시오.

그림 4는 풀링된 OOF 혼동 행렬을 보여주며, 여기에서 각 결절은 동일한 환자의 결절이 제외된 상태로 학습된 모델에 의해서만 예측되었습니다. SVM은 38개의 악성 결절 중 32개를 정확하게 분류했으나(민감도 0.842), 30개의 양성 결절 중 15개를 악성으로 오분류했습니다(특이도 0.500). 결정 트리는 위음성 및 위양성 분류 횟수가 가장 많았습니다. 이러한 패턴은 정확도만으로는 불충분한 이유를 보여주며, 성공적인 결과와 최적이지 않은 결과를 모두 예시합니다.

집중 분석된 OOF SHAP 분석(그림 5 표 4)에서, 미세석회화와 조영 후 확대가 SVM 악성 확률에 가장 큰 모델 특이적 기여를 하였으며, 조영 증강 균질성과 성별이 그 뒤를 이었습니다. 이러한 결과는 적합된 SVM이 본 코호트의 측정 변수들을 어떻게 활용했는지를 설명하며, 독립적인 임상적 중요성을 입증하는 것은 아닙니다.

데이터 가용성 성명서

본 논문의 근거가 되는 데이터는 교신 저자에게 합리적으로 요청할 경우 공유될 것입니다.

밀도 분석 및 혈관 비율이 포함된 양성 결절 및 유두상 갑상선암 초음파 이미지
그림 1. 병변 제한적 SRUS/URM 대표 이미지. (A) 양성 갑상선 결절. (B) 초음파 유도하 FNAC 결과에 따른 유두상 갑상선암. 각 패널은 병변의 윤곽과 장치에서 생성된 정량적 오버레이가 포함된 해당 미세혈관 재구성 영상을 보여줍니다. 이 예시들은 성공적인 획득 및 재구성 과정을 보여주며, 진단 정확도를 추정하는 데 사용되지 않았습니다. 약어: SRUS = 초고해상도 초음파; URM = 초고해상도 현미경 영상; FNAC = 미세침 흡인 세포검사. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

진양성률 대비 위양성률을 비교하는 ROC 곡선; 머신러닝 알고리즘 성능 도표.
그림 25가지 분류기에 대한 환자 그룹별 OOF ROC 곡선. 각 곡선은 결절당 하나의 홀드아웃(held-out) 예측치를 요약하며, 점선 대각선은 무작위 판별 수준을 나타냅니다. 약어: RF = Random Forest; SVM = Support Vector Machine; DT = Decision Tree; XGB = eXtreme Gradient Boosting; GB = Gradient Boosting; OOF = Out-of-fold; ROC-AUC = Receiver Operating Characteristic-Area Under Curve. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

머신러닝 모델 성능 차트: 정확도, 민감도, 특이도, 정밀도, F1, ROC-AUC.
그림 3. 5개의 환자 그룹 검증 폴드에 걸친 정확도, 민감도, 특이도, 정밀도, F1-score 및 ROC-AUC의 평균 ± SD.약어: SD = 표준 편차; ROC-AUC = 수신자 조작 특성-곡선 아래 면적. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

머신러닝 모델의 혼동 행렬 비교: random forest, SVM, decision tree, XGBoost.
그림 4. 환자 그룹별 OOF 혼동 행렬. 행은 참조 클래스를, 열은 예측 클래스를 나타냅니다. 각 결절은 동일한 환자의 결절이 전혀 포함되지 않은 상태로 학습된 모델에 의해 예측되었습니다. 약어: OOF = Out-of-fold. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

SVM 분석을 위한 SHAP 값 막대 그래프 및 산점도; 전역 중요도, 개별 설명.
그림 5. 순열 기반 설명자를 이용한 SVM의 OOF SHAP 분석. (A) 평균 절대 SHAP 값 상위 10개를 순위별로 나열함. (B) 68개의 홀드아웃 예측값에 대해 동일한 변수들의 부호가 포함된 SHAP 값. 약어: OOF = Out-of-fold; SHAP = SHapley Additive exPlanations; SVM = Support Vector Machine; MVD = 미세혈관 밀도. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

획득 소스예측 인자모델 취급
인구통계학적 특성연령; 성별수치형 워크시트 변수; 두 변수 모두 사전에 지정된 모델 입력값으로 유지됨.
B-모드 초음파미세석회화수치형 워크시트 변수; 전역 스케일링 없음.
컬러 도플러결절 내 혈관성(혈류)B-모드 예측 인자가 아닌 컬러 도플러로 분류됨.
정성적 CEUS조영 후 확대; 조영 증강 양상; 조영 증강 균질성수치형 워크시트 변수; 사전 지정된 입력값으로 유지됨.
정량적 조영증강 초음파(CEUS)AUC, 피크 강도, 피크 도달 시간, 도착 시간, 상승 시간, 평균 통과 시간, 반-피크 강도 도달 시간7개의 시간-강도 곡선 변수; 결측치 대체 또는 전역 스케일링 미적용.
SRUS 미세혈관혈관 비율, 복잡도, MVD 최대값/최소값/평균값/표준편차, 관류 지수, 혈류 속도 최대값/최소값/평균값/표준편차11가지 미세혈관 변수; 사전 특성 선택 없음.

표 1: 정량적 변수 및 전처리. 사전에 지정된 25개의 예측 변수는 획득 소스별로 그룹화되었습니다: 연령 및 성별; B-모드 미세석회화; 컬러 도플러 결절 내 혈관 분포; 정성적 및 정량적 CEUS 측정치; 그리고 SRUS 미세혈관 측정치. 성명, 등록 ID 및 병변 크기 필드는 제외되었습니다. 25개 변수 행렬에서 누락된 값은 없었습니다. 환자 식별 정보는 그룹화 용도로만 사용되었습니다. StandardScaler는 SVM 훈련 폴드 내에서만 적용되었습니다. 약어: CEUS = 조영증강 초음파; SRUS = 초고해상도 초음파; SVM = 서포트 벡터 머신.

획득 소스특성양성 결절악성 결절P 값
(n = 30)(n = 38)
인구통계학적 특성연령, years48 (42, 55)48 (41, 52)0.551
인구통계학적 특성성별, n (%)0.012
인구통계학적 특성  여성26 (86.7%)27 (71.1%)
인구통계학적 특성  남성4 (13.3%)11 (28.9%)
B-모드 초음파
B-모드 초음파미세석회화, n (%)0.001
B-모드 초음파  없음12 (40.0%)2 (5.3%)
B-모드 초음파  있음18 (60.0%)36 (94.7%)
컬러 도플러혈류, n (%)0.1
컬러 도플러  없음7 (23.3%)8 (21.1%)
컬러 도플러  있음23 (76.7%)30 (78.9%)
정성적 CEUS조영 후 확대, n (%)0.001
정성적 CEUS  아니오16 (53.3%)5 (13.2%)
정성적 CEUS  예14 (46.7%)33 (86.8%)
정성적 CEUS조영 증강의 균질성, n(%)0.087
정성적 CEUS  불균질함11 (36.7%)23 (60.5%)
정성적 CEUS  균질함19 (63.3%)15 (39.5%)
정성적 CEUS조영 증강 패턴, n (%)
정성적 CEUS  저조영 증강18 (60.0%)20 (52.6%)
정성적 CEUS  등조영 증강3 (10.0%)0 (0.0%)
정성적 CEUS  고조영 증강9 (30.0%)18 (47.4%)
정량적 CEUS
정량적 CEUS곡선 하 면적 (AUC), dB·s3255.49 (2457.15, 4048.94)3620.76 (3096.36, 4066.75)0.201
정량적 CEUS최고 강도 (PI), dB48.93 (40.93, 55.78)50.22 (42.49, 56.82)0.621
정량적 CEUS최고 도달 시간 (TTP), s17.78 (16.47, 19.30)20.42 (17.53, 23.47)0.045
정량적 CEUS도착 시간 (AT), s9.88 (8.23, 11.53)9.88 (8.64, 11.53)0.1
정량적 CEUS상승 시간 (RT), s8.43 (6.92, 9.55)9.55 (7.00, 12.11)0.164
정량적 CEUS평균 통과 시간 (MTT), s69.38 (60.17, 87.84)82.82 (64.22, 99.15)0.102
정량적 CEUS반최고 강도 도달 시간 (THP), s81.62 (70.53, 99.93)95.34 (73.60, 109.44)0.157
SRUS 미세혈관
SRUS 미세혈관혈관 비율, %56.29 (43.34, 71.44)57.81 (41.49, 70.24)0.772
SRUS 미세혈관복잡도 수준1.68 (1.59, 1.73)1.62 (1.57, 1.69)0.083
SRUS 미세혈관미세혈관 밀도—최대15.24 (10.59, 17.88)13.28 (9.60, 15.92)0.142
SRUS 미세혈관미세혈관 밀도—최소0.07 (0.05, 0.07)0.06 (0.04, 0.07)0.385
SRUS 미세혈관미세혈관 밀도—평균6.20 (3.46, 7.45)4.71 (3.74, 6.78)0.161
SRUS 미세혈관미세혈관 밀도—SD3.15 (2.12, 3.64)2.56 (1.94, 3.04)0.085
SRUS 미세혈관관류 지수6.81 (4.53, 9.05)7.12 (4.52, 9.90)0.666
SRUS 미세혈관최대 혈류 속도, mm/s25.13 (22.24, 26.43)26.32 (23.86, 28.00)0.152

표 2: 30개의 양성 및 38개의 악성 갑상선 결절의 기선 특성. 양성(n = 30) 및 악성(n = 38) 결절의 기선 인구통계학적 및 영상학적 특성. 값은 n (%) 또는 중앙값(사분위 범위)으로 표시됨. 참조 라벨은 초음파 유도하 세침흡인세포검사(FNAC)에 따라 할당되었으며, 수술 후 조직병리 결과는 이용 가능하지 않았음. 약어: EUS = 조영증강 초음파; SRUS = 초고해상도 초음파.

분류기정확도민감도특이도정밀도F1-스코어ROC-AUC
랜덤 포레스트층화 그룹 K-폴드 교차 검증 (StratifiedGroupKFold validation)0.548 ± 0.1760.573 ± 0.2970.572 ± 0.1050.603 ± 0.1390.555 ± 0.2040.633 ± 0.137
풀링된 OOF (pooled OOF) 0.5590.5530.5670.6180.5830.579
서포트 벡터 머신(SVM)계층적 그룹 K-폴드 교차 검증0.686 ± 0.1200.850 ± 0.1800.495 ± 0.2040.678 ± 0.1540.740 ± 0.1180.690 ± 0.164
풀링된 OOF (Out-of-Fold) 0.6910.8420.50.6810.7530.655
의사결정나무층화 그룹 K-폴드(StratifiedGroupKFold) 검증0.429 ± 0.0730.492 ± 0.2290.402 ± 0.2470.514 ± 0.1690.468 ± 0.1170.447 ± 0.073
풀링된 OOF (Out-Of-Fold) 0.4260.4740.3670.4860.480.42
XGBoost계층화 그룹 K-폴드 교차 검증(StratifiedGroupKFold validation)0.541 ± 0.1510.494 ± 0.1970.595 ± 0.1370.587 ± 0.2280.530 ± 0.2020.571 ± 0.163
풀링된 OOF (Out-of-Fold) 0.5440.50.60.6130.5510.594
그라디언트 부스팅층화 그룹 K-폴드 교차 검증 (StratifiedGroupKFold validation)0.544 ± 0.0990.500 ± 0.0910.550 ± 0.2130.624 ± 0.0870.546 ± 0.0530.579 ± 0.124
풀링된 OOF (Out-of-Fold) 0.5440.50.60.6130.5510.555

표 3: 5-겹 환자 그룹 교차 검증 성능 및 통합 OOF 성능. 동일한 환자의 모든 결절은 동일한 폴드에 할당되었습니다. 값은 5개의 StratifiedGroupKFold 검증 폴드에 대한 평균 ± 표준편차(SD)입니다. 68개의 결절은 63명의 환자 그룹에서 추출되었으며, 각 폴드에서는 12~13명의 환자 그룹으로부터 12~5개의 결절을 제외했습니다. 각 통합 OOF 값은 해당 환자의 모든 결절이 제외된 검증 폴드에서 생성된 결절당 하나의 예측값을 사용합니다. 그림 3에서 이에 상응하는 통합 OOF 혼동 행렬을 보고합니다. 약어: OOF = out-of-fold; SVM = Support Vector Machine.

순위특징평균 |SHAP|평균 |SHAP|의 표준편차 배수
1미세석회화0.03570.023
2조영 후 확대0.03310.0165
3강화 균질성0.02070.008
4성별0.01940.0109
5유속 표준편차(SD)0.01590.01
6MVD 의미0.01240.0086
7평균 통과 시간0.01180.0069
8최소 유속0.01070.0061
9강조 패턴0.01030.0112
10미세혈관 밀도 표준편차0.01020.0077

표 4: SVM에 대한 글로벌 OOF SHAP 특성 순위. SHAP 값은 SVM 악성 확률에 대한 기여도를 정량화한다. 각 결절은 환자 그룹별로 구분된 홀드아웃 검증 폴드에서 한 번씩 설명되었다. 글로벌 값은 68개 OOF 설명에 대한 평균 절대 SHAP 값이며, 폴드 SD는 5개 폴드에 걸친 폴드별 평균 절대값의 표준편차(SD)이다. 순위는 모델별 탐색적 요약이며 인과 관계, 독립적 바이오마커 또는 임상적 임계값이 아니다. 약어: OOF = out-of-fold; SVM = Support Vector Machine; MVD = 미세혈관 밀도; SHAP = SHapley Additive exPlanations.

토론

갑상선 결절의 현재 진단 방법은 주로 전통적인 초음파 검사에 의존하고 있으나, 이는 본질적으로 검사자의 숙련도에 따라 결과가 달라지는 검사자 간 변동성이 있으며5 회절 한계 미만의 미세혈관을 시각화할 수 없다는 한계가 있습니다. 저희가 알기로, 본 연구는 초고해상도 초음파(SRUS) 미세혈관 영상 데이터에 적용된 여러 머신러닝 알고리즘에 대한 첫 번째 종합적 평가이며, 이를 통해 연구 환경에서 갑상선 결절 내 PTC 위험도에 대한 객관적인 정량적 평가를 달성하였습니다.

이 연구의 주요 기여는 국소화 기반의 조영 마이크로버블 SRUS 측정값을 B-모드 초음파, 컬러 도플러, 정성 및 정량적 CEUS, 그리고 임상 변수와 통합하여 갑상선 결절을 분류하는 환자 수준의 분석 프레임워크를 제시했다는 점입니다. 본 연구의 독창성은 새로운 분류기 아키텍처를 개발한 것이 아니라, 실험적으로 측정된 미세혈관 정보를 사전 정의된 25개 변수의 다중 모달 특성 세트에 통합하고, 누출 방지 환자 그룹화 방식을 통해 이를 평가했다는 점에 있습니다. 동일한 환자의 모든 결절은 단일 폴드(fold)에 유지되었으며, SVM 스케일러는 각 학습 폴드에만 적합되었고, 모델 평가에는 5-폴드 환자 그룹화 검증, 통합 OOF 예측 및 집중적인 OOF SHAP 분석이 사용되었습니다. 이 프레임워크 내에서 SVM은 가장 높은 평균 정확도(0.686 ± 0.120)와 평균 ROC-AUC(0.690 ± 0.164)를 보였으나, 통합 OOF 특이도는 0.500에 불과했으며 폴드 간 성능 차이가 있었습니다. 종합적으로, 이러한 결과는 미세혈관 및 전통적인 초음파 데이터를 환자 수준에서 평가하는 재현 가능한 접근 방식을 확립하는 동시에, 실제 임상 적용 전에 추가적인 개선이 필요한 부분을 명시합니다.

이전의 갑상선 연구를 통해 조영제 마이크로버블 SRUS의 타당성이 입증되었으며, 24개의 결절로 구성된 파일럿 코호트에서 미세혈관 흐름의 그룹 간 차이가 보고된 바 있습니다26. 본 연구는 세 가지 구체적인 측면에서 이러한 영상화 타당성 입증을 확장합니다. 첫째, SRUS 기반의 혈관 밀도, 혈류 속도 및 관류 측정값을 단독 SRUS 비교가 아닌 B-모드 미세석회화, 컬러 도플러 결절 내 혈관 분포, 정성 및 정량 CEUS, 그리고 연령 및 성별과 함께 분석하였습니다. 둘째, 전처리 및 검증 전 과정에서 환자를 구분 단위로 처리하여, 동일 환자의 결절이 훈련 데이터와 검증 데이터에 동시에 나타나는 것을 방지하였습니다. 셋째, 동일한 환자 그룹화 프레임워크를 사용하여 모델 성능을 풀링된 OOF 예측 및 집중적인 OOF SHAP 분석과 연결하였습니다. 이러한 요소들을 종합하여 데이터 획득, 정량적 미세혈관 특성 분석, 모델 평가 및 설명을 하나의 재현 가능한 워크플로우로 연결함으로써, 향후 연구의 기반이 될 토대를 제공합니다.

우리는 악성 갑상선 결절 진단에 AI 및 딥러닝을 적용한 다수의 최근 연구들을 확인하였습니다. 우리의 접근 방식과 이러한 연구들을 차별화하는 것은 유용합니다. Feng 등은 수술 전 유두상 갑상선 암 위험 층별화를 위한 다기관, 다중 모달 모델을 개발하였으며27, Gatta 등은 일반적인 갑상선 초음파 영상을 기반으로 양성 대 악성 진단을 위해 외부적으로 평가된 머신러닝 모델들을 통합하였습니다28. Li 등은 결절 국소화를 위해 일반 초음파에 계산적 단일 이미지 초해상도를 적용하였으며29, He 등은 진단 불가(Bethesda I) FNA 결과를 예측하기 위해 GAN으로 강화된 B-모드 라디오믹스를 사용하였습니다30. 기하학 인식, 전이 학습 및 Transformer 기반 접근 방식은 갑상선 초음파 연구의 알고리즘적 다양성을 더욱 잘 보여줍니다31. 이러한 연구들은 일반적인 초음파 영상, 다중 모달 임상 또는 영상 변수, 또는 계산적으로 강화된 이미지 표현을 사용하며, 주입된 조영 미세 기포를 국소화하거나 병변 수준의 미세혈관 밀도 및 혈류를 직접적으로 정량화하지는 않습니다. Habchi 등은 일반 갑상선 초음파 영상에 VGG19 기반 전이 학습 프레임워크를 적용하여 공개 데이터셋에서 높은 분류 정확도를 보고하였습니다32. 그들의 연구는 이 분야에서 딥러닝의 잠재력을 입증했지만, 오직 B-모드 이미지 특성에만 의존하였습니다.

이와 비교하여, 본 연구의 구체적인 기여점은 국소화 기반 SRUS를 사용하여 실험적으로 측정된 미세혈관 변수를 획득하고, 이를 기존 초음파 및 CEUS 특징과 통합하여 환자 그룹별로 평가했다는 점입니다. 인용된 연구들은 입력값, 종점, 참조 표준 및 검증 설계가 서로 다르기 때문에 직접적인 성능 비교 대상이라기보다 상호 보완적인 관계로 유지되며, 우리는 이러한 상호 보완성이 위험 성층화를 개선하기 위한 여러 독립적인 경로를 제시한다는 점에서 강점이라고 생각합니다. 특히, 우리의 연구 결과는 Habchi 등이 제안한 기하학 인식 Bandelet Transform 프레임워크31나 Xu 등의 전이 학습 벤치마크와 같은 딥러닝 기반 접근 방식과도 상호 보완적입니다. 이러한 방식들은 정량적 혈역학적 바이오마커보다는 전통적인 B-모드 이미지 분류에 집중하고 있으며33, 이는 종양 생물학의 서로 다른 측면을 포착하는 근본적으로 다른 입력 모달리티입니다.

연구 결과, 다섯 가지 평가 분류기의 성능에서 유의미한 차이가 나타났습니다. SVM은 평균 정확도(0.686 ± 0.120)와 ROC-AUC(0.690 ± 0.164) 측면에서 가장 우수한 성능을 보였으며, 교차 검증에서 표준 편차가 가장 낮아 소규모 샘플 작업에서 견고한 성능을 입증했습니다. 풀링된 OOF 검증을 통해 SVM의 민감도가 84.2%(악성 결절 38개 중 32개를 정확히 식별)였으며, F1 스코어는 0.753으로 모든 모델 중 가장 높았음이 확인되었습니다. 진단 누락이 심각한 결과로 이어질 수 있다는 점에서 이러한 강력한 검출 능력은 임상 현장에서 매우 큰 가치를 가집니다. 하지만 특이도는 50.0%(양성 결절 30개 중 15개를 오분류)에 불과했으며, 이러한 패턴은 신중한 해석이 필요합니다. 이러한 낮은 특이도는 본 데이터셋의 고차원적 특성(25개의 예측 변수 대 30개의 양성 샘플)을 반영하는 것으로 보입니다. 이와 같이 희소한 특성 공간에서는 SVM의 결정 경계가 악성과 유사한 미세혈관 특성을 가진 소수의 양성 결절에 의해 불균형하게 영향을 받게 되며, 이로 인해 분류기는 위음성을 최소화하기 위해 모호한 사례를 악성으로 라벨링하는 보수적인 전략을 취하게 됩니다. 임상적 관점에서 이러한 트레이드오프는 스크리닝 시나리오에서 수용 가능합니다. PTC 진단을 놓쳤을 때의 결과가 불필요한 FNAC를 시행했을 때보다 훨씬 더 심각할 수 있기 때문입니다. 향후 연구에서는 특히 양성 샘플을 더 많이 추가하여 더 큰 샘플 코호트를 우선적으로 확보하고, 민감도를 유지하면서 특이도를 개선하기 위해 비용 민감 학습(cost-sensitive learning)이나 차원 축소 방법을 다시 시도하는 것이 바람직합니다.

RF는 SVM보다 낮은 평균 정확도(0.548 ± 0.176)를 보였습니다. 그러나 RF는 균형 잡힌 통합 OOF 성능(정확도 55.9%, 민감도 55.3%, 특이도 56.7%)을 나타냈으며, 이는 임상 의사결정 지원 시스템에서 가치 있는 결과입니다. 불순도 기반 중요도 분석 결과, mean MVD, mean flow-velocity, perfusion index가 주요 변수로 순위에 올라 유의미한 SRUS 신호를 나타냈습니다. XGBoost와 Gradient Boosting의 성능은 중간 수준이었으며, 두 모델 모두 RF를 능가하지 못했습니다. 이는 제한된 표본 크기(n = 68)와 보수적인 정규화로 인한 하이퍼파라미터 민감도 때문인 것으로 보입니다. DT는 성능이 낮게 나타났으며(정확도 0.429, ROC-AUC 0.447), 이는 단일 트리 과적합으로 인해 무작위 추측에 가까운 결과가 나온 것으로 예상됩니다. 요약하자면, 민감도 극대화가 우선순위일 때는 SVM이 선호되며, 균형 잡힌 성능과 해석 가능성 측면에서는 RF가 장점을 가집니다. 두 모델 모두 추가적인 연구가 필요합니다.

집중 분석된 SHAP 분석 결과, 미세석회화, 조영 후 크기 증가, 조영 증강 균질성이 상위 3가지 예측 인자로 확인되었으며, 성별과 혈류 속도 표준 편차, 평균 MVD 및 평균 통과 시간을 포함한 SRUS 파라미터가 그 뒤를 이었습니다. 전통적인 특징들이 지배적이지만, SRUS 파라미터는 독립적인 추가 정보를 제공합니다. SRUS 지표의 중요성은 해당 기술의 물리적 장점과 일치합니다. 전통적인 도플러의 분해능은 ~200–300µm로 제한되는 반면, SRUS는 ~10 µm의 분해능을 달성할 수 있습니다. Zhang 등은 악성 결절이 더 낮은 혈류 속도(9.86 vs. 16.76 mm/s, p < 0.01)와 MVD를 가진다는 것을 확인했으며19, 이는 PTC의 섬유성 및 림프관 우세 생물학적 특성을 반영합니다. 본 연구의 SHAP 결과는 생물학적으로 타당하며, TI-RADS 기준과의 일치성은 임상적으로 유의미한 패턴 학습을 뒷받침합니다8.

정확한 위험 층화는 환자 치료 및 임상적 의사결정에 중요한 영향을 미칩니다. SRUS 영상의 ML 분석을 통해 고위험 결절을 식별할 수 있다면, 환자는 보다 적시에 FNAC를 받을 수 있어 불안감을 줄이고 암의 진행을 예방할 수 있습니다. 반면, 선택된 저위험 결절은 초음파로 추적 관찰할 수 있습니다. 정량적 미세혈관 측정값은 향후 이러한 과정에서 기존의 관찰법을 보완할 수 있을 것입니다. 하지만 본 연구에서는 분류기 출력값이 의사의 성능을 향상시키는지, 불필요한 FNAC 절차를 줄이는지 또는 환자의 예후를 변화시키는지 테스트하지 않았습니다. 따라서 모델 출력값을 아직 임상적 의사결정의 지침으로 사용해서는 안 됩니다. 대신, 이를 원리 증명을 입증하고 전향적 평가의 토대를 제공하는 연구용 도구로 간주해야 합니다. 분석 시, 단일 환자의 모든 결절은 동일한 폴드(fold) 내에 유지되어야 하며, 전처리는 해당 폴드의 훈련 데이터 부분만을 사용하여 적합시켜야 합니다.

몇 가지 제한 사항을 고려해야 합니다. 첫째, 본 연구는 외부 검증 없이 63명의 환자로부터 얻은 68개의 결절을 대상으로 한 단일 센터 후향적 연구였으며, 표본 크기가 작아 과적합(overfitting)의 위험이 높아질 수 있습니다. 그럼에도 불구하고, 환자 그룹별 교차 검증을 통해 어느 정도의 신뢰성을 확보하였습니다. 둘째, 모든 참조 라벨은 수술 후 조직병리학적 검사가 아닌 초음파 유도하 세침흡인세포검사(FNAC)를 통해 도출되었습니다. FNAC는 세포학적 증거를 제공하지만 수술 후 조직학적 확인과 동일하지 않으며, 특히 양성으로 분류된 결절에서 분류 오류를 유발할 수 있습니다. 다만, 본 연구에서는 양성 결절의 범위를 제한하고 모든 결절에 대해 BRAFV600E 유전자 검사를 수행하였습니다. 셋째, 악성 그룹은 FNAC에서 PTC로 보고된 결절로 제한되어, 다른 갑상선 악성 종양에 대한 일반화 가능성이 제한적입니다. 넷째, 추가적인 임상 요인(갑상선 기능, 가족력)이 체계적으로 수집되지 않았습니다. 마지막으로, 체계적인 하이퍼파라미터 최적화, 보정 분석 또는 독립적인 이미지 기반 딥러닝 비교가 수행되지 않았습니다. 이러한 제한 사항에도 불구하고, 본 연구 결과의 생물학적 타당성과 기존 문헌과의 일관성은 결과의 유효성에 대한 신뢰를 제공합니다. 향후 연구에서는 다음 사항들이 우선적으로 고려되어야 합니다: (1) 수술 후 조직병리학적 검사를 포함한 더 큰 코호트에서의 전향적 다기관 검증, (2) SRUS를 탄성 초음파 및 일반 초음파와 통합하는 다중 모달 융합(multimodal fusion), (3) 혈청 바이오마커, 표준화된 획득 프로토콜 및 품질 관리 기준34, 그리고 특성 공학(feature engineering) 최적화입니다.

결론적으로, 본 연구는 갑상선 결절의 탐색적 분류를 지원하기 위해 정량적 SRUS 미세혈관 측정값에 기존의 머신러닝 알고리즘을 적용하는 것이 가능함을 입증하였습니다. SVM은 높은 민감도를 보였으나 특이도는 제한적이었으며, 이는 진단 대체제가 아닌 선별 검사 보조 도구로서의 잠재적 역할을 뒷받침합니다. 비록 예비 연구 단계이지만, 본 연구 결과는 재현 가능하고 데이터 누출이 없는 평가 파이프라인을 구축하였으며, 향후 더 큰 코호트를 통한 전향적 검증이 필요함을 시사합니다.

공개 사항

저자들은 선언할 이해관계 충돌이 없습니다.

감사의 글

저자들은 환자 데이터 수집을 도와주신 수도의과대학 베이징 우호병원의 초음파과 직원분들께 감사드립니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Decision Tree 분류기scikit-learnVersion 1.5.2머신러닝 분류기
미세침 흡인 생검 바늘초음파 유도 하 FNAC에 사용
Gradient Boosting 분류기scikit-learnVersion 1.5.2머신러닝 분류기
정맥 카테터조영제 투여에 사용
PythonPython Software FoundationVersion 3.11.9머신러닝 분석에 사용된 프로그래밍 언어
Random Forest 분류기scikit-learnVersion 1.5.2머신러닝 분류기
SHAP (permutation explainer)SHAP DevelopersVersion 0.46.0모델 설명 가능성 분석
SonoVue 조영제BraccoCEUS/SRUS 영상을 위한 초음파 조영제
StandardScalerscikit-learnVersion 1.5.2SVM 파이프라인을 위한 특성 표준화
멸균 생리식염수조영제 주입 후 정맥 플러싱에 사용
StratifiedGroupKFoldscikit-learnVersion 1.5.2환자 그룹화 교차 검증
Support Vector Machine (SVM) 분류기scikit-learnVersion 1.5.2방사 기저 함수(Radial-basis-function) 커널 분류기
U5-15LE 리니어 어레이 트랜스듀서VINNO TechnologyU5-15LE리니어 초음파 프로브
ULTIMUS 9E 초음파 시스템VINNO TechnologyULTIMUS 9EB-모드, 컬러 도플러, CEUS 및 SRUS 영상에 사용된 초음파 영상 시스템
XGBoostXGBoost DevelopersVersion 2.1.1그라디언트 부스팅 프레임워크

참고문헌

  1. Mu C, et al. Mapping global epidemiology of thyroid nodules among general population: a systematic review and meta-analysis. Front Oncol. 2022;12:1029926.
  2. Moon JH, et al. Prevalence of thyroid nodules and their associated clinical parameters: a large-scale, multicenter-based health checkup study. Korean J Intern Med. 2018;33(4):753-62.
  3. Dean DS, Gharib H. Epidemiology of thyroid nodules. Best Pract Res Clin Endocrinol Metab. 2008;22(6):901-11.
  4. Uppal N, Collins R, James B. Thyroid nodules: global, economic, and personal burdens. Front Endocrinol (Lausanne). 2023;14:1113977.
  5. Durante C, et al. The diagnosis and management of thyroid nodules: a review. JAMA. 2018;319(9):914-24.
  6. Lim H, Devesa SS, Sosa JA, Check D, Kitahara CM. Trends in thyroid cancer incidence and mortality in the United States, 1974-2013. JAMA. 2017;317(13):1338-48.
  7. Gharib H, et al. American Association of Clinical Endocrinologists, American College of Endocrinology, and Associazione Medici Endocrinologi medical guidelines for clinical practice for the diagnosis and management of thyroid nodules—2016 update. Endocr Pract. 2016;22(5):622-39.
  8. Tessler FN, et al. ACR Thyroid Imaging, Reporting and Data System (TI-RADS): white paper of the ACR TI-RADS Committee. J Am Coll Radiol. 2017;14(5):587-95.
  9. Petranović Ovčariček P, et al. The 2025 ATA guidelines for differentiated thyroid cancer—ten years of professional debate and measured progress. Eur J Nucl Med Mol Imaging. 2026;53(4):2213-6.
  10. Christensen-Jeffries K, et al. Super-resolution ultrasound imaging. Ultrasound Med Biol. 2020;46(4):865-91.
  11. Carmeliet P. Angiogenesis in health and disease. Nat Med. 2003;9(6):653-60.
  12. Zhang B, et al. Utility of contrast-enhanced ultrasound for evaluation of thyroid nodules. Thyroid. 2010;20(1):51-7.
  13. Rago T, Vitti P. Role of thyroid ultrasound in the diagnostic evaluation of thyroid nodules. Best Pract Res Clin Endocrinol Metab. 2008;22(6):913-28.
  14. Xia S, et al. Super-resolution ultrasound and microvasculomics: a consensus statement. Eur Radiol. 2024;34(11):7503-13.
  15. Song P, Rubin JM, Lowerison MR. Super-resolution ultrasound microvascular imaging: is it ready for clinical use? Z Med Phys. 2023;33(3):309-23.
  16. Errico C, et al. Ultrafast ultrasound localization microscopy for deep super-resolution vascular imaging. Nature. 2015;527(7579):499-502.
  17. Couture O, Hingot V, Heiles B, Muleki-Seya P, Tanter M. Ultrasound localization microscopy and super-resolution: a state of the art. IEEE Trans Ultrason Ferroelectr Freq Control. 2018;65(8):1304-20.
  18. Gao JY, Hou C. Progresses and clinical application of super-resolution ultrasound imaging: a narrative review. Ultrasound J. 2025;17(1):29.
  19. Zhang G, et al. Ultrasound super-resolution imaging for the differential diagnosis of thyroid nodules: a pilot study. Front Oncol. 2022;12:978164.
  20. Wildman-Tobriner B, et al. Using artificial intelligence to revise ACR TI-RADS risk stratification of thyroid nodules: diagnostic accuracy and utility. Radiology. 2019;292(1):112-9.
  21. Toro-Tobon D, et al. Artificial intelligence in thyroidology: a narrative review of the current applications, associated challenges, and future directions. Thyroid. 2023;33(8):903-17.
  22. Peng S, et al. Deep learning-based artificial intelligence model to assist thyroid nodule diagnosis and management: a multicentre diagnostic study. Lancet Digit Health. 2021;3(4):e250-9.
  23. Chen C, et al. Deep learning to assist composition classification and thyroid solid nodule diagnosis: a multicenter diagnostic study. Eur Radiol. 2024;34(4):2323-33.
  24. Bini F, et al. Artificial intelligence in thyroid field: a comprehensive review. Cancers (Basel). 2021;13(19):4740.
  25. Habchi Y, Kheddar H, Himeur Y, Ghanem MC. Machine learning and transformers for thyroid carcinoma diagnosis. J Vis Commun Image Represent. 2026;115:104668.
  26. Zhang M, Wang X, Deng Y, Tang K. Multimodal ultrasound integration pathways and paradigm innovations in precision diagnosis and treatment of thyroid cancer. Acad Radiol. 2026. Epub ahead of print.
  27. Feng JW, et al. Development and validation of the multidimensional machine learning model for preoperative risk stratification in papillary thyroid carcinoma: a multicenter, retrospective cohort study. Cancer Imaging. 2025;25(1):98.
  28. Gatta E, et al. Machine learning for diagnosis of malignant thyroid nodules based on thyroid ultrasound: systematic review and meta-analysis of studies with external datasets. Eur J Radiol Open. 2026;16:100716.
  29. Li J, Guo Q, Peng S, Tan X. Super-resolution based nodule localization in thyroid ultrasound images through deep learning. Curr Med Imaging. 2024;20(1):e15734056269264.
  30. He S, et al. Super-resolution ultrasound radiomics for pre-FNA prediction of nondiagnostic (Bethesda I) thyroid nodules. Front Endocrinol (Lausanne). 2026;17:1710097.
  31. Habchi Y, Kheddar H, Ghanem MC, Hwaidi J. Adaptive bandelet transform and transfer learning for geometry-aware thyroid cancer ultrasound classification. Diagnostics (Basel). 2026;16(4):554.
  32. Habchi Y, Kheddar H, Himeur Y. Adaptive bandelet transform and transfer learning for geometry-aware thyroid cancer ultrasound classification [conference paper]. In: 2024 International Conference on Telecommunications and Intelligent Systems (ICTIS). IEEE; 2024. p. 1-6.
  33. Xu Y, Xu M, Geng Z, Liu J, Meng B. Thyroid nodule classification in ultrasound imaging using deep transfer learning. BMC Cancer. 2025;25(1):544.
  34. Gou TH, et al. Application value of super-resolution ultrasound imaging in the diagnosis of American College of Radiology Thyroid Imaging Reporting and Data System category 4 and 5 thyroid nodules. Zhongguo Yi Xue Ke Xue Yuan Xue Bao. 2026. doi:10.3881/j.issn.1000-503X.16808.

재인쇄 및 허가

태그

SHAP5