본 연구는 GAN, VAE, 주의 기반 딥 컨볼루션 네트워크를 통합하여 기침 음성 신호로부터 COVID-19를 감지하는 생성형 AI 기반 프레임워크를 제안하며, 견고성, 데이터 균형, 데이터셋 간 일반화를 개선하여 확장 가능하고 비침습적인 선별검사를 가능하게 합니다.
연구 논문
본 연구는 GAN, VAE, 주의 기반 딥 컨볼루션 네트워크를 통합하여 기침 음성 신호로부터 COVID-19를 감지하는 생성형 AI 기반 프레임워크를 제안하며, 견고성, 데이터 균형, 데이터셋 간 일반화를 개선하여 확장 가능하고 비침습적인 선별검사를 가능하게 합니다.
기침 오디오 분석은 COVID-19 질병 선별을 지원하는 자동화 도구 개발을 위한 실질적인 경로를 제공합니다. 관심이 높아지고 있음에도 불구하고, 많은 기존 접근법은 잡음, 클래스 불균형, 데이터셋 변동성에 민감하여 재현성을 제한하고 있습니다. 이 연구는 기침 소리 녹음을 이용한 구조화된 생성형 인공지능 기반 COVID-19 탐지 방법론을 제시합니다. 실험은 두 개의 공개 접근 가능한 데이터셋인 COUGHVID와 Virufy를 사용하여 진행되며, 두 데이터셋 모두 기침 샘플을 표시하고 있습니다. 제안된 프로토콜은 기침 분할, 잡음 제거, 신호 정규화 등 순차적인 전처리 단계로 구성됩니다. 음향 특성은 멜 주파수 셉스트랄 계수, 크로마 디스크리뷰터, 스펙트럼 대비 특징을 통해 포착됩니다. 표현 학습을 개선하고 데이터 불균형을 완화하기 위해, 변분 자동인코더와 생성적 적대 네트워크를 통합한 하이브리드 생성 프레임워크가 특징 수준 샘플을 합성합니다. 분류는 이후 딥 컨볼루션 신경망과 주의 기반 DCNN 모델을 사용하여 수행됩니다. 성능 평가 결과, 생성 보강 도입은 비생성 기준선에 비해 지속적으로 향상되어, 평가된 데이터셋 전반에서 분류 정확도 97.2%와 AUROC 0.953을 달성했습니다. 이 결과들은 기침 기반 COVID-19 탐지를 향상시키고 음향 건강 모니터링 분야의 미래 연구를 위한 재현 가능한 분석 파이프라인을 구축하는 생성 모델링의 효과를 입증합니다.
호흡음향은 특히 감염성 및 폐질환 맥락에서 건강 평가를 위한 비침습적 정보원으로 점점 더 많이 탐구되고 있습니다. 신호 처리와 인공지능(AI)의 발전으로 기침음과 호흡음의 자동 분석이 가능해져 디지털 바이오마커로서의 활용을 뒷받침할 수 있게 되었습니다. 최근 연구들은 스마트폰, 웨어러블 기기, 임상 센서에 내장된 마이크를 이용해 포착된 호흡음을 딥러닝 모델을 통해 효과적으로 분석하여 COVID-19 감염을 감지할 수 있음을 보여줍니다 1,5. 이러한 발전은 오디오 기반 선별검사가 신속하고 비접촉적이며 확장 가능한 기존 진단 절차의 보완 수단으로서의 잠재력을 부각시킵니다. SARS-CoV-2 바이러스에 의해 발생하는 2019년 코로나바이러스 질병(COVID-19)은 주로 호흡기계에 영향을 미치며 기류 역학, 폐 기능, 성도 행동에 측정 가능한 변화를 유발합니다. 역전사-중합효소 연쇄반응(RT-PCR) 검사는 진단의 기준으로 남아 있지만, 그 물리적 제약과 지연된 처리 시간 때문에 대규모 또는 연속 선별검사에 적합하지 않아 호흡음 분석에 기반한 대안적 접근법 탐색이 촉진되고 있습니다.
기침, 호흡, 음성 신호를 이용한 AI 기반 COVID-19 감지 연구가 점점 더 많이 연구되고 있습니다. 표 1에 요약된 바와 같이, 이전 연구들은 다양한 데이터셋, 음향 특징 표현(예: MFCC, STFT, 스펙트로그램 기반 특징), 그리고 고전 머신러닝 모델부터 딥 컨볼루션, 재발, 주의 기반, 트랜스포머 아키텍처에 이르기까지 학습 패러다임을 탐구해왔습니다. 8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. 여러 연구가 크라우드소싱 및 임상적으로 수집된 호흡 청음을 활용해 유망한 선별 성과를 입증했습니다. 반면, 다른 이들은 전이 학습, 데이터 증강, 설명 가능한 AI가 견고성과 신뢰성을 높이는 데 중요하다고 강조했습니다. 상세한 연구별 논의를 반복하는 대신, 표 1은 이러한 대표적 접근법에 대한 통합 비교 개요를 제공하여 데이터셋, 방법론, 보고된 결과를 직접 비교할 수 있도록 합니다.
이러한 발전에도 불구하고, 기존 접근법의 견고성과 실제 적용에는 여러 한계가 있습니다. 호흡 오디오 데이터셋은 이질적인 녹음 조건에서 자주 수집되어, 기기, 음향 환경, 피험자 집단 간에 상당한 변동성을 초래합니다 2,3,4. 많은 공개 데이터셋은 자가 보고된 COVID-19 상태에 의존하여 라벨 신뢰성에 불확실성을 발생시킵니다7. 또한, 뚜렷한 클래스 불균형과 임상적으로 검증된 표본의 제한된 가용성은 관찰된 데이터만을 기반으로 학습된 판별 모델의 일반화 능력을 제한합니다 4,5. 따라서 통제된 실험 환경에서 보고된 모델 성능은 다양한 실제 시나리오에서 신뢰할 수 있는 배포로 일관되게 이어지지 않습니다.
이러한 한계를 종합해 보면, 데이터 부족, 클래스 불균형, 이기종 데이터셋 전반에 걸친 견고한 일반화를 동시에 다루는 통합된 프레임워크가 부재하는 중요한 연구 격차를 부각시킵니다. 생성적 적대 네트워크(GAN)와 변분 자동인코더(VAE)와 같은 생성 모델이 잠재 표현을 학습하고 현실적인 생의학 신호를 합성하기 위해 연구되었지만, 기존 연구들은 일반적으로 이러한 모델들을 독립적으로 사용하여 단일 데이터셋 내에서 평가합니다. 더불어, 주의력 강화 합성곱 아키텍처와의 통합 및 교차 데이터셋 조건에서의 평가 과정도 충분히 연구되지 않았습니다.
이 격차를 해소하기 위해 본 연구는 기침 소리로부터 COVID-19를 감지하는 생성형 AI 지원 프레임워크를 제안하는데, 이는 음향 특징 추출과 하이브리드 GAN–VAE 모델, 그리고 주의 기반 심층 합성곱 신경망(DCNNs)을 통합한 것입니다. 생성 요소는 구조화된 잠재 표현 학습과 합성 데이터 생성을 통해 클래스 불균형과 제한된 샘플 가용성을 완화하며, 판별 모델은 이기종 데이터셋 전반에 걸쳐 분류의 견고성을 향상시킵니다. 이전 연구들이 주로 데이터셋 내 검증에 의존하는 것과 달리, 제안된 프레임워크는 독립적인 데이터셋에서 교차 데이터셋 테스트를 통해 평가하여 일반화 성능을 보다 엄밀하게 평가할 수 있습니다. 이 프레임워크는 독립적인 진단 도구가 아니라 스크리닝 지향적 접근법으로 설계되었으며, 재현 가능하고 신뢰할 수 있는 배포를 지원하기 위해 변동성과 라벨 불확실성 기록을 명확히 고려합니다.
이 맥락에서 본 연구의 새로운 기여는 세 가지입니다. 첫째, 통합 GAN–VAE 하이브리드 생성 프레임워크가 주의 기반 DCNN 분류기와 통합되어 기침 기반 COVID-19 선별에서 클래스 불균형, 제한된 데이터 가용성, 견고한 특징 표현 학습을 공동으로 해결합니다. 둘째, 제안된 접근법은 교차 데이터셋 검증을 통해 체계적으로 평가되어, 기존 데이터셋 내 검사에 비해 모델 일반화에 대한 보다 현실적인 평가를 제공합니다. 셋째, 이 연구는 이질적 기록 조건에서 생성 증강의 영향에 대한 상세한 분석을 제시하여, 이 프레임워크를 확장 가능하고 실용적인 COVID-19 선별검사를 위한 재현 가능한 개념 증명으로 자리매김합니다.
| 저자 및 연도 | 데이터셋 | 사용되는 기법 / 특징 | 모델 / 분류기 | 정확도 / 지표 | 제한 사항 / 주석 |
| Imran 외, 20208쪽 | 크라우드소싱 기침 데이터셋 (AI4COVID-19) | MFCC, 전이 학습, 도메인 인식 기능 | 위험 회피 다중 분류기 (DL + ML 앙상블) | 정확도: 92.6% | 기침의 질에 따라 다릅니다; 제한된 임상 검증 |
| 브라운 외, 20209 | 크라우드소싱 호흡음 (>7,000명) | 수제 오디오 기능, VGGish 임베딩 | 얕은 ML 모델 | AUC > 80% | 크라우드소싱 데이터에서의 라벨 잡음 |
| Laguarta 외, 202010 | MIT 오픈 보이스 데이터셋 (5,320명 피험자) | MFCC, 음향 바이오마커 | CNN (ResNet50, 전이 학습) | 민감도: 98.5%, 특이도: 94.2% | 대규모 사전 학습 데이터셋이 필요합니다 |
| Quartieri 외, 202011 | 언어 인터뷰 (5과목, 코로나 전후) | 호흡 강도, F0, CPP, 포먼트 | 통계적 효과-크기 분석 | 모든 과제에서 80% 이상의 AUC 달성 | 표본 크기가 매우 적습니다 |
| Hassan 외, 202012 | 호흡음 | 시간적 음성 특징 | RNN | 기침: 97%, 호흡: 98.2%, 목소리: 88.2% | 상세한 데이터셋 통계 부족 |
| 캄파리아 외, 201913 | ESC-10, ESC-50 | 스펙트로그램 이미지 기반 특징 | CNN, TDSN | CNN: 77% (ESC-10), 49% (ESC-50); TDSN: 56% (ESC-10) | 환경음만 허용합니다; 복잡한 데이터셋에서의 낮은 성능 |
| Aykanat 외, 201714 | 1,630명의 피험자로부터 17,930개의 폐 소리 (전자 청진기) | MFCC 특징, 스펙트로그램 이미지 | SVM, CNN | CNN/SVM: 86% (건강 vs 병리), 76%/75% (라일-론쿠스–정상), 80%/80% (단일 유형), 62%/62% (모든 유형) | 특수 하드웨어가 필요합니다; 질병 특이적은 아니에요 |
| Ponomarchuk 외, 202215 | 코스와라, 비루피 | MFCC, 멜 스펙트로그램, 웨이블릿 특징 | CNN, RNN, 앙상블 모델 | AUC: 0.93 (내부 수치), 0.79 (외부 수치) | 데이터셋 간 일반화는 여전히 어렵습니다 |
| 펑 외, 202116 | 코스와라, 비루피 | STFT, MFCC | SVM (RBF), CNN | 정확도 81.25% (AUC 0.79) | 데이터셋 의존적 성능 |
| Islam 외, 202217 | 임상 기침 기록 | 스펙트럼 및 시간-주파수 특성 | 심층 신경망 | 정확도: 89.2% | 제한된 데이터셋 |
| 만슈리, 202218 | 비루피 | 스펙트럼 분석 기능 | 고전적 ML 분류기 | 정확도: 95.86% | 소규모 실험 연구 |
| 황 외, 202019 | 10명의 COVID-19 환자에서 들려온 폐 소리 | 시간-주파수 호흡음 분석 | 임상 전문가 분석 | 질적 검증 | 소규모 데이터셋; ML 모델 없음 |
| W. D. 푸자 외, 202420 | Coswara, Virufy (기침 소리 데이터셋) | STFT, 멜 스펙트로그램, MFCC, RMS 에너지, 스펙트럼 대역폭, 스펙트럼 중심체, 스펙트럼 롤오프, ZCR; CNN 기반 심층 특징 추출 | 1차원 CNN(특징 추출기) + 랜덤 포레스트 | 정확도: 93% | 성능은 기침 품질에 따라 달라집니다; 임상 진단보다는 선별검사를 위해 설계된 것; 크라우드소싱 데이터 변동성 |
| Chadaga 외, 202321 | 크라우드소싱 기침 오디오 녹음 | 멜 스펙트로그램과 시간-주파수 음향 특징 | 합성곱 신경망(CNN) | 정확도: 84%, 정확도: 85%, 회상력: 84%, F1 점수: 84% | 성능은 데이터 불균형, 자기보고된 라벨, 기록 조건에 대한 민감성에 의해 제한됩니다 |
| Chadaga 외, 202322 | 경도에서 중등도 COVID-19 및 기타 호흡기 질환 임상 지표 | 피처 선정 (피어슨, PSO); 주요 지표: 호산구, 알부민, T. 빌리루빈, ALP, ALT, AST, HbA1c, TWBC | 스택드 앙상블; 1D CNN, LSTM, DN, 잔여 MLP | 정확도: 89% | 중증 사례는 제외; RT-PCR의 대안; 설명 가능한 AI 적용 |
| Dar 외, 202423 | COVID-19 데이터셋 | SJHBO 최적화(Jaya+HBO+SO), 다양한 스펙트럼 특징 | 딥 Q 네트워크 (DQN) | 정확도: 95.11%, 민감도: 95.06%, 특이도: 94.69% | 복잡성이 높으며; 튜닝은 하이브리드 옵티마이저를 통해 개선됩니다 |
| 징 취안 외 202024쪽 | COVID-19 환자의 음성 녹음 | 음향 기능 세트; 질병 중증도, 수면의 질, 피로, 불안 분석 | 지지 벡터 기계(SVM) | 0.69 (질병 중증도) | 오디오 기능에만 제한; 중간 정도의 정확도; 데이터셋 크기는 명시되지 않음; 건강 관련 요소는 네 가지만 고려됩니다 |
| Sharma, J. 외, 202025 | 어반사운드8K, ESC-10, ESC-50 | 다기능 채널: MFCC, GFCC, CQT, 크로마그램; 믹스업 데이터 증강 | 공간적으로 분리 가능한 컨볼루션과 주의 모듈을 가진 딥 CNN | 어반사운드8K: 97.52%, ESC-10: 94.75%, ESC-50: 87.45% | 비벤치마크나 실제 데이터셋에서 테스트하지 않음; 더 깊은 CNN과 주의 모듈로 인한 계산 복잡성 |
| Lella, KK 외, 202126 | 호흡음; COVID-19, 천식, 건강) | 데이터 증강; MFCC 대신 데이터 노이징 자동 인코더(DDAE)를 사용한 딥 피처 | 1D 합성곱 신경망 (1D CNN) | ~90% | 제한된 데이터셋 세부사항; MFCC 대비 ~4% 개선; 일반화 가능성은 검증되지 않음 |
| Orlandic 외, 202127 | 기침 (25k+ 기침) | MFCCs, PSD, 스펙트럼 및 시간 특징 | XGBoost | AUC 96.5%, 정밀도 95.5% | 자가 보고한 COVID; 하위 집합의 전문가 라벨 |
| Zhang 외, 202343쪽 | COVID-19 백신 접종 후 HLH 사례 보고(문헌 데이터베이스) | 체계적 문헌고찰; 임상 특징 집계; 분자 도킹 분석 | 해당되지 않음 (임상 검토) | 기술 통계; 임상 결과 | 희귀 사건 분석; 작은 표본 크기; 보고된 사례에 의존하면 보고 편향이 발생할 수 있습니다 |
| Xu 외, 202344쪽 | 문헌에서 보고된 백신 관련 VKH 질환 사례 | 소급 사례 검토; 임상 및 영상 특징 분석 | 해당 없음 (임상 관찰 연구) | 치료 반응 및 임상 회복 결과 | 제한된 사례 수; 대조군 부재; 인과관계는 확고히 확립될 수 없다 |
| Hu 외, 202545쪽 | 중국 내 SRDI 의료기기 기업의 기업 단위 모회사-자회사 데이터 (Qixinbao 데이터베이스) | 소셜 네트워크 분석; 공간 네트워크 지표; 지리적 검출기 분석 | 해당 없음 (네트워크 및 정책 분석) | 네트워크 밀도, 중심성, 확산 지수 | 단면 설계; 기업의 동등한 비중; 직접적인 성과나 임상 결과 지표는 없습니다 |
표 1: 기존 COVID-19 오디오 기반 탐지 연구 요약. 기침/음성 선별 접근법의 비교 개요, 데이터셋, 방법 및 보고된 성과 포함. 이 표를 다운로드하려면 여기를 클릭해 주세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
제안된 방법론
이 연구는 기침 신호로부터 COVID-19를 감지하는 생성형 AI 기반 프레임워크를 제안합니다. 이 프레임워크는 생성 모델과 판별 분류기를 통합하며, 학습 데이터와 평가 데이터는 엄격히 분리되어 있습니다. 그림 1 은 제안된 GAN–VAE–ADCNN 프레임워크의 상세 아키텍처를 보여주며, 변분 오토인코더(VAE)를 통한 잠재 표현 학습, 생성적 적대적 네트워크(GAN)를 이용한 합성 특징 생성, 그리고 딥 컨볼루션 신경망(DCNN)과 주의 기반 DCNN(ADCNN)을 통한 최종 분류를 통해 오디오 전처리와 특징 추출의 흐름을 보여줍니다. 그림은 생성 구성 요소는 훈련 중에만 사용되며, 분류는 판별 모델을 사용해 수행됨을 보여줍니다.

그림 1: GAN–VAE–ADCNN 아키텍처 개요. 기침에서 유래한 음향 특징을 VAE로 인코딩하고, GAN 기반 합성 샘플 생성을 통해 증강하며, DCNN 및 주의 기반 DCNN(ADCNN) 모델을 사용해 분류하는 제안된 하이브리드 파이프라인의 개요. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
모델 아키텍처 및 구현
이 프레임워크에서 사용된 생성 및 판별 모델은 고정되고 재현 가능한 아키텍처로 구현되었습니다. GAN은 ReLU 활성화를 이용한 세 개의 완전 연결 계층(128, 256, 512 단위)을 가진 생성기와, LeakyReLU 활성화 후 시그모이드 출력을 사용하는 세 개의 완전 연결 계층(512, 256, 128 단위)을 가진 판별기로 구성됩니다.
VAE 인코더는 256과 128 단위로 이루어진 두 개의 완전 연결 층으로 구성되며, 그 다음에 잠재 평균 및 분산 추정이 64차원으로 이루어집니다. 디코더는 이 구조를 반영하며, 재구성 손실과 쿨백-라이블러 발산을 결합하여 구조적이고 확률적인 잠재 공간을 학습하도록 훈련합니다.
DCNN 분류기는 3x3 커널을 가진 네 개의 컨볼루션 블록과 각각 32, 64, 128, 256 필터를 포함합니다. 각 블록 후에는 배치 정규화, ReLU 활성화, 2x2 최대 풀링이 이어집니다. ADCNN은 최종 합성 블록 이후 채널별 주의 메커니즘을 통합하여 DCNN을 확장합니다. 모든 모델은 학습률 0.0001, 배치 크기는 32인 Adam 옵티마이저를 사용해 최적화되었습니다. 그림 1에서 보듯, VAE와 GAN은 훈련 중에만 작동하며, DCNN과 ADCNN은 분류에 사용됩니다. 전체 훈련 및 평가 절차는 알고리즘 1에 요약되어 있습니다.
알고리즘 1: GAN–VAE 기반 COVID-19 탐지 프레임워크
입력: 사전 처리된 기침 오디오 녹음
결과물: 이진 분류 라벨 (COVID-19 양성/음성)
교육 및 평가 절차는 고정되고 재현 가능한 파이프라인을 따랐습니다. 모든 기침 오디오 녹음은 16kHz로 리샘플링되었고, 노이즈 감소와 진폭 정규화가 이루어졌습니다. 녹음은 고정 길이 구간으로 나뉘어 MFCC, 크로마, 스펙트럼 특징을 추출했습니다. 각 오디오 세그먼트에서 총 40개의 멜 주파수 셉스트럴 계수(MFCC)가 추출되었습니다. 또한 12개의 크로마 특징이 계산되었습니다. 결과적으로 표현된 것은 각 기침 구간에 대해 52차원 특징 벡터를 형성합니다. 피험자 수준 분할을 통해 데이터를 훈련, 검증, 테스트 세트로 나누었습니다. VAE는 확률적 잠재 표현을 학습하도록 훈련되었고, 그 결과 잠재 벡터는 합성 특징 생성을 위한 GAN의 학습에 사용되었습니다. 학습 데이터셋은 GAN–VAE 생성 샘플을 사용하여 보강되었고, 합성 데이터는 검증 및 테스트에서 제외되었습니다. DCNN과 ADCNN 분류기는 증강된 학습 데이터를 기반으로 훈련되었고, 최종 평가는 표준 성과 지표를 사용하여 진행된 테스트 세트에 대해 수행되었습니다.
훈련 설정, 데이터 분할 및 누수 방지
모든 실험은 고정되고 재현 가능한 훈련 구성으로 수행되었습니다. 데이터 분할은 오디오 분할 전에 피험자 수준에서 수행되어 데이터 누출을 방지했습니다. 데이터셋은 80:10:10 비율로 훈련, 검증, 테스트 세트로 나뉘어 동일한 녹화 내 모든 구간이 단일 하위 집합에 할당되도록 했습니다. 학습 세트는 모델 학습과 생성 데이터 보강에 사용되었고, 검증 세트는 하이퍼파라미터 튜닝과 조기 정지에 사용되었으며, 테스트 세트는 최종 성능 평가를 위해 대기되었습니다. GAN–VAE 프레임워크에서 생성된 합성 샘플은 교육 중에만 사용되었으며, 공정한 평가를 보장하기 위해 검증 및 테스트에서 엄격히 제외되었습니다.
모델은 최대 100에포크에 대해 훈련되었으며, 검증 손실과 인내심 10에포크에 기반한 조기 중단이 이루어졌습니다. 최적화는 학습률 0.0001, 배치 크기 32의 Adam 옵티마이저를 사용하여 수행되었습니다. 분류에는 이진 교차엔트로피 손실이 적용되었고, 재구성과 대립 손실은 각각 VAE와 GAN 구성 요소 훈련에 사용되었습니다. 이 통합 교육 및 평가 프로토콜은 재현성을 보장하고, 데이터 유출을 방지하며, 교육과 평가 단계를 엄격히 분리합니다.
데이터셋 설명
공개된 두 가지 기침 오디오 데이터셋인 COUGHVID와 Virufy를 사용해 대규모 음향 다양성과 임상적으로 참조된 라벨을 균형 있게 유지하며, 훈련과 평가에서 명확히 분리된 역할을 수행했습니다.
기독증은 부분적인 전문가 주석과 자기보고 메타데이터가 포함된 크라우드소싱 기침 녹음 모음입니다. 데이터 품질을 보장하기 위해, 최소 신호 지속 시간, 적절한 신호 대 잡음비, 손상되거나 모호한 샘플 제거, 증상 메타데이터 포함 식별 가능한 기침 사건 존재 등 사전 정의된 품질 관리 기준을 적용한 후 428개의 녹음을 선정하였습니다. 전처리와 세분화 후, 이 녹음들은 1,719개의 기침 세그먼트를 생성했으며, 16kHz 샘플링 속도의 WAV 포맷으로 표준화되었습니다. COUGHVID는 생성 모델과 판별 분류기 모두를 훈련하는 데 사용되었습니다.
Virufy는 의사의 감독 하에 COVID-19 양성 또는 음성으로 표시된 기침 기록으로 구성됩니다. 16개의 녹음 모두 포함되어, 세그멘테이션 후 234개의 기침 세그먼트가 만들어졌으며, 역시 16kHz로 표준화되었습니다. Virufy는 외부 교차 데이터셋 평가에만 사용되어 일반화 성능을 평가했으며, 훈련, 미세 조정, 생성 증강에는 사용되지 않았습니다.
따라서 제안된 프레임워크는 임상적으로 검증된 진단 시스템이라기보다는 통제된 실험 조건에서 평가된 개념 증명 스크리닝 접근법으로 해석되어야 합니다.
데이터 전처리 및 세분화
모든 녹음은 16kHz로 리샘플링되어 모노로 변환되었으며, 무음 제거, 스펙트럼 노이즈 감소, 진폭 정규화가 적용되었습니다. 데이터 유출을 방지하기 위해 피험자 수준 분할 후에 분할이 수행되었습니다. 각 녹음은 겹치는 2–4 s 세그먼트로 나뉘었고, 저에너지나 무음 세그먼트는 버려졌습니다.
외부 검증 프로토콜
외부 검증은 교차 데이터셋 평가를 통해 수행되었습니다. COUGHVID로 학습된 모델은 외부 검증을 위해 Virufy에서 평가되었습니다. 이 프로토콜은 전향적 임상 검증보다는 다양한 조건에서 수집된 데이터셋 간의 일반화를 평가합니다. 그림 2 는 이 워크플로우에 대한 프로토콜 수준 개요를 제공하며, 데이터셋 사용, 전처리, 특징 추출, 분류기 훈련 및 평가 시나리오를 보여줍니다. 그림 1 이 내부 모델 아키텍처에 초점을 맞추는 반면, 그림 2 는 훈련 및 테스트 단계에 걸친 실험 설계와 데이터 흐름을 강조합니다.

그림 2: 제안된 COVID-19 기침 선별 프레임워크의 워크플로우. 전처리, 특징 추출(MFCC, 색도, 스펙트럼 특징), GAN–VAE 기반 표현 학습 및 증강(훈련 전용), 피험자 수준 분할 및 데이터 교차 평가에 따른 최종 분류를 포함한 전체 처리 파이프라인 일러스트레이션. 이 그림의 더 큰 버전을 보시려면 여기를 클릭해 주세요.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
데이터셋 구성 및 클래스 분포 분석
전처리 및 분할 이후, COUGHVID와 Virufy 데이터셋은 데이터셋 규모와 분절 밀도 모두에서 상당한 차이를 보였습니다. COUGHVID는 444개 기록 중 428개(96.4%), 추출된 1,953개 기침 구간 중 1,719개(88.0%)를 기여하여, 모델 훈련 및 생성 증강의 주요 데이터셋으로서의 역할을 확인시켜 주었습니다(그림 3). 반면 Virufy는 16개의 녹음(3.6%)과 234개의 기침 구간(12.0%)만을 기여했으며, 이는 외부 교차 데이터셋 평가에만 할당되었습니다. 특히 크기가 작음에도 불구하고 Virufy는 COUGHVID에 비해 기록당 평균 분절 수가 더 많았으며, 이는 기록 구조와 분할 결과의 차이를 반영합니다(그림 3)....
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
결과는 제안된 생성형 AI 기반 프레임워크가 이기종적인 데이터셋에서 기침 신호를 통해 COVID-19를 감지할 수 있음을 보여줍니다. 표 4 와 표 6에서 보듯, GAN–VAE 하이브리드 모델은 97.2%의 정확도와 0.953의 AUROC, 높은 정밀도, 회상율, F1 점수, 특이성까지 모두 우수한 성과를 보여, 균형 잡힌 분류 성능을 나타냈습니다.
생성 모델과 판별 분류기를 결합했을 때 성능이 꾸준히 향상되었습니다. GAN–DCNN과 VAE–ADCNN 모두 각자의 기초 모델을 능가하여, 생성 증강이 특히 집단 불균형과 제한된 임상적 검증 데이터에서 특징 학습과 일반화를 향상시켰음을 시사합니다. MFCC 특징은 데이터셋 전반에 걸쳐 가장 강력한 개별 식별 성능을 제공했습니다. 크로마와 스펙트럼 대비 특징은 개별적으로 성능이 낮았으나, MFCCS와 결합하면 이질...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자(들)는 이해 충돌 가능성을 보고하지 않았습니다.
이 논문 준비 과정에서 귀중한 지도와 지속적인 지원, 건설적인 피드백을 주신 컴퓨터 과학 및 공학부 교수진과 연구 멘토들에게 진심으로 감사드립니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 기독후 바이러스 데이터셋 | 그리고 이카트; 콜 폴리테크니크 Fé 사랑스럽고; 랄 드 로잔 (EPFL) | 공개 발매 (2021) | 자기 보고 메타데이터와 부분 의사 주석을 포함한 크라우드소싱 기침 오디오 데이터셋; 주로 학습 및 데이터 증강에 사용됩니다. |
| CUDA 툴킷 | 엔비디아 | 11.3 | GPU 가속 프레임워크는 모델 학습과 추론을 가속화하는 데 사용됩니다. |
| 리브로사 | 오픈 소스 | 0.9 | 오디오 분석 라이브러리는 재샘플링, 세분화, MFCC 추출, 스펙트럼 특징 계산에 사용됩니다. |
| 리눅스 운영체제 | 정경 | Ubuntu 20.04 LTS | 모든 실험과 모델 학습에 사용되는 운영체제입니다. |
| 매트플롯립 | 오픈 소스 | 3.5 | 데이터셋 분포와 평가 결과를 도표로 표시하는 데 사용되는 시각화 라이브러리입니다. |
| 넘버피 | 오픈 소스 | 1.21 | 배열 조작과 신호 처리 작업에 사용되는 수치 컴퓨팅 라이브러리입니다. |
| NVIDIA GPU | 엔비디아 | 테슬라 / RTX 클래스 | 딥 및 생성형 모델 훈련에 사용되는 그래픽 처리 장치입니다. |
| 파이썬 프로그래밍 언어 | 파이썬 소프트웨어 재단 | 3.8 | 데이터 전처리, 특징 추출, 모델 개발 및 평가에 사용되는 핵심 프로그래밍 환경입니다. |
| 파이토치 | 메타 (페이스북 AI 연구) | 1.12 | GAN, VAE, DCNN, 그리고 주의 기반 DCNN 모델을 구현하는 데 사용되는 딥러닝 프레임워크입니다. |
| Scikit-learn | 오픈 소스 | 1 | 데이터 분할, 클래스 가중치, 성능 지표 계산에 사용되는 머신러닝 라이브러리입니다. |
| 사이피 | 오픈 소스 | 1.7 | 오디오 전처리 및 신호 변환에 사용되는 과학 컴퓨팅 라이브러리입니다. |
| Virufy 데이터셋 | 비루피 | 공개 발매 (2021) | RT-PCR&ndash로 임상적으로 수집된 기침 기록; 검증된 COVID-19 라벨; 외부 검증 및 데이터 교차 평가에만 전용으로 사용됩니다. |
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청