Araştırma makalesi

Öksürük Ses Sinyallerinden COVID-19 Taraması için Üretken Yapay Zeka Tabanlı Bir Çerçeve

DOI:

10.3791/69874

10 Mart 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, öksürük ses sinyallerinden COVID-19'u tespit etmek için GAN'ları, VAE'leri ve dikkat temelli derin konvolüsyon ağları entegre eden üretken yapay zeka tabanlı bir çerçeve öneriyor; bu çerçeve dayanıklılığı, veri dengesini ve ölçeklenebilir, invaziv olmayan tarama için çapraz veri seti genellemesini artırıyor.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Öksürük ses analizi, COVID-19 hastalık taramasını desteklemek için otomatik araçlar geliştirmek için pratik bir yol sunar. Artan ilgiye rağmen, mevcut yaklaşımların çoğu gürültü, sınıf dengesizliği ve veri seti değişkenliğine karşı hassas olmaya devam ediyor ve bu da tekrarlanabilirliklerini sınırlıyor. Bu çalışma, öksürük ses kayıtları kullanılarak COVID-19 tespiti için yapılandırılmış, üretken yapay zeka odaklı bir metodoloji sunmaktadır. Deneyler, her ikisi de etiketlenmiş öksürük örneklerinden oluşan iki kamuya açık veri seti olan COUGHVID ve Virufy kullanılarak gerçekleştirilmektedir. Önerilen protokol, öksürük segmentasyonu, ses yalıtımı ve sinyal normalizasyonu gibi ardışık ön işleme aşamalarından oluşmaktadır. Akustik özellikler daha sonra Mel-Frekans Cepstral Katsayıları, kroma tanımlayıcıları ve spektral kontrast özellikleri aracılığıyla yakalanır. Temsil öğrenimini geliştirmek ve veri dengesizliğini azaltmak için, Varyasyonel Otomatik Kodlayıcılar ve Üretken Karşı Ağları entegre eden hibrit bir üretken çerçeve kullanılarak özellik düzeyinde örnekler sentezlenir. Sınıflandırma daha sonra Derin Konvolüsyon Sinir Ağları ve Dikkat Tabanlı DCNN modelleri kullanılarak gerçekleştirilir. Performans değerlendirmesi, üretken artırmanın dahil edilmesinin üretken olmayan temel seviyelere göre tutarlı olarak geliştiğini, değerlendirilen veri setlerinde %97,2 zirve sınıflandırma doğruluğu ve 0,953 AUROC elde ettiğini göstermektedir. Bu sonuçlar, öksürük tabanlı COVID-19 tespitini artırmada üretken modellemenin etkinliğini göstermekte ve akustik sağlık izleme alanında gelecekteki araştırmalar için tekrarlanabilir analitik bir hattı oluşturmaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Solunum akustikleri, özellikle enfeksiyon ve akciğer hastalıkları bağlamında, sağlık değerlendirmesi için invaziv olmayan bir bilgi kaynağı olarak giderek daha fazla araştırılmaktadır. Sinyal işleme ve yapay zekadaki (YZ) gelişmeler, öksürük ve nefes seslerinin otomatik analizini mümkün kılmış ve bunların dijital biyobelirteç olarak kullanımını desteklemiştir. Son çalışmalar, akıllı telefonlara, giyilebilir cihazlara veya klinik sensörlere gömülü mikrofonlarla yakalanan solunum seslerinin, COVID-19 enfeksiyonunu tespit etmek için derin öğrenme modelleri kullanılarak etkili şekilde analizedilebileceğini göstermektedir 1,5. Bu gelişmeler, ses tabanlı taramanın geleneksel tanı prosedürlerine hızlı, temassız ve ölçeklenebilir bir tamamlayıcı olarak potansiyelini vurgulamaktadır. SARS-CoV-2 virüsü tarafından neden olan Koronavirüs Hastalığı 2019 (COVID-19), öncelikle solunum sistemini etkiler ve hava akışı dinamiklerinde, akciğer fonksiyonunda ve ses yolu davranışında ölçülebilir değişikliklere yol açar. Ters transkripsiyon–polimeraz zincir reaksiyonu (RT-PCR) testi tanı için referans standart olarak kalsa da, lojistik kısıtlamaları ve gecikmeli teslim süresi, büyük ölçekli veya sürekli taramaya uygunluğunu sınırlamaktadır ve solunum sesi analizine dayalı alternatif yaklaşımların araştırılmasını teşvik etmektedir.

Artan bir literatür, öksürük, nefes ve konuşma sinyalleri kullanılarak yapay zeka tabanlı COVID-19 tespitini araştırmıştır. Tablo 1'de özetlendiği üzere, önceki çalışmalar çeşitli veri setlerini, akustik özellik temsillerini (örneğin, MFCC, STFT, spektrogram tabanlı özellikler) ve klasik makine öğrenimi modellerinden derin konvolüsyone, tekrarlayan, dikkat tabanlı ve transformator mimarilerine kadar uzanan öğrenme paradigmalarınıincelemiştir 8,9,10,11,12,13,14,15 ,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45. Birçok çalışma, kitlesel kaynaklı ve klinik olarak toplanan solunum sesi kullanılarak umut vadeden bir tarama performansı göstermiştir. Buna karşılık, diğerleri aktarım öğrenmesi, veri artırma ve açıklanabilir yapay zekanın sağlamlık ve güvenilirliği artırmak için önemini vurguladı. Detaylı bir çalışma çalışması tartışmayı tekrarlamak yerine, Tablo 1 bu temsil yaklaşımların konsolide karşılaştırmalı bir genel bakış sunar ve veri setlerinin, metodolojilerin ve raporlanan sonuçların doğrudan karşılaştırılmasına olanak tanır.

Bu gelişmelere rağmen, mevcut yaklaşımların sağlamlığını ve gerçek dünyada uygulanabilirliğini engelleyen bazı sınırlamalar vardır. Solunum ses veri setleri sıklıkla heterojen kayıt koşullarında toplanır ve cihazlar, akustik ortamlar ve konu popülasyonları arasında önemlideğişkenliklere yol açar 2,3,4. Birçok kamuya açık veri seti kendi bildirilen COVID-19 durumuna dayanır ve bu da etiket güvenilirliğinde belirsizlikyaratır 7. Ayrıca, belirgin sınıf dengesizliği ve klinik olarak doğrulanmış örneklerin sınırlı erişilebilirliği, yalnızca gözlemlenen verilere dayalı ayırıcı modellerin genelleştirme kapasitesinikısıtlar. 4,5. Sonuç olarak, kontrol edilen deneysel ortamlarda raporlanan model performansı, çeşitli gerçek dünya senaryolarında güvenilir bir dağıtıma tutarlı şekilde dönüşmemektedir.

Bu sınırlamalar bir arada ele alındığında, kritik bir araştırma açığını ortaya koyuyor: veri kıtlığı, sınıf dengesizliği ve heterojen veri setleri arasında sağlam genellemeyi aynı anda ele alan birleşik bir çerçevenin olmaması. Üretken Karşıt Ağlar (GAN'lar) ve Varyasyonel Otokodlayıcılar (VAE) gibi üretken modeller gizli temsilleri öğrenmek ve gerçekçi biyomedikal sinyalleri sentezlemek içinaraştırılmış olsa da, mevcut çalışmalar genellikle bu modelleri bağımsız olarak kullanır ve tek bir veri seti içinde değerlendirir. Ayrıca, dikkatle güçlendirilmiş konvolüsyon mimarilerle entegrasyonları ve çapraz veri seti koşullarında değerlendirmeleri yeterince araştırılmamıştır.

Bu açığı gidermek için, mevcut çalışma, öksürük seslerinden COVID-19 tespiti için üretken yapay zeka destekli bir çerçeve önermektedir; bu çerçeve, akustik özellik çıkarımı hibrit GAN–VAE modeli ve dikkat temelli derin konvolüsyon sinir ağları (DCNN) ile bütünleştirir. Üretken bileşen, yapılandırılmış gizli temsil öğrenimi ve sentetik veri üretimi yoluyla sınıf dengesizliğini ve sınırlı örneklem kullanılabilirliğini azaltırken, ayırt edici modeller heterojen veri setleri arasında sınıflandırma dayanıklılığını artırır. Önceki çalışmaların çoğunlukla veri kümesi içi doğrulamaya dayanmasının aksine, önerilen çerçeve bağımsız bir veri seti üzerinde çapraz veri seti testleriyle değerlendirilir ve bu da genelleştirme performansının daha titiz bir şekilde değerlendirilmesini sağlar. Çerçeve, bağımsız bir tanı aracı değil, tarama odaklı bir yaklaşım olarak tasarlanmıştır ve tasarımı, tekrarlanabilir ve güvenilir dağıtımı desteklemek için kayıt değişkenliği ve etiket belirsizliğini açıkça hesaba katmaktadır.

Bu bağlamda, bu çalışmanın yenilikçi katkıları üç unsurdur. İlk olarak, birleşik bir GAN–VAE hibrit üretken çerçevesi, öksürük tabanlı COVID-19 taramasında sınıf dengesizliği, sınırlı veri kullanılabilirliği ve sağlam özellik temsili öğrenmesini birlikte ele almak için dikkat odaklı DCNN sınıflandırıcılarıyla entegre edilmiştir. İkinci olarak, önerilen yaklaşım, çapraz veri seti doğrulaması kullanılarak sistematik olarak değerlendirilir ve geleneksel veri seti içi testlere kıyasla model genellemesi açısından daha gerçekçi bir değerlendirme sağlar. Üçüncü olarak, çalışma, üretken artırmanın heterojen kayıt koşullarında etkisinin ayrıntılı bir analizini sunar ve böylece çerçeveyi ölçeklenebilir, pratik COVID-19 taraması için tekrarlanabilir bir kavram kanıtı olarak konumlandırır.

Yazar(lar) & YılVeri kümesi(ler)Kullanılan Teknikler / ÖzelliklerModel / SınıflandırıcıDoğruluk / MetriklerSınırlamalar / Notlar
Imran ve ark., 20208Kitlesel kaynaklı öksürük veri seti (AI4COVID-19)MFCC, transfer öğrenme, alan bağımlısı özelliklerRisk-averse multi-classifier (DL + ML ensemble)Doğruluk: %92,6Öksürük kalitesine bağlıdır; sınırlı klinik doğrulama
Brown ve ark., 20209Kitlesel kaynaklı solunum sesleri (>7.000 kullanıcı)El yapımı ses özellikleri, VGGvari gömülemelerSığ ML modelleriAUC > %80Kitlesel kaynaklı verilerde etiket gürültüsü
Laguarta ve ark., 202010MIT Open Voice veri seti (5.320 denek)MFCC, akustik biyobelirteçlerCNN (ResNet50, transfer öğrenme)Hassasiyet: %98,5, Spesifiklik: %94,2Büyük ön eğitim veri seti gerektirir
Quartieri ve ark., 202011Konuşma mülakatları (5 konu, COVID öncesi/sonrası)Solunum yoğunluğu, F0, CPP, formantlarİstatistiksel etki-boyut analiziTüm görevlerde %80'in üzerinde bir AUC elde edinÇok küçük örneklem büyüklüğü
Hassan ve ark., 202012Solunum sesleriZamansal konuşma özellikleriRNNÖksürük:%97, nefes:98,2%, ses:%88,2Detaylı veri seti istatistiklerinin eksikliği
Khamparia ve ark., 201913ESC-10, ESC-50Spektrogram görüntü tabanlı özelliklerCNN, TDSNCNN: %77 (ESC-10), %49 (ESC-50); TDSN: %56 (ESC-10)Sadece çevresel sesler; Karmaşık veri setlerinde daha düşük performans
Aykanat ve ark., 2017141.630 denekten 17.930 akciğer sesi (elektronik stetoskop)MFCC özellikleri, spektrogram görüntüleriSVM, CNNCNN/SVM: %86 (sağlıklı vs patolojik), %76/%75 (rale–rhonchus–normal), %80/%80 (tek tip), %62/%62 (tüm tipler)Özel donanım gerektirir; Hastalığa özgü değildir
Ponomarchuk ve ark., 202215Coswara, VirufyMFCC, mel-spektrogram, dalga siği özellikleriCNN, RNN, topluluk modelleriAUC: 0.93 (iç), 0.79 (hariç)Veri kümeleri arasında genelleme yapmak hâlâ zordur
Feng ve ark., 202116Coswara, VirufySTFT, MFCCSVM (RBF), CNNDoğruluk %81,25 (AUC 0,79)Veri setine bağlı performans
Islam ve ark., 202217Klinik öksürük kayıtlarıSpektral ve zaman-frekans özellikleriDerin sinir ağlarıDoğruluk: %89,2Sınırlı veri seti
Manshouri, 202218VirufySpektral analiz özellikleriKlasik ML sınıflandırıcılarıDoğruluk:%95,86Küçük ölçekli deneysel çalışma
Huang ve ark., 20201910 COVID-19 hastasının akciğer sesleriZaman-frekans solunum sesi analiziKlinik uzman analiziNiteliksel doğrulamaKüçük veri seti; makine öğrenimi modeli yok
W. D. Puja ve ark., 202420Coswara, Virufy (öksürük sesi veri setleri)STFT, Mel spektrogramı, MFCC, RMS enerjisi, spektral bant genişliği, spektral merkez, spektral roll-off, ZCR; CNN tabanlı derin özellik çıkarımı1D CNN (özellik çıkarıcı) + Rastgele OrmanDoğruluk: %93Performans, öksürük kalitesine bağlıdır; klinik tanı yerine tarama için tasarlanmıştı; Kitlesel veri değişkenliği
Chadaga ve ark., 202321Kitlesel kaynaklı öksürük ses kayıtlarıMel-spektrogram ve zaman-frekans akustik özellikleriKonvolüsyon Sinir Ağı (CNN)Doğruluk: %84, Hassasiyet: %85, Hatırlama: %84, F1 puanı: %84Performans, veri dengesizliği, kendi bildirimleri etiketleri ve kayıt koşullarına duyarlılık nedeniyle sınırlıdır
Chadaga ve ark., 202322Hafif-orta COVID-19 ve diğer solunum yolu hastalıkları klinik belirteçleriÖzellik seçimi (Pearson, PSO); Ana işaretleyiciler: Eozinofil, Albümin, T. Bilirubin, ALP, ALT, AST, HbA1c, TWBCÜst üste yığılmış topluluk; 1D CNN, LSTM, DNN, Kalıntı MLPDoğruluk: %89Ağır vakalar hariç; RT-PCR'ye alternatif olarak; açıklanabilir yapay zeka uygulandı
Dar ve ark. 202423COVID-19 Veri SetiSJHBO optimizasyonu (Jaya+HBO+SO), birçok spektral özellikDerin Q Ağı (DQN)Doğruluk: %95,11, Hassasiyet: %95,06, Spesifiklik: %94,69Yüksek karmaşıklık; Akort hibrit optimizer ile geliştiriliyor
Jing Quian ve diğerleri 202024COVID-19 hastalarından alınan konuşma kayıtlarıAkustik özellik setleri; Hastalık şiddeti, uyku kalitesi, yorgunluk, kaygı analiziDestek Vektör Makineleri (SVM)0.69 (hastalık şiddeti)Sadece ses özellikleriyle sınırlı; orta doğruluk; veri seti boyutu belirtilmemiştir; Sadece dört sağlık yönü ele alındı
Sharma, J. ve ark. 202025UrbanSound8K, ESC-10, ESC-50Çok özellikli kanallar: MFCC, GFCC, CQT, Kromagram; Karıştırılmış veri artırmaMekansal olarak ayrılabilir konvolüsyonlar ve dikkat modülleri içeren derin CNNUrbanSound8K: %97,52, ESC-10: %94,75, ESC-50: %87,45Kıyaslama dışı veya gerçek dünya veri setlerinde test edilmemiştir; Daha derin CNN ve dikkat modülleri nedeniyle hesaplamalı karmaşıklık
Lella KK ve ark. 202126 Solunum sesleri; COVID-19, astım, sağlıklı)veri artırma; MFCC yerine Data De-noising Auto Encoder (DDAE) kullanılarak derin özellikler1D Konvolüsyon Sinir Ağı (1D CNN)~%90Sınırlı veri seti detayları; MFCC'ye göre ~%4 iyileşme; Genellenebilirlik test edilmedi
Orlandic ve ark., 202127COUGHVID (25k+ öksürük)MFCC'ler, PSD, spektral ve zaman özellikleriXGBoostAUC %96,5, Precision %95,5Kendi kendine bildiren COVID; alt kümedeki uzman etiketleri
Zhang ve ark., 202343COVID-19 aşısı sonrası yayımlanmış HLH vaka raporları (literatür veritabanları)Sistematik inceleme; klinik özellik toplayıcısı; Moleküler kenetlenme analiziGeçerli değil (klinik inceleme)Betimleyici istatistik; Klinik sonuçlarNadir olay analizi; küçük örneklem büyüklüğü; Bildirilen vakalara güvenmek raporlama yanlılığına yol açabilir
Xu ve ark., 202344Literatürden aşı ile ilişkili VKH hastalığı vakaları bildirilmiştirGeriye dönük dava incelemesi; Klinik ve görüntüleme özellik analiziUygulanmaz (klinik gözlemsel çalışma)Tedavi yanıtı ve klinik iyileşme sonuçlarıSınırlı sayıda vaka; kontrol grubunun eksikliği; nedensel ilişki kesin olarak kurulamaz
Hu ve ark., 202545Çin'deki SRDI tıbbi cihaz şirketlerinin firma düzeyindeki ana-yan kuruluş verileri (Qixinbao veritabanı)Sosyal ağ analizi; uzaysal ağ metrikleri; Coğrafi dedektör analiziUygulanmaz (ağ ve politika analizi)Ağ yoğunluğu, merkezilik, yayılma endeksleriKesitsel tasarım; firmaların eşit ağırlıkları; Doğrudan performans veya klinik sonuç ölçütü yok

Tablo 1: Mevcut COVID-19 ses tabanlı tespit çalışmalarının özeti. Önceki öksürük/ses taraması yaklaşımlarının karşılaştırmalı genel bakışı; veri setleri, yöntemler ve bildirilen performans dahil. Bu tabloyu indirmek için lütfen buraya tıklayın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen Metodoloji

Bu çalışma, öksürük sinyallerinden COVID-19'u tespit etmek için üretken yapay zeka tabanlı bir çerçeve önermektedir. Çerçeve, üretken modelleri ayırt edici sınıflandırıcılarla entegre eder; eğitim ve değerlendirme verileri tamamen ayrı tutulur. Şekil 1, önerilen GAN–VAE–ADCNN çerçevesinin ayrıntılı mimarisini göstermekte; ses ön işleme ve özellik çıkarımından Varyasyonel Otomatik Kodlayıcı (VAE) aracılığıyla gizli temsil öğrenimi, Generatif Karşı Ağ (GAN) kullanılarak sentetik özellik üretimi ve Derin Konvolüsyon Sinir Ağları (DCNN) ile Dikkat Tabanlı DCNN (ADCNN) ile nihai sınıflandırma akışını gösterir. Şekil, üretken bileşenlerin yalnızca eğitim sırasında kullanıldığını, sınıflandırmanın ise ayırt edici modellerle yapıldığını göstermektedir.

figure-protocol-1
Şekil 1: GAN–VAE–ADCNN mimarisi genel bakış. Önerilen hibrit boru hattının şeması; öksürükten türetilen akustik özellikler VAE kullanılarak kodlanıyor, GAN tabanlı sentetik örnek üretimiyle güçlendirilip DCNN ve dikkat tabanlı DCNN (ADCNN) modelleriyle sınıflandırılıyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Model Mimarisi ve Uygulaması

Bu çerçevede kullanılan üretken ve ayırt edici modeller, sabit ve tekrarlanabilir mimarilerle uygulanmıştır. GAN, ReLU aktivasyonunu kullanan üç tam bağlantılı katmandan (128, 256 ve 512 birim) oluşan bir jeneratör ve LeakyReLU aktivasyonu ile sigmoid çıkışı kullanan üç tam bağlı katmanlı (512, 256 ve 128 birim) bir ayrımcıdan oluşur.

VAE kodlayıcısı, 256 ve 128 birimli iki tam bağlı katmandan oluşur; ardından 64 numaralı gizli ortalama ve varyans tahmini gelir. Kodlayıcı bu yapıyı yansıtır ve yeniden yapılandırma kaybı ile Kullback–Leibler ayrımının birleşimiyle eğitilerek yapılandırılmış ve olasılıksal bir gizli uzay öğrenilir.

DCNN sınıflandırıcısı, sırasıyla 3x3 çekirdekli dört konvolüsyon bloğu ve 32, 64, 128 ve 256 filtreli blokları içerir. Her bloktan sonra toplu normalizasyon, ReLU aktivasyonu ve 2x2 maksimum havuzlama yapılır. ADCNN, son konvolüsyon bloktan sonra kanal bazında dikkat mekanizması ekleyerek DCNN'yi genişletir. Tüm modeller, Adam optimizatörü kullanılarak optimize edildi; öğrenme oranı 0.0001 ve parti boyutu 32 oldu. Şekil 1'de gösterildiği gibi, VAE ve GAN yalnızca eğitim sırasında çalışırken, DCNN ve ADCNN sınıflandırma için kullanılır. Tam eğitim ve değerlendirme prosedürü Algoritma 1'de özetlenmiştir.

Algoritma 1: GAN–VAE Tabanlı COVID-19 Tespit Çerçevesi

Giriş: Önceden işlenmiş öksürük ses kayıtları

Çıktı: İkili sınıflandırma etiketi (COVID-19 pozitif/negatif)

Eğitim ve değerlendirme prosedürleri sabit, tekrarlanabilir bir hattı takip etti. Tüm öksürük ses kayıtları 16 kHz'e yeniden örneklendi, gürültü azaltmaya tabi tutuldu ve genlik normalleştirildi. Kayıtlar, sabit uzunluklu segmentlere ayrılmış, bunlardan MFCC, kroma ve spektral özellikler çıkarılmıştır. Her ses segmentinden toplam 40 Mel-Frekans Cepstral Katsayısı (MFCC) çıkarıldı. Buna ek olarak, 12 kroma özelliği hesaplandı. Ortaya çıkan temsil, her öksürük segmenti için 52 boyutlu bir özellik vektörü oluşturur. Veri eğitim, doğrulama ve test setlerine bölünmek için konu düzeyinde bölünme yapıldı. VAE, olasılıksal gizli temsilleri öğrenmek üzere eğitildi ve ortaya çıkan gizli vektörler, GAN'ı sentetik özellik üretimi için eğitmek için kullanıldı. Eğitim veri seti GAN–VAE tarafından oluşturulan örneklerle genişletildi, sentetik veriler doğrulama ve testten dışlandı. DCNN ve ADCNN sınıflandırıcıları artırılmış eğitim verileri üzerine eğitildi ve nihai değerlendirme standart performans metrikleri kullanılarak yapılan test setinde gerçekleştirildi.

Eğitim Kurulumu, Veri Bölmesi ve Sızıntı Önleme

Tüm deneyler sabit, tekrarlanabilir bir eğitim konfigürasyonu ile gerçekleştirildi. Veri sızıntısını önlemek için ses segmentasyonundan önce konu düzeyinde veri bölmesi yapıldı. Veri seti, 80:10:10 oranında eğitim, doğrulama ve test setlerine ayrılmış, böylece aynı kaydın tüm bölümleri tek bir alt kümeye atanmıştır. Eğitim seti, model öğrenimi ve üretken veri artırma için, doğrulama seti hiperparametre ayarlama ve erken durdurma için kullanıldı ve test seti nihai performans değerlendirmesi için sunuldu. GAN–VAE çerçevesi tarafından oluşturulan sentetik örnekler yalnızca eğitim sırasında kullanıldı ve adil değerlendirme için doğrulama ve testlerden kesin olarak çıkarıldı.

Modeller maksimum 100 dönem için eğitilmiş, doğrulama kaybına dayalı erken durma ve 10 dönemlik sabırla destekleniyordu. Optimizasyon, Adam optimizatörü kullanılarak 0.0001 öğrenme oranı ve 32 parti büyüklüğüyle gerçekleştirildi. Sınıflandırma için ikili çapraz entropi kaybı uygulanırken, VAE ve GAN bileşenlerinin eğitimi için yeniden yapılandırma ve rakip kayıplar kullanıldı. Bu birleşik eğitim ve değerlendirme protokolü, tekrarlanabilirliği sağlar, veri sızıntısını önler ve eğitim ile değerlendirme aşamaları arasında sıkı ayrım sağlar.

Veri Seti Tanımı

İki kamuya açık öksürük ses veri seti — COUGHVID ve Virufy — büyük ölçekli akustik çeşitliliği klinik referanslı etiketlerle dengelemek için kullanıldı ve eğitim ile değerlendirmede roller açıkça ayrıldı.

COUGHVID, kısmi uzman notları ve kendi rapor edilen meta verilerle birlikte oluşan öksürük kayıtlarından oluşan kitlesel kaynaklı bir koleksiyondur. Veri kalitesini sağlamak için, minimum sinyal süresi, yeterli sinyal-gürültü oranı, bozuk veya belirsiz örneklerin çıkarılması ve belirti meta verileriyle tanımlanabilir öksürük olaylarının varlığı gibi önceden tanımlanmış kalite kontrol kriterleri uygulanarak 428 kayıt seçildi. Ön işleme ve segmentasyondan sonra, bu kayıtlar 1.719 öksürük segmenti elde etti; bu segmentler 16 kHz örnekleme hızında WAV formatına standartlaştırıldı. COUGHVID, hem üretken modelleri hem de ayırt edici sınıflandırıcıları eğitmek için kullanıldı.

Virufy, doktor gözetiminde yapılan öksürük kayıtlarından oluşur ve COVID-19 için RT-PCR pozitif veya negatif olarak etiketlenir. Tüm 16 mevcut kayıt dahil edildi ve bu da segmentasyondan sonra 234 öksürük segmenti elde edildi ve bunlar da 16 kHz'ye standartlaştırıldı. Virufy, genelleme performansını değerlendirmek için yalnızca harici çapraz veri seti değerlendirmesi için kullanıldı ve eğitim, ince ayar veya üretken artırma için kullanılmadı.

Bu nedenle, önerilen çerçeve, klinik olarak doğrulanmış bir tanı sistemi olarak değil, kontrollü deneysel koşullar altında değerlendirilen bir kavram kanıtı tarama yaklaşımı olarak yorumlanmalıdır.

Veri Ön İşleme ve Segmentasyon

Tüm kayıtlar 16 kHz'e yeniden örneklendi, monoya dönüştürüldü ve sessizlik çıkarma, spektral gürültü azaltma ve genlik normalizasyonuna tabi tutuldu. Veri sızıntısını önlemek için konu düzeyinde bölünmeden sonra segmentasyon yapıldı. Her kayıt, üst üste binen 2–4 saniyelik segmentlere bölünür ve düşük enerjili veya sessiz bölümler atılır.

Dış Doğrulama Protokolü

Dış doğrulama, çapraz veri seti değerlendirmesi yoluyla gerçekleştirildi. COUGHVID üzerinde eğitilen modeller, dış doğrulama için Virufy üzerinde değerlendirildi. Bu protokol, farklı koşullar altında toplanan veri setleri arasında genellemeyi değerlendirir, prospektif klinik doğrulama yerine geçerlidir. Şekil 2, veri seti kullanımı, ön işleme, özellik çıkarma, sınıflandırıcı eğitimi ve değerlendirme senaryolarını gösteren protokol düzeyinde bir iş akışını sunmaktadır. Şekil 1 iç model mimarisine odaklanırken, Şekil 2 eğitim ve test aşamaları arasında deneysel tasarım ve veri akışını vurgular.

figure-protocol-2
Şekil 2: Önerilen COVID-19 öksürük tarama çerçevesinin iş akışı. Ön işleme, özellik çıkarımı (MFCC, kroma, spektral özellikler), GAN–VAE tabanlı temsil öğrenme ve artırma (sadece eğitim) ve konu düzeyinde bölünme ve çapraz veri seti değerlendirmesi kapsamında nihai sınıflandırma dahil olmak üzere tam işleme boru hattının illüstrasyonu. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Veri Seti Kompozisyonu ve Sınıf Dağılımı Analizi

Ön işleme ve segmentasyondan sonra, COUGHVID ve Virufy veri setleri hem veri seti ölçeği hem de segment yoğunluğu açısından önemli farklılıklar göstermiştir. COUGHVID, 444 kaydın 428'ini (%96,4) ve çıkarılan 1.953 öksürük segmentinin 1.719'unu (%88,0) sağladı; bu da model eğitimi ve üretken artırma için birincil veri seti rolünü doğruladı (Şekil 3). Buna karşılık, V...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sonuçlar, önerilen üretken yapay zeka tabanlı çerçevenin heterojen veri setlerinde öksürük sinyallerinden COVID-19'u tespit edebildiğini göstermektedir. Tablo 4 ve Tablo 6'da gösterildiği gibi, GAN–VAE hibrit modeli en iyi performansı elde etti; %97,2 doğruluk ve 0,953 AUROC'la, ayrıca yüksek hassasiyet, geri çağırma, F1 puanı ve özgüllük ile dengeli sınıflandırma performansını gösterdi.

Üretken modeller ayırt edici sınıflandı...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazar(lar) tarafından potansiyel bir çıkar çatışması bildirilmemiştir.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu makalenin hazırlanması sırasında değerli rehberlik, sürekli destek ve yapıcı geri bildirimler için Bilgisayar Bilimleri ve Mühendisliği Fakültesi'ndeki öğretim üyelerine ve araştırma mentorlarına içten teşekkürlerimizi sunuyoruz.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
COUGHVID Veri Seti& Eacute; cole Polytechnique Fé dé Rale de Lausanne (EPFL)Kamuya açık yayın (2021)Kendi rapor edilen meta veriler ve kısmi doktor notasyonlarıyla kitlesel kaynaklı öksürük ses veri seti; esas olarak eğitim ve veri artırma için kullanılır.
CUDA Araç SetiNVIDIA11.3GPU hızlandırma çerçevesi, model eğitimi ve çıkarımı hızlandırmak için kullanılır.
LibROSAAçık Kaynak0.9Yeniden örnekleme, segmentasyon, MFCC çıkarımı ve spektral özellik hesaplaması için kullanılan ses analiz kütüphanesi.
Linux İşletim SistemiKanonikUbuntu 20.04 LTSTüm deneyler ve model eğitimi için kullanılan işletim sistemi.
MatplotlibAçık Kaynak3.5Veri seti dağılımlarını ve değerlendirme sonuçlarını çizmek için kullanılan görselleştirme kütüphanesi.
NumPyAçık Kaynak1.21Dizi işleme ve sinyal işleme işlemleri için kullanılan sayısal hesaplama kütüphanesi.
NVIDIA GPUNVIDIATesla / RTX sınıfıDerin ve üretken modelleri eğitmek için kullanılan grafik işlem birimi.
Python Programlama DiliPython Yazılım Vakfı3.8Veri ön işleme, özellik çıkarma, model geliştirme ve değerlendirme için kullanılan temel programlama ortamı.
PyTorchMeta (Facebook AI Araştırması)1.12GAN, VAE, DCNN ve dikkat temelli DCNN modellerini uygulamak için kullanılan derin öğrenme çerçevesi.
Scikit-learnAçık Kaynak1Veri bölme, sınıf ağırlıklandırma ve performans metrik hesaplaması için kullanılan makine öğrenimi kütüphanesi.
SciPyAçık Kaynak1.7Ses ön işleme ve sinyal dönüşümleri için kullanılan bilimsel hesaplama kütüphanesi.
Virufy DatasetVirufyKamuya açık yayın (2021)Klinik olarak RT-PCR&ndash ile toplanmış öksürük kayıtları; doğrulanmış COVID-19 etiketleri; yalnızca dış doğrulama ve çapraz veri seti değerlendirmesi için kullanılır.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Cough Audio AnalysisCough Sound RecordingsMel Frequency CepstralVariational AutoencodersGenerative Adversarial NetworksDeep Convolutional NetworksAcoustic Health MonitoringSignal Denoising

İlgili makaleler