$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Önerilen Metodoloji
Bu çalışma, öksürük sinyallerinden COVID-19'u tespit etmek için üretken yapay zeka tabanlı bir çerçeve önermektedir. Çerçeve, üretken modelleri ayırt edici sınıflandırıcılarla entegre eder; eğitim ve değerlendirme verileri tamamen ayrı tutulur. Şekil 1, önerilen GAN–VAE–ADCNN çerçevesinin ayrıntılı mimarisini göstermekte; ses ön işleme ve özellik çıkarımından Varyasyonel Otomatik Kodlayıcı (VAE) aracılığıyla gizli temsil öğrenimi, Generatif Karşı Ağ (GAN) kullanılarak sentetik özellik üretimi ve Derin Konvolüsyon Sinir Ağları (DCNN) ile Dikkat Tabanlı DCNN (ADCNN) ile nihai sınıflandırma akışını gösterir. Şekil, üretken bileşenlerin yalnızca eğitim sırasında kullanıldığını, sınıflandırmanın ise ayırt edici modellerle yapıldığını göstermektedir.

Şekil 1: GAN–VAE–ADCNN mimarisi genel bakış. Önerilen hibrit boru hattının şeması; öksürükten türetilen akustik özellikler VAE kullanılarak kodlanıyor, GAN tabanlı sentetik örnek üretimiyle güçlendirilip DCNN ve dikkat tabanlı DCNN (ADCNN) modelleriyle sınıflandırılıyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Model Mimarisi ve Uygulaması
Bu çerçevede kullanılan üretken ve ayırt edici modeller, sabit ve tekrarlanabilir mimarilerle uygulanmıştır. GAN, ReLU aktivasyonunu kullanan üç tam bağlantılı katmandan (128, 256 ve 512 birim) oluşan bir jeneratör ve LeakyReLU aktivasyonu ile sigmoid çıkışı kullanan üç tam bağlı katmanlı (512, 256 ve 128 birim) bir ayrımcıdan oluşur.
VAE kodlayıcısı, 256 ve 128 birimli iki tam bağlı katmandan oluşur; ardından 64 numaralı gizli ortalama ve varyans tahmini gelir. Kodlayıcı bu yapıyı yansıtır ve yeniden yapılandırma kaybı ile Kullback–Leibler ayrımının birleşimiyle eğitilerek yapılandırılmış ve olasılıksal bir gizli uzay öğrenilir.
DCNN sınıflandırıcısı, sırasıyla 3x3 çekirdekli dört konvolüsyon bloğu ve 32, 64, 128 ve 256 filtreli blokları içerir. Her bloktan sonra toplu normalizasyon, ReLU aktivasyonu ve 2x2 maksimum havuzlama yapılır. ADCNN, son konvolüsyon bloktan sonra kanal bazında dikkat mekanizması ekleyerek DCNN'yi genişletir. Tüm modeller, Adam optimizatörü kullanılarak optimize edildi; öğrenme oranı 0.0001 ve parti boyutu 32 oldu. Şekil 1'de gösterildiği gibi, VAE ve GAN yalnızca eğitim sırasında çalışırken, DCNN ve ADCNN sınıflandırma için kullanılır. Tam eğitim ve değerlendirme prosedürü Algoritma 1'de özetlenmiştir.
Algoritma 1: GAN–VAE Tabanlı COVID-19 Tespit Çerçevesi
Giriş: Önceden işlenmiş öksürük ses kayıtları
Çıktı: İkili sınıflandırma etiketi (COVID-19 pozitif/negatif)
Eğitim ve değerlendirme prosedürleri sabit, tekrarlanabilir bir hattı takip etti. Tüm öksürük ses kayıtları 16 kHz'e yeniden örneklendi, gürültü azaltmaya tabi tutuldu ve genlik normalleştirildi. Kayıtlar, sabit uzunluklu segmentlere ayrılmış, bunlardan MFCC, kroma ve spektral özellikler çıkarılmıştır. Her ses segmentinden toplam 40 Mel-Frekans Cepstral Katsayısı (MFCC) çıkarıldı. Buna ek olarak, 12 kroma özelliği hesaplandı. Ortaya çıkan temsil, her öksürük segmenti için 52 boyutlu bir özellik vektörü oluşturur. Veri eğitim, doğrulama ve test setlerine bölünmek için konu düzeyinde bölünme yapıldı. VAE, olasılıksal gizli temsilleri öğrenmek üzere eğitildi ve ortaya çıkan gizli vektörler, GAN'ı sentetik özellik üretimi için eğitmek için kullanıldı. Eğitim veri seti GAN–VAE tarafından oluşturulan örneklerle genişletildi, sentetik veriler doğrulama ve testten dışlandı. DCNN ve ADCNN sınıflandırıcıları artırılmış eğitim verileri üzerine eğitildi ve nihai değerlendirme standart performans metrikleri kullanılarak yapılan test setinde gerçekleştirildi.
Eğitim Kurulumu, Veri Bölmesi ve Sızıntı Önleme
Tüm deneyler sabit, tekrarlanabilir bir eğitim konfigürasyonu ile gerçekleştirildi. Veri sızıntısını önlemek için ses segmentasyonundan önce konu düzeyinde veri bölmesi yapıldı. Veri seti, 80:10:10 oranında eğitim, doğrulama ve test setlerine ayrılmış, böylece aynı kaydın tüm bölümleri tek bir alt kümeye atanmıştır. Eğitim seti, model öğrenimi ve üretken veri artırma için, doğrulama seti hiperparametre ayarlama ve erken durdurma için kullanıldı ve test seti nihai performans değerlendirmesi için sunuldu. GAN–VAE çerçevesi tarafından oluşturulan sentetik örnekler yalnızca eğitim sırasında kullanıldı ve adil değerlendirme için doğrulama ve testlerden kesin olarak çıkarıldı.
Modeller maksimum 100 dönem için eğitilmiş, doğrulama kaybına dayalı erken durma ve 10 dönemlik sabırla destekleniyordu. Optimizasyon, Adam optimizatörü kullanılarak 0.0001 öğrenme oranı ve 32 parti büyüklüğüyle gerçekleştirildi. Sınıflandırma için ikili çapraz entropi kaybı uygulanırken, VAE ve GAN bileşenlerinin eğitimi için yeniden yapılandırma ve rakip kayıplar kullanıldı. Bu birleşik eğitim ve değerlendirme protokolü, tekrarlanabilirliği sağlar, veri sızıntısını önler ve eğitim ile değerlendirme aşamaları arasında sıkı ayrım sağlar.
Veri Seti Tanımı
İki kamuya açık öksürük ses veri seti — COUGHVID ve Virufy — büyük ölçekli akustik çeşitliliği klinik referanslı etiketlerle dengelemek için kullanıldı ve eğitim ile değerlendirmede roller açıkça ayrıldı.
COUGHVID, kısmi uzman notları ve kendi rapor edilen meta verilerle birlikte oluşan öksürük kayıtlarından oluşan kitlesel kaynaklı bir koleksiyondur. Veri kalitesini sağlamak için, minimum sinyal süresi, yeterli sinyal-gürültü oranı, bozuk veya belirsiz örneklerin çıkarılması ve belirti meta verileriyle tanımlanabilir öksürük olaylarının varlığı gibi önceden tanımlanmış kalite kontrol kriterleri uygulanarak 428 kayıt seçildi. Ön işleme ve segmentasyondan sonra, bu kayıtlar 1.719 öksürük segmenti elde etti; bu segmentler 16 kHz örnekleme hızında WAV formatına standartlaştırıldı. COUGHVID, hem üretken modelleri hem de ayırt edici sınıflandırıcıları eğitmek için kullanıldı.
Virufy, doktor gözetiminde yapılan öksürük kayıtlarından oluşur ve COVID-19 için RT-PCR pozitif veya negatif olarak etiketlenir. Tüm 16 mevcut kayıt dahil edildi ve bu da segmentasyondan sonra 234 öksürük segmenti elde edildi ve bunlar da 16 kHz'ye standartlaştırıldı. Virufy, genelleme performansını değerlendirmek için yalnızca harici çapraz veri seti değerlendirmesi için kullanıldı ve eğitim, ince ayar veya üretken artırma için kullanılmadı.
Bu nedenle, önerilen çerçeve, klinik olarak doğrulanmış bir tanı sistemi olarak değil, kontrollü deneysel koşullar altında değerlendirilen bir kavram kanıtı tarama yaklaşımı olarak yorumlanmalıdır.
Veri Ön İşleme ve Segmentasyon
Tüm kayıtlar 16 kHz'e yeniden örneklendi, monoya dönüştürüldü ve sessizlik çıkarma, spektral gürültü azaltma ve genlik normalizasyonuna tabi tutuldu. Veri sızıntısını önlemek için konu düzeyinde bölünmeden sonra segmentasyon yapıldı. Her kayıt, üst üste binen 2–4 saniyelik segmentlere bölünür ve düşük enerjili veya sessiz bölümler atılır.
Dış Doğrulama Protokolü
Dış doğrulama, çapraz veri seti değerlendirmesi yoluyla gerçekleştirildi. COUGHVID üzerinde eğitilen modeller, dış doğrulama için Virufy üzerinde değerlendirildi. Bu protokol, farklı koşullar altında toplanan veri setleri arasında genellemeyi değerlendirir, prospektif klinik doğrulama yerine geçerlidir. Şekil 2, veri seti kullanımı, ön işleme, özellik çıkarma, sınıflandırıcı eğitimi ve değerlendirme senaryolarını gösteren protokol düzeyinde bir iş akışını sunmaktadır. Şekil 1 iç model mimarisine odaklanırken, Şekil 2 eğitim ve test aşamaları arasında deneysel tasarım ve veri akışını vurgular.

Şekil 2: Önerilen COVID-19 öksürük tarama çerçevesinin iş akışı. Ön işleme, özellik çıkarımı (MFCC, kroma, spektral özellikler), GAN–VAE tabanlı temsil öğrenme ve artırma (sadece eğitim) ve konu düzeyinde bölünme ve çapraz veri seti değerlendirmesi kapsamında nihai sınıflandırma dahil olmak üzere tam işleme boru hattının illüstrasyonu. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.