Yöntem makalesi

XGBoost Temelli Patolojik Ses Tanıma Araştırmaları

DOI:

10.3791/68784

29 Mayıs 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada, Saarbrücken veritabanı kullanılarak ses telleri poliplerini teşhis etmek için invaziv olmayan XGBoost tabanlı bir yapay zeka modeli oluşturmak için bir protokol sunuyoruz.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

İnsan sosyal iletişiminin sürekli büyümesiyle, ses bozukluklarından muzdarip olan kişi sayısı da artmaktadır. Patolojik ses için akustik algılama yöntemlerinin nesnel ve invaziv olmayan avantajları nedeniyle, patolojik ses tanıma için konuşma sinyali analizinin kullanımı bir araştırma merkezi haline gelmiştir. Bu makale ilk olarak Almanca SVD veritabanından 101 sürekli ünlü /a/ seçilmiş ve araştırma nesnesi olarak seçilmiştir. İkinci olarak, zaman-frekans analizi için wavelet paket teknolojisi kullanılarak, yaklaşık entropi, örnek entropisi, bulanık entropisi ve permütasyon entropisi olmak üzere dört doğrusal olmayan dinamik parametre, patolojik ses sınıflandırıcısının özellik parametre seti olarak alt sinyallerden çıkarılır. Son olarak, patolojik bir ses sınıflandırıcı oluşturmak için desen tanıma yöntemi olarak makine öğrenimi algoritması XGBoost seçilir ve sınıflandırma performansı beş katlı çapraz doğrulama ve ROC eğrisi kullanılarak doğrulanır. Deneysel sonuçlar, XGBoost'un patolojik ses sınıflayıcısının doğruluğunun 0.857, F1 puanının 0.875 ve AUC değerinin 0.944 olduğunu göstermiştir; bunların hepsi SVM tarafından oluşturulan sınıflandırıcıdan daha yüksektir ve XGBoost'un patolojik ses tanıma konusunda daha iyi performans gösterdiğini gösterir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ses bozukluklarından muzdarip olan kişi sayısı sürekli artmaktadır. İstatistiklere göre, nüfusun üçte biri hayatlarının bir noktasında ses sorunlarıyaşar 1. Şarkıcılar ve öğretmenler gibi profesyonel ses kullanıcıları için, seslerini sık sık kötüye kullanmaları ve kötüye kullanımı nedeniyle boğaz hastalıkları görülmesi daha yüksektir. Tianjin ve Urumçi'deki öğretmenler üzerinde yapılan iki çalışma anket yaptı ve sonuçlar ses bozuklukları yaşama olasılığının sırasıyla %33,81 ve %28,23 olduğunu gösterdi. Sonuç olarak, klinik uygulamada patolojik sesin tespiti ve teşhisine artan bir önem verilmektedir. Şu anda, klinik uygulamada ses hastalıklarının tanısında esas olarak öznel değerlendirme yöntemleri, laringoskopi muayenesi ve akustik tespityöntemleri kullanılmaktadır 4,5. Akustik algılama yöntemi, ses sinyallerini araştırma için dijital sinyallere dönüştürerek nesnelliği sağlar ve muayene sırasında hasta ağrısınıönler. Bu nedenle, akustik tespit klinik tanıda doktorlar için etkili bir yardımcı araç haline gelmiş ve bu konuda araştırmalar artmaktadır.

Akustik analiz yöntemleriyle patolojik sesin teşhisi için en önemli teknikler, özellik çıkarma ve desen tanımadır. 1960'lardan bu yana araştırmacılar, patolojik sesin incelenmesi için bazı geleneksel akustik parametreler çıkarmakta ve temel frekans bozulması, genlik bozulması ve Mel-frekans cepstral katsayıları (MFCC) gibi birçok etkili ve sağlam akustik özellik parametresi bulmuşlardır. Son yıllarda, araştırmacılar sadece geleneksel akustik karakteristik parametreleri incelemekle sınırlı kalmıyor, aynı zamanda doğrusal olmayan dinamik parametreler patolojik ses tanıma alanında da kullanılmayabaşlanmıştır 8. Ayrıca çok iyi bir etkisi var. Makine öğreniminin hızlı gelişimiyle birlikte, hızlı çalışma hızına ve iyi sınıflandırma performansına sahip daha fazla desen tanıma yöntemi ortaya çıkmıştır. Ayrıca, patolojik ses tanıma alanında destek vektör makineleri (SVM), rastgele orman, sinir ağları, derin öğrenme 9,10 gibi patolojik ses tanıma yöntemleri de giderek daha fazla kullanılmaktadır. XGBoost, son yıllarda ilgi gören bir desen tanımayöntemidir 11. Özellik normalizasyonu gerektirmez ve özellikleri kendi başına seçebilir. Çeşitli kayıp fonksiyonlarına uyum sağlayabilir ve aşırı uyumu önlemek için düzenleme terimleri kullanır. Hızlı hız, taşınabilirlik ve hata toleransı özelliklerine sahiptir. Bu nedenle, bu makale daha iyi tanıma sonuçları elde etmek için XGBoost yöntemini patolojik ses tanımaya uygulamayı amaçlamaktadır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmanın teknik iş akışı Şekil 1'de gösterilmiştir.

1. Ses örneklerinin edinilmesi

  1. Deneysel verileri Almanya'daki SVD'denalın 12.
  2. 101 ünlü /a/ ses verisi alın; bunların 45'i (19 erkek ve 26 kadın) ses polip hastası ve 56 vakası (28 erkek ve 28 kadın) normal bireyler var.

2. Ses verisinin dalga paketiayrıştırması 13

  1. MATLAB R2023a yazılımı kullanarak üç Daubechies dalgacısı (db1, 3, 5) ve üç ayrıştırma derinliği (4, 6, 8 seviye) üzerinde kapsamlı bir arama yapın.
  2. Konuşma sinyalini 16 alt banda (her biri 500 Hz çözünürlük) bölmek için 16 kHz örnekleme hızı, dört seviyeli db3 dalgalet paket ayrıştırması (WPD) kullanın (Şekil 2).

3. Özellik parametre çıkarımı

  1. Python 3.10 ile 4 seviyeli WPD ile elde edilen 16 alt banttan ayrık katsayılı diziler çıkarın; bu diziler aşağıda açıklanan tüm entropi denklemleri için giriş değerleri olarak hizmet eder.
    NOT: Bu çalışmada kullanılan tüm denklemler daha önce yayımlanmış algoritmalardan (references'te olduğu gibi) türetilmiş ve bağımsız olarak türetilmemiştir.
  2. 16 WPD alt bant dizisi için yaklaşıkentropiyi aşağıdaki 14 formülle hesaplayın:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]Parametreler: Pattern boyutu m 2 olarak seçilir ve benzerlik toleransı r standartsapma 14'ün 0,1 ile 0,25 katı olarak seçilir.
  3. 16 WPD alt bant dizisi için örnek entropisiniaşağıdaki 15 formülle hesaplayın:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]Parametreler: Pattern boyutu m 1 veya 2 olarak seçilir ve benzerlik toleransı r standartsapma 15'in 0.1 ile 0.25 çarpı olarak seçilir.
  4. Bulanık üyelik fonksiyonunu aşağıdaki16 altındaki formülle hesaplayın:
    figure-protocol-5(7)
  5. Bulanık entropiyi17'nin altındaki formülle hesaplayın:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    Parametreler: Pattern boyutu m 2 olarak seçilir ve benzerlik toleransı r standart sapmanın 0,15 katı olarak seçilir.
  6. Permütasyon entropisini18'in altındaki formülle hesaplayın:
    figure-protocol-9(11)
    Parametreler: Pattern boyutu m 6 olarak seçilir ve permütasyon entropisi çıkarımı için zaman gecikmesi L = 2 nihayetinde belirlenmiştir.

4. Model kurulum

  1. Normal ve ses teli polipli hastalardan alınan ses örneklerini bir eğitim veri seti ve 8:2 oranında bir test veri setine ayırın.
  2. Parametre ayarı ve model eğitimi için eğitim veri setini kullanın ve ardından ortaya çıkan sınıflandırıcıyı hastalık sınıflandırması için test veri setine uygulayın.
  3. SVM modelleme prosedürünü Python 3.10 ile gerçekleştirin.
    1. SVM çekirdek performanslarını karşılaştırarak verinin doğrusal olmayan yapısını doğrulayın. Doğrusal çekirdekle yapılan ilk testler düşük doğruluk verirken, radyal baz fonksiyonu (RBF) çekirdeği sınıflandırma sonuçlarını önemli ölçüde iyileştirerek özellik alanının doğrusal olmayan bir karar sınırı gerektirdiğini göstermiştir.
    2. SVM sınıflandırıcısı için 16 boyutlu entropi özellik vektörlerini (WPD ile çıkarılan) giriş olarak kullanın. Doğrusal olmayan ses özelliklerini yüksek boyutlu bir uzaya eşlemek için bir RBF çekirdeği uygulayın.
    3. Python (scikit-learn) kullanarak eğitim aşamasında ceza katsayısı C ile çekirdek genişliğinin γ optimal kombinasyonunu belirlemek için ızgara araması yapın. Her parametre setini, çapraz doğrulama tanıma oranını maksimize ederek değerlendirin.
    4. SVM modelini, normal bireylerden ve ses teli polipleri olan hastalardan alınan ses örnekleriyle eğitin. Şebeke aramasından elde edilen optimal hiperparametreleri kullanarak nihai eğitilmiş modeli oluşturun.
    5. Eğitilmiş modeli görünmeyen test örneklerine uygulayın. Her test örneği, eğitim verisiyle aynı WPD ve entropi çıkarma prosedüründen geçer. SVM, test özellik vektörünün optimize edilmiş karar sınırına göre mekansal konumuna dayanarak ikili sınıf etiketini (normal ve ses telleri polipleri) tahmin eder.
  4. Python 3.10 kullanarak XGBoost modelleme prosedürünü gerçekleştirin.
    1. Eğitim aşamasında temel hiperparametreleri (öğrenme hızı ve ağaç derinliği dahil) optimize etmek için Python tabanlı bir ızgara araması kullanın. Sınıflandırma doğruluğunu en üst düzeye çıkaran yapılandırmayı belirlemek için çapraz doğrulama yoluyla birden fazla parametre kombinasyonunu değerlendirin.
    2. Ses örneklerinden çıkarılan on altı entropi özelliğini kullanarak ikili bir XGBoost sınıflandırıcısını eğitin. Şebeke aramasından elde edilen optimal hiperparametreleri kullanarak nihai modeli oluşturun.
    3. Eğitilen modeli, görünmez örneklerden oluşan bağımsız bir doğrulama seti üzerinde test edin. Bu adım, sınıflandırıcının genelleştirme yeteneğini, eğitim sırasında kullanılmayan veriler üzerindeki performansını değerlendirerek değerlendirir.

5. Model performansının değerlendirilmesi

  1. Beş aşamalı çapraz doğrulama yöntemi uygulayın.
    1. Ön işlenmiş ses veri setini rastgele beş eşit kata ayırın. Modeli oluşturmak için eğitim seti olarak dört katı kullanın ve kalan bir katı performans değerlendirmesi için doğrulama seti olarak kullanın.
    2. Bu işlemi beş kez tekrarlayın. Beş yinelemenin sonuçlarının ortalamasını nihai model performansı olarak kullanın.
  2. Kafa karışıklığı matrisini elde edin.
    1. Sınıflandırıcının tahmin edilen etiketlerini, beş kat çapraz doğrulama sonuçlarına göre tüm test örnekleri için temel doğruluk etiketleriyle karşılaştırarak karışıklık matrisi oluşturun. Bu bireysel karşılaştırmaları, doğru ve yanlış sınıflandırmaları nicelendirmek için Python scikit-learn kütüphanesini kullanarak bir acil durum tablosuna toplayın; Tablo 1'de gösterildiği gibi.
  3. Bir sınıflandırma modelinin etkinliğini tanımlamak için doğruluk, hassasiyet, hassasiyet ve F1 puanını hesaplayın. İlgili hesaplama formülleri şunlardır.
    Doğruluk = (TP + TN)/(TP + TN + FP + FN)
    Hassasiyet = TP/(TP + FP)
    Hassasiyet = Geri Çağırma = TPR = TP/(TP+ FN)
    F1 = (2 × Hassasiyet × Geri Çağırma)/ (Hassasiyet + Geri Çağırma)
    NOT: Bu metrikler (TP, TN, FP, FN) karışıklık matrisinin elemanlarından türetilmiştir.
  4. ROC eğrisini AUC ile tanımlayın.
    1. Tüm sınıflandırma eşiklerinde gerçek pozitif oran (TPR) ile yanlış pozitif oranı (FPR) arasındaki uzlaşmayı görselleştirmek için ROC eğrisini çizin. Modelin genel ayırt etme yeteneğini niceltmek için özet bir metrik olarak Eğri Altındaki Alanı (AUC) hesaplayın.
      NOT: AUC değeri, 1'e daha yakın olan bir AUC değeri, sınıflandırıcının normal bireyler ile ses teli polipleri olanlar arasında, belirli karar eşiğinden bağımsız olarak doğru ayırt etme olasılığının daha yüksek olduğunu gösterir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada, ses sinyallerinin zaman-frekans ayrıştırmasını gerçekleştirmek için wavelet paket analizi kullanılmıştır. Doğrusal olmayan dinamik parametreler—yaklaşık entropi, örnek entropisi, bulanık entropi ve permütasyon entropisi dahil olmak üzere—ses teli polipleriyle ilişkili patolojik seslerin karmaşıklık ve düzensizlik özellikleri sistematik olarak karakterize edildi. Daha sonra, destek vektör makinesi (SVM) algoritması ve XGBoost algoritmasına dayalı olarak iki patolojik ses sın...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Konuşma sinyali analiziyle patolojik ses teşhisi, invaziv olmayan ve objektif biryaklaşımı temsil eder 19. Sonuç olarak, patolojik ses sınıflandırması, konuşma sinyal işleme ve tanıma alanında önemli bir araştırma odak noktası olarak ortaya çıkmış ve önemli klinik uygulama değeri ile gelişimsel perspektiflergöstermiştir 20. Bu çalışma, SVD'den toplanan konuşma örneklerini deneysel korpora olarak kullanmıştır. Konuşma sinyal işleme ve makine...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, rekabet eden çıkarları olmadığını belirtirler.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Çalışma, Jiangsu Eyaleti Hastane Yetenek Geliştirme Projesi (JSPH-MC-2023-12) tarafından desteklendi. Yazarlar, Nanjing Havacılık ve Astronotik Üniversitesi Beyin-Makine Zekası Teknolojisi Ana Laboratuvarı (Eğitim Bakanlığı) personeline metodoloji, veri analizi ve figür oluşturma konusundaki rehberlikleri için Ekonomi ve Yönetim Fakültesi Doçenti Shan Li'ye ve Eğitim Bakanlığı'nın Beyin-Makine Zekası Teknolojisi Ana Laboratuvarı personeline teşekkür etmek isterler. Bu katkılar, bu araştırmanın sorunsuz ilerlemesini sağlamıştır.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
MATLAB The MathWorksR2023aSayısal hesaplama ve algoritma prototipleme için birincil yazılım platformu.
Python yazılımıPython Yazılım VakfıPython 3.10Çalışma boyunca kullanılan temel programlama dili.
Saarbruecken Ses Veritabanı, SVDSaarland Üniversitesi Fonetik EnstitüsüSaarbrü cken Voice Database (SVD)Patolojik ve normal ses kayıtlarının kamuya açık veri tabanı. Ses teli polipleri gibi hastalıkları olan kişilerden gelen sürekli ünlüler ve sürekli konuşma ile sağlıklı kontroller içerir. Belirlenen erişim şartları kapsamında akademik araştırmalar için kullanılır.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

XGBoost S n fland r cKonu ma Sinyali AnaliziSes BozukluklarDalgac k PaketiZaman Frekans AnaliziDo rusal Olmayan Dinamik ParametrelerEntropi zellikleriBe Katl apraz Do rulamaROC E risi

İlgili makaleler