Przedstawiamy tutaj protokół umożliwiający utworzenie nieinwazyjnego modelu AI opartego na XGBoost do diagnozowania polipów strun głosowych z wykorzystaniem bazy danych Saarbrücken.
Artykuł metodologiczny
Przedstawiamy tutaj protokół umożliwiający utworzenie nieinwazyjnego modelu AI opartego na XGBoost do diagnozowania polipów strun głosowych z wykorzystaniem bazy danych Saarbrücken.
Wraz z ciągłym rozwojem komunikacji społecznej rośnie także liczba osób cierpiących na zaburzenia głosu. Ze względu na obiektywne i nieinwazyjne zalety akustycznych metod wykrywania głosu patologicznego, wykorzystanie analizy sygnałów mowy do rozpoznawania mowy patologicznego stało się gorącym punktem badań. Artykuł ten po raz pierwszy wybrał 101 ciągłych samogłosek /a/ z niemieckiej bazy danych SVD jako obiekt badawczy. Po drugie, wykorzystując technologię pakietów falkowych do analizy czasowo-częstotliwościowej, cztery nieliniowe parametry dynamiczne: przybliżoną entropię, entropię próbki, entropię rozmytą oraz entropię permutacyjną, wyodrębniane są z podsygnałów jako zestaw parametrów cech dla patologicznego klasyfikatora głosowego. Na koniec algorytm uczenia maszynowego XGBoost jest wybierany jako metoda rozpoznawania wzorców do ustanowienia patologicznego klasyfikatora głosowego, a wydajność klasyfikacji jest weryfikowana za pomocą pięciokrotnej walidacji krzyżowej i krzywej ROC. Wyniki eksperymentalne wykazały, że dokładność patologicznego klasyfikatora głosu XGBoost wynosi 0,857, wynik F1 0,875, a wartość AUC 0,944, co jest wyższe niż klasyfikator skonstruowany przez SVM, co wskazuje, że XGBoost ma lepsze wyniki w patologicznym rozpoznawaniu mowy.
Liczba osób cierpiących na zaburzenia głosu stale rośnie. Według statystyk, jedna trzecia populacji doświadcza problemów z głosem w pewnym momencie swojego życia1. Dla profesjonalnych użytkowników głosu, takich jak śpiewacy i nauczyciele, ze względu na częste nadużywanie i nadużywanie głosu, częstość chorób gardła jest wyższa. Dwa badania przeprowadziły badania wśród nauczycieli w Tiencinie i Urumczi, a wyniki wykazały, że prawdopodobieństwo wystąpienia zaburzeń głosu wynosi odpowiednio 33,81% i 28,23%, czyli 2,3%. W rezultacie coraz większy nacisk kładzie się na wykrywanie i diagnozowanie patologicznego głosu w praktyce klinicznej. Obecnie metody subiektywnej oceny, badanie laryngoskopowe oraz metody detekcji akustycznej są głównie wykorzystywane do diagnozowania chorób głosu w praktyce klinicznej 4,5. Metoda detekcji akustycznej przekształca sygnały głosowe w cyfrowe do badań, zapewniając obiektywizm i unikając bólu pacjenta podczas badania6. Dlatego detekcja akustyczna stała się skutecznym narzędziem pomocniczym dla lekarzy w diagnostyce klinicznej, a badania nad tym obszarem rosną.
Najważniejszymi technikami diagnozowania patologicznego głosu z wykorzystaniem metod analizy akustycznej są ekstrakcja cech i rozpoznawanie wzorców. Od lat 60. XX wieku naukowcy wyodrębniają niektóre tradycyjne parametry akustyczne do badań głosu patologicznego i odkryli wiele efektywnych i odpornych parametrów cech akustycznych, takich jak perturbacja częstotliwości fundamentalnej, perturbacja amplitudy oraz współczynniki cepstralne o częstotliwości Mela (MFCC)7. W ostatnich latach naukowcy nie tylko ograniczyli się do badania tradycyjnych parametrów charakterystycznych akustycznych, ale także nieliniowe parametry dynamiczne zaczęły być wykorzystywane w dziedzinie patologicznego rozpoznawania mowy8. Ma też bardzo dobry efekt. Wraz z szybkim rozwojem uczenia maszynowego pojawiło się więcej metod rozpoznawania wzorców o szybkim biegu i dobrej wydajności klasyfikacji. Coraz więcej stosuje się także metody rozpoznawania wzorców w patologicznym rozpoznawaniu głosu, takie jak maszyny wektorowe wspierające (SVM), las losowy, sieci neuronowe oraz głębokie uczenie 9,10. XGBoost to metoda rozpoznawania wzorców, która zyskała na sobie uwagę w ostatnich latach11. Nie wymaga normalizacji funkcji i może wybierać je samodzielnie. Może dostosować się do różnych funkcji strat i wykorzystuje terminy regularizacyjne, aby zapobiec nadmiernemu dopasowaniu. Cechuje się dużą prędkością, przenośnością i odpornością na awarie. Dlatego niniejszy artykuł próbuje zastosować metodę XGBoost do patologicznego rozpoznawania głosu, aby osiągnąć lepsze wyniki rozpoznawania.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Techniczny przepływ pracy tego badania przedstawiono na Rysunku 1.
1. Pozyskiwanie próbek głosowych
2. Rozkład pakietów falkowych danych głosowych13
3. Ekstrakcja parametrów cech
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. Ustanowienie modelu
5. Ocena wydajności modelu
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
W tym badaniu zastosowano analizę pakietów falkowych do przeprowadzenia rozkładu czasowo-częstotliwościowego sygnałów głosowych. Poprzez integrację nieliniowych parametrów dynamicznych — w tym przybliżonej entropii, entropii próbki, entropii rozmytej oraz entropii permutacyjnej — systematycznie scharakteryzowano złożoność i nieregularności patologicznych głosów związanych z polipami fałdów głosowych. Następnie skonstruowano dwa patologiczne klasyfikatory głosowe na podstawie algorytmu maszyny wektorowej wsparcia (SVM) or...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Patologiczna diagnostyka głosu z wykorzystaniem analizy sygnałów mowy stanowi nieinwazyjne i obiektywne podejście19. W konsekwencji klasyfikacja głosu patologicznego stała się istotnym obszarem badań w zakresie przetwarzania i rozpoznawania sygnałów mowy, wykazując znaczącą wartość kliniczną i perspektywy rozwojowe20. W badaniu wykorzystano próbki mowy pobrane z SVD jako eksperymentalne korpusory. Dzięki przetwarzaniu sygnałów mowy i technikom uczenia maszynowego opracowano...
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy deklarują, że nie mają ze sobą rywalizujących interesów.
Prace zostały wsparte przez Projekt Poprawy Zdolności Szpitali Prowincji Jiangsu (JSPH-MC-2023-12). Autorzy pragną podziękować profesorowi nadzwyczajnemu Shan Li ze Szkoły Ekonomii i Zarządzania oraz pracownikom Kluczowego Laboratorium Technologii Inteligencji Mózg-Maszyna (Ministerstwo Edukacji) na Uniwersytecie Aeronautyki i Astronautyki w Nankinie za wskazówki dotyczące metodologii, analiza danych i generowanie danych. Te osiągnięcia zapewniły płynny postęp tych badań.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| MATLAB | The MathWorks | R2023a | Podstawowa platforma programowa do obliczeń numerycznych i prototypowania algorytmów. |
| Oprogramowanie Python | Python Software Foundation | Python 3.10 | Podstawowy język programowania używany przez całe badanie. |
| Baza danych głosu Saarbruecken, SVD | Instytut Fonetyki, Uniwersytet Saary | Saarbrü Cken Voice Database (SVD) | Publicznie dostępna baza danych patologicznych i normalnych nagrań głosu. Zawiera samogłoski podtrzymywane i ciągłą mowę u osób z takimi schorzeniami, jak polipy strun głosowych, a także zdrową kontrolę. Wykorzystywane do badań naukowych na określonych warunkach dostępu. |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie