Hier stellen wir ein Protokoll zur Einrichtung eines nicht-invasiven, auf XGBoost basierenden KI-Modells zur Diagnose von Stimmbänderpolypen unter Verwendung der Saarbrücken-Datenbank vor.
Methodenartikel
Hier stellen wir ein Protokoll zur Einrichtung eines nicht-invasiven, auf XGBoost basierenden KI-Modells zur Diagnose von Stimmbänderpolypen unter Verwendung der Saarbrücken-Datenbank vor.
Mit dem kontinuierlichen Wachstum der menschlichen sozialen Kommunikation nimmt auch die Zahl der Menschen mit Stimmstörungen zu. Aufgrund der objektiven und nicht-invasiven Vorteile akustischer Detektionsmethoden für pathologische Stimme ist der Einsatz der Sprachsignalanalyse zur pathologischen Spracherkennung zu einem Forschungsschwerpunkt geworden. Dieser Artikel wählte erstmals 101 kontinuierliche Vokale /a/ aus der deutschen SVD-Datenbank als Forschungsobjekt aus. Zweitens werden unter Verwendung der Wavelet-Pakettechnologie für die Zeit-Frequenz-Analyse vier nichtlineare dynamische Parameter – nämlich approximative Entropie, Sampleentropie, Fuzzy-Entropie und Permutationsentropie – aus den Subsignalen als Merkmalsparameter für den pathologischen Sprachklassifikator extrahiert. Schließlich wird der maschinelle Lernalgorithmus XGBoost als Mustererkennungsmethode ausgewählt, um einen pathologischen Stimmklassifikator zu etablieren, und die Klassifikationsleistung wird mittels Fünffach-Kreuzvalidierung und ROC-Kurve überprüft. Experimentelle Ergebnisse haben gezeigt, dass die Genauigkeit des pathologischen Stimmklassifikators von XGBoost 0,857 beträgt, der F1-Wert 0,875 und der AUC-Wert 0,944, was alle höher ist als der von SVM erstellte Klassifikator, was darauf hindeutet, dass XGBoost eine bessere Leistung bei der pathologischen Spracherkennung bietet.
Die Zahl der Menschen, die an Stimmstörungen leiden, steigt ständig. Statistiken zufolge hat ein Drittel der Bevölkerung irgendwann in ihrem Leben Stimmprobleme1. Für professionelle Stimmnutzer wie Sänger und Lehrer ist aufgrund ihres häufigen Missbrauchs und Missbrauchs ihrer Stimme die Häufigkeit von Halserkrankungen höher. Zwei Studien führten Umfragen unter Lehrern in Tianjin und Urumqi durch, und die Ergebnisse zeigten, dass die Wahrscheinlichkeit, an Stimmstörungen zu leiden, bei 33,81 % bzw. 28,23 % liegt. Daher wird in der klinischen Praxis zunehmend Wert auf die Erkennung und Diagnose pathologischer Stimme gelegt. Derzeit werden subjektive Bewertungsmethoden, Laryngoskopieuntersuchungen und akustische Nachweismethoden hauptsächlich zur Diagnose von Stimmerkrankungen in der klinischen Praxisverwendet 4,5. Die akustische Detektionsmethode wandelt Sprachsignale für die Forschung in digitale Signale um, sorgt für Objektivität und vermeidet Schmerzen des Patienten während der Untersuchung6. Daher ist die akustische Detektion zu einem effektiven Hilfsinstrument für Ärzte in der klinischen Diagnostik geworden, und die Forschung dazu nimmt zu.
Die wichtigsten Techniken zur Diagnose pathologischer Stimme mit akustischen Analysemethoden sind Merkmalsextraktion und Mustererkennung. Seit den 1960er Jahren extrahieren Forscher einige traditionelle akustische Parameter zur Untersuchung pathologischer Stimme und haben viele effektive und robuste akustische Merkmalsparameter gefunden, wie grundlegende Frequenzstörung, Amplitudenstörung und Mel-Frequenz-Cepstralkoeffizienten (MFCC)7. In den letzten Jahren haben sich Forscher nicht nur auf die Untersuchung traditioneller akustischer charakteristischer Parameter beschränkt, sondern nichtlineare dynamische Parameter werden auch im Bereich der pathologischen Spracherkennungeingesetzt. Es hat auch eine sehr gute Wirkung. Mit der rasanten Entwicklung des maschinellen Lernens sind mehr Mustererkennungsmethoden mit hoher Laufgeschwindigkeit und guter Klassifikationsleistung entstanden. Es gibt auch immer mehr Mustererkennungsmethoden in der pathologischen Spracherkennung, wie Support Vector Machines (SVM), Random Forest, neuronale Netze, Deep Learning 9,10. XGBoost ist eine Mustererkennungsmethode, die in den letzten Jahren Aufmerksamkeit erregt hat11. Es erfordert keine Feature-Normalisierung und kann Features eigenständig auswählen. Es kann sich an verschiedene Verlustfunktionen anpassen und verwendet Regularisierungsterme, um Überanpassungen zu verhindern. Es besitzt Eigenschaften wie hohe Geschwindigkeit, Portabilität und Fehlertoleranz. Daher versucht dieser Artikel, die XGBoost-Methode auf pathologische Spracherkennung anzuwenden, um bessere Erkennungsergebnisse zu erzielen.
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Der technische Arbeitsablauf dieser Studie ist in Abbildung 1 dargestellt.
1. Erfassung von Stimmproben
2. Wavelet-Paketzerlegung von Sprachdaten13
3. Extraktion von Merkmalsparametern
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. Modellgründung
5. Bewertung der Modellleistung
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
In dieser Studie wurde eine Wavelet-Paketanalyse eingesetzt, um die Zeit-Frequenz-Zerlegung von Sprachsignalen durchzuführen. Durch die Integration nichtlinearer dynamischer Parameter – einschließlich approximativer Entropie, Probenentropie, fuzzy-Entropie und Permutationsentropie – wurden die Komplexitäts- und Unregelmäßigkeitsmerkmale pathologischer Stimmen, die mit Stimmlippenpolypen assoziiert sind, systematisch charakterisiert. Anschließend wurden zwei pathologische Sprachklassifika...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Die pathologische Stimmdiagnose mittels Sprachsignalanalyse stellt einen nicht-invasiven und objektiven Ansatzdar 19. Folglich hat sich die pathologische Stimmklassifikation als bedeutender Forschungsschwerpunkt in der Sprachsignalverarbeitung und -erkennung etabliert und weist erheblichen klinischen Anwendungswert und Entwicklungsmöglichkeitenauf. Diese Studie verwendete Sprachproben, die von SVD gesammelt wurden, als experimentelle Korpor...
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Die Autoren erklären, dass sie keine konkurrierenden Interessen haben.
Die Arbeit wurde vom Jiangsu Province Hospital Capability Improvement Project (JSPH-MC-2023-12) unterstützt. Die Autoren möchten dem außerordentlichen Professor Shan Li von der School of Economics and Management sowie dem Personal des Key Laboratory of Brain-Machine Intelligence Technology (Bildungsministerium) der Nanjing University of Aeronautics and Astronautics für ihre Anleitung zu Methodik, Datenanalyse und Figurengenerierung danken. Diese Beiträge haben den reibungslosen Fortschritt dieser Forschung gewährleistet.
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
| Name | Unternehmen | Katalognummer | Kommentare |
|---|---|---|---|
| MATLAB | The MathWorks | R2023a | Primäre Softwareplattform für numerische Berechnung und Algorithmusprototyping. |
| Python-Software | Python Software Foundation | Python 3.10 | Kernprogrammiersprache, die während der gesamten Studie verwendet wird. |
| Saarbruecken Voice Database, SVD | Institut für Phonetik, Saarland-Universität | Saarbrü cken Sprachdatenbank (SVD) | Öffentlich zugängliche Datenbank mit pathologischen und normalen Stimmaufnahmen. Enthält anhaltende Vokale und kontinuierliche Sprache von Probanden mit Erkrankungen wie Stimmbänderpolypen sowie gesunden Kontrollpersonen. Wird für akademische Forschung unter den festgelegten Zugangsbedingungen verwendet. |
Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.
Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden
Genehmigung beantragen