Aqui, apresentamos um protocolo para estabelecer um modelo de IA não invasivo baseado em XGBoost para diagnosticar pólipos de cordas vocais usando o banco de dados de Saarbrücken.
Artigo de método
Aqui, apresentamos um protocolo para estabelecer um modelo de IA não invasivo baseado em XGBoost para diagnosticar pólipos de cordas vocais usando o banco de dados de Saarbrücken.
Com o crescimento contínuo da comunicação social humana, o número de pessoas que sofrem de distúrbios vocais também está aumentando. Devido às vantagens objetivas e não invasivas dos métodos de detecção acústica para voz patológica, o uso da análise de sinais de fala para reconhecimento patológico de voz tornou-se um ponto de encontro de pesquisa. Este artigo selecionou inicialmente 101 vogais contínuas /a/ do banco de dados alemão SVD como objeto de pesquisa. Em segundo lugar, usando tecnologia de pacotes wavelet para análise tempo-frequência, quatro parâmetros dinâmicos não lineares, a saber, entropia aproximada, entropia amostral, entropia difusa e entropia de permutação, são extraídos dos subsinais como o conjunto de parâmetros de características para o classificador de voz patológico. Por fim, o algoritmo de aprendizado de máquina XGBoost é selecionado como método de reconhecimento de padrões para estabelecer um classificador de voz patológico, e o desempenho da classificação é verificado usando validação cruzada de cinco vezes e curva ROC. Resultados experimentais mostraram que a precisão do classificador de voz patológico do XGBoost é 0,857, a pontuação F1 é 0,875 e o valor AUC é 0,944, todos maiores que o classificador construído pela SVM, indicando que o XGBoost tem melhor desempenho em reconhecimento de voz patológico.
O número de pessoas que sofrem de distúrbios vocais está aumentando constantemente. Segundo estatísticas, um terço da população enfrenta problemas de voz em algum momento davida 1. Para usuários profissionais de voz, como cantores e professores, devido ao uso frequente e abuso da voz, a incidência de doenças da garganta é maior. Dois estudos realizaram pesquisas com professores em Tianjin e Urumqi, e os resultados mostraram que a probabilidade de sofrer de distúrbios vocais é de 33,81% e 28,23%, respectivamente 2,3. Como resultado, há uma ênfase crescente na detecção e diagnóstico da voz patológica na prática clínica. Atualmente, métodos de avaliação subjetiva, exame de laringuscopia e métodos de detecção acústica são usados principalmente para o diagnóstico de doenças vocais na práticaclínica 4,5. O método de detecção acústica converte sinais de voz em sinais digitais para pesquisa, garantindo objetividade e evitando dor do paciente durante oexame 6. Portanto, a detecção acústica tornou-se uma ferramenta auxiliar eficaz para médicos no diagnóstico clínico, e as pesquisas sobre ela estão em aumento.
As técnicas mais importantes para diagnosticar a voz patológica usando métodos de análise acústica são extração de características e reconhecimento de padrões. Desde a década de 1960, pesquisadores vêm extraindo alguns parâmetros acústicos tradicionais para o estudo da voz patológica e encontraram muitos parâmetros de características acústicas eficazes e robustas, como perturbação de frequência fundamental, perturbação de amplitude e coeficientes cepstrais de frequência Mel (MFCC)7. Nos últimos anos, os pesquisadores não se limitaram apenas ao estudo de parâmetros característicos acústicos tradicionais, mas parâmetros dinâmicos não lineares também começaram a ser usados no campo do reconhecimento patológicode voz. Também tem um efeito muito bom. Com o rápido desenvolvimento do aprendizado de máquina, surgiram mais métodos de reconhecimento de padrões com alta velocidade de corrida e bom desempenho na classificação. Existem também cada vez mais métodos de reconhecimento de padrões usados no reconhecimento patológico de voz, como máquinas de vetores de suporte (SVM), floresta aleatória, redes neurais, deep learning 9,10. O XGBoost é um método de reconhecimento de padrões que ganhou atenção nos últimosanos 11. Não requer normalização de características e pode selecionar recursos por conta própria. Ele pode se adaptar a várias funções de perda e utiliza termos de regularização para evitar o excesso de ajuste. Possui características de alta velocidade, portabilidade e tolerância a falhas. Portanto, este artigo tenta aplicar o método XGBoost ao reconhecimento patológico de voz para alcançar melhores resultados de reconhecimento.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
O fluxo de trabalho técnico deste estudo é ilustrado na Figura 1.
1. Aquisição de amostras de voz
2. Decomposição por pacotes wavelet de dados de voz13
3. Extração de parâmetros de características
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. Estabelecimento de modelos
5. Avaliação do desempenho do modelo
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Neste estudo, a análise de pacotes wavelet foi empregada para realizar a decomposição tempo-frequência dos sinais de voz. Ao integrar parâmetros dinâmicos não lineares — incluindo entropia aproximada, entropia amostral, entropia difusa e entropia de permutação — as características de complexidade e irregularidade das vozes patológicas associadas a pólipos das pregas vocais foram sistematicamente caracterizadas. Dois classificadores de voz patológicos foram posteriormente construídos com ...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
O diagnóstico patológico da voz utilizando análise do sinal de fala representa uma abordagem não invasiva eobjetiva 19. Consequentemente, a classificação patológica da voz emergiu como um foco significativo de pesquisa em processamento e reconhecimento de sinais de fala, demonstrando valor substancial de aplicação clínica e perspectivas de desenvolvimento20. Este estudo utilizou amostras de fala coletadas de SVD como corpora experimentais. ...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Os autores declaram que não têm interesses concorrentes.
O trabalho foi apoiado pelo Projeto de Melhoria da Capacidade do Hospital da Província de Jiangsu (JSPH-MC-2023-12). Os autores gostariam de agradecer ao Professor Associado Shan Li, da Escola de Economia e Administração, e à equipe do Laboratório-Chave de Tecnologia de Inteligência Cérebro-Máquina (Ministério da Educação) da Universidade de Aeronáutica e Astronáutica de Nanjing, por suas orientações em metodologia, análise de dados e geração de figuras. Essas contribuições garantiram o progresso tranquilo dessa pesquisa.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
| Nome | Empresa | Número de catálogo | Comentários |
|---|---|---|---|
| MATLAB | O MathWorks | R2023a | Plataforma de software primária para computação numérica e prototipagem de algoritmos. |
| Software em Python | Fundação de Software Python | Python 3.10 | Linguagem de programação central usada ao longo do estudo. |
| Banco de Dados de Voz Saarbruecken, SVD | Instituto de Fonética, Universidade do Sarre | Saarbrü Banco de Dados de Voz Cken (SVD) | Banco de dados público disponível de gravações de voz patológicas e normais. Contém vogais sustentadas e fala contínua de indivíduos com condições que incluem pólipos das cordas vocais, além de controles saudáveis. Usado para pesquisa acadêmica sob seus termos de acesso especificados. |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE
Solicitar permissão