Artigo de investigação

VoiceNet: Uma Estrutura de Fala Multilíngue de Inteligência Artificial Responsável para Classificação de Gênero e Idade

48 visualizações

11 de setembro de 2026

Neste artigo

Resumo

O VoiceNet-RAI integra características MFCC, incorporações multilíngues do wav2vec 2.0 e EfficientNet-Lite para classificação de gênero e idade a partir de dados de voz. O framework alcança até 97,87% de precisão no subconjunto em língua inglesa e suporta aplicações responsáveis em reconhecimento de fala, autenticação e perícia digital.

Resumo

A classificação precisa de gênero e idade a partir de dados de voz é importante para uma interação humano-computador (IHC) personalizada, segura e ética. Com o crescente uso de modelos de fala pré-treinados em larga escala, como o wav2vec 2.0, surge a necessidade de utilizar essas representações de forma responsável para inferência demográfica multilíngue e com atenção à privacidade. Este estudo propõe o VoiceNet-RAI, um framework de aprendizado profundo (DL) que integra coeficientes cepstrais em escala de frequência Mel (MFCCs) com incorporações multilíngues baseadas em transformador do wav2vec 2.0 dentro de uma arquitetura EfficientNet-Lite, para apoiar classificação precisa, justa e transparente em diversos contextos linguísticos. O framework combina informações espectrais e contextuais para melhorar a robustez sob condições variáveis de gravação. Experimentos com dados de fala multilíngues cobrindo 28 idiomas demonstraram alto desempenho na classificação, com o subconjunto em inglês alcançando precisão de 97,87%, exatidão de 98,61%, revocação de 98,70% e pontuação F1 de 98,65%. A validação externa utilizando o conjunto de dados Mozilla Common Voice resultou em precisão de 98,27% na classificação de gênero, demonstrando generalização para um conjunto de dados independente. Uma análise de ablação mostrou ainda que a combinação de características MFCC e wav2vec 2.0 melhorou o desempenho em comparação com representações apenas brutas ou exclusivamente com MFCC. Esses resultados demonstram o potencial de representações híbridas de fala espectrais-contextuais para classificação robusta e responsável de gênero e idade.

Introdução

O reconhecimento de voz é um componente fundamental da comunicação humana, por meio do qual os indivíduos expressam seus sentimentos, pensamentos e objetivos. As vozes humanas são produzidas por um processo biológico no qual o ar é expelido dos pulmões e moldado em som pelos órgãos articulatórios, como lábios, língua e dentes1. O ouvido desempenha um papel essencial na identificação da voz e pode distinguir entre vozes masculinas e femininas com base em características como volume e altura. Uma característica que contribui para diferenças significativas na altura vocal entre homens e mulheres é o dimorfismo sexual2. A classificação por idade e gênero a partir da voz é relevante para diversas aplicações, incluindo interação homem-máquina, reconhecimento automático de gênero, saudações personalizadas, pré-classificação de emoções na fala e classificação de chamadas baseada em gênero3.

A fala é uma parte intrínseca da interação humana. A voz humana contém múltiplas características que variam entre indivíduos e podem fornecer informações sobre estados emocionais e mentais, bem como idade e sexo. Essas características multidimensionais podem ser utilizadas em aplicações como sistemas de segurança baseados em voz e assistentes de Inteligência Artificial (IA) orientados à fala. Outras áreas nas quais a análise de voz é importante incluem sistemas de Verificação Automática de Locutor (ASV) e sistemas de IA baseados em emoção. Sistemas de entrada baseados em voz também podem reduzir o espaço de busca em bancos de dados4,5. Além disso, sistemas de segurança baseados em IA podem usar dados de voz em aplicações como investigações criminais e proteção de vítimas. As vozes masculinas e femininas apresentam características diferentes devido a variações nas propriedades ressonantes do trato vocal. Essas características podem ser extraídas de sinais de fala em um formato adequado para processamento computacional, permitindo a classificação de gênero a partir de dados de voz6,7. Portanto, são necessários algoritmos eficazes de aprendizado para a classificação de gênero baseada em voz. Algoritmos de Aprendizado Profundo (DL) são particularmente adequados para classificação relacionada à fala devido à sua capacidade de aprender padrões complexos a partir de dados de áudio. Tais modelos podem conter camadas convolucionais, recorrentes, convolucionais temporais ou totalmente conectadas, dependendo da arquitetura. Essas camadas podem aprender características acústicas relevantes, incluindo tom e entonação. Uma vez treinado, um modelo pode classificar o gênero a partir de gravações de áudio previamente não vistas8. Outra área importante da pesquisa em Aprendizado de Máquina (ML) é a classificação de idade a partir de gravações de voz. Algoritmos de ML podem usar características acústicas como entonação, timbre e amplitude para identificar padrões relacionados à idade. Técnicas como Análise de Componentes Principais (PCA) também podem ser aplicadas para extrair padrões informativos de dados de fala e potencialmente melhorar o desempenho da classificação9.

A aprendizagem profunda (DL) demonstrou alto desempenho em aplicações como reconhecimento de imagem, emoção e fala. Redes Neurais Profundas (DNNs), em particular, são amplamente utilizadas em tarefas relacionadas à fala. Neste estudo, abordagens baseadas em DL são aplicadas à classificação de voz em combinação com técnicas estabelecidas de extração de características. Os Coeficientes Cepstrais na Escala de Frequência Mel (MFCCs) capturam características espectrais relevantes dos sinais de fala e fornecem uma representação eficiente para o processamento subsequente. As características extraídas são posteriormente integradas em um framework de aprendizagem por transferência para classificação de gênero e idade baseada na voz10,11.

Estudos recentes têm adotado cada vez mais representações de fala auto-supervisionadas e baseadas em Transformer para classificação de atributos do falante. Pesquisadores investigaram vieses demográficos, incluindo vieses de gênero e idade, em modelos de fala auto-supervisionados, como o HuBERT e o wav2vec 2.0, destacando a importância de avaliações conscientes da equidade12. Mais recentemente, abordagens baseadas em Transformer e independentes de idioma demonstraram a eficácia de representações de fala contextuais aprendidas para o reconhecimento de gênero em condições multilíngues e ruidosas13. Sinha et al. investigaram ainda mais as representações do wav2vec 2.0 por camadas para classificação de idade e gênero e mostraram que diferentes camadas do Transformer capturam níveis variados de informações relacionadas ao falante14. Esses avanços motivam o framework proposto VoiceNet-RAI, que combina informações espectrais convencionais baseadas em MFCC com representações contextuais do wav2vec 2.0, incorporando ao mesmo tempo considerações multilíngues e de Inteligência Artificial Responsável.

Estudos recentes demonstraram que a idade e o gênero do falante podem ser caracterizados usando tanto características acústicas convencionais quanto representações baseadas em aprendizado profundo. Abordagens que combinam informações acústicas e temporais mostraram que características complementares da fala podem melhorar o desempenho da classificação de idade e gênero15,16. Pesquisas relacionadas também demonstraram que características de fala transformadas, geradas usando representações profundas do tipo gargalo (bottleneck), podem melhorar o desempenho da classificação de idade e gênero do falante17. Esses achados apoiam o uso mais amplo de representações espectrais, temporais e aprendidas em tarefas de classificação envolvendo sinais de fala e derivados da fala.

Vários estudos investigaram o reconhecimento de idade e gênero a partir da fala utilizando abordagens de aprendizado de máquina e aprendizado profundo18,19,20,21,22,23,24,25,26,27,28,29,30. Abordagens mais recentes exploraram representações transformadas de MFCC e redes neurais profundas para classificação de idade e gênero do falante31, enquanto a variabilidade multilíngue e dependente do idioma permanece uma consideração importante no desenvolvimento de sistemas robustos de classificação demográfica baseados na voz. Diferenças na pronúncia, estrutura fonética, características do falante e condições de gravação podem reduzir a generalização do modelo entre idiomas e populações. Assim, o uso de representações espectrais e contextuais complementares da fala pode melhorar a robustez em contextos multilíngues.

Embora abordagens híbridas tenham anteriormente combinado múltiplas características acústicas ou classificadores em conjunto para reconhecimento demográfico baseado na voz, o VoiceNet-RAI se diferencia ao integrar dois níveis complementares de representação da fala dentro de um quadro unificado. Especificamente, as características convencionais de MFCC preservam características espectrais e vocais localizadas, enquanto o wav2vec 2.0 fornece representações contextualizadas aprendidas a partir de sinais de fala brutos usando um codificador Transformer. Em vez de depender exclusivamente de descritores acústicos manualmente elaborados ou de uma única representação profunda, o VoiceNet-RAI realiza a fusão em nível de características das representações de MFCC e wav2vec 2.0 agregadas temporalmente, refinando em seguida a representação híbrida resultante usando o EfficientNet-Lite. A novidade científica reside, portanto, na integração coordenada de representações espectrais, contextuais auto-supervisionadas e profundas leves para classificação de gênero e idade, juntamente com avaliação multilíngue, validação em conjunto de dados independente e análise de equidade em subgrupos. Essa combinação estende os tradicionais pipelines híbridos de classificação de fala para além da fusão de características orientada à precisão, rumo a um quadro que considera simultaneamente a complementaridade das representações, o design de modelos leves, a generalização e a Inteligência Artificial Responsável.

As principais contribuições desta pesquisa incluem o desenvolvimento de uma abordagem para identificar gênero e idade a partir de dados de voz, integrando características MFCC e wav2vec 2.0 com EfficientNet-Lite. Foram realizados extensos experimentos em um conjunto de dados de gravações de voz de 28 idiomas, avaliando-se características originais, características MFCC, características wav2vec 2.0 e suas combinações com modelos de ML e DL. O desempenho dos modelos é avaliado utilizando tanto o conjunto de dados multilíngue completo quanto o subconjunto em língua inglesa. O framework é ainda avaliado sob perspectivas multilíngue e de Inteligência Artificial Responsável, por meio de análises de subgrupos específicos por gênero e idioma, avaliação independente de locutores e validação utilizando o conjunto de dados Mozilla Common Voice. Além disso, o desempenho do framework proposto é comparado com abordagens de estado da arte relatadas na literatura existente, sendo fornecidos resultados de validação cruzada. Uma grande quantidade de pesquisas relacionadas já foi realizada, e Tabela 1 resume esses estudos, incluindo os modelos, conjuntos de dados e resultados relatados19,20,21,22,23,24,25,26,27,28,29,30,31.

Protocolo

Este estudo utilizou conjuntos de dados publicamente disponíveis, o BVC Challenging Voice Set e o Mozilla Common Voice, sem envolvimento direto de participantes. Portanto, não foi necessária aprovação ética institucional nem consentimento informado adicional. Apenas os dados necessários para classificação de gênero e idade foram processados, e nenhuma tentativa foi feita para identificar falantes individuais. A metodologia completa do fluxo de trabalho da estrutura proposta está apresentada na Figura 1.

Aquisição de dados

O conjunto de dados utilizado na abordagem proposta consistiu em arquivos de áudio no formato .wav obtidos do BVC Challenging Voice Set, um conjunto de voz de acesso público desenvolvido pelo grupo Biometrics Vision and Computing (BVC) e hospedado no GitHub32. O conjunto de dados continha gravações de voz de 526 indivíduos, incluindo 336 falantes do sexo masculino e 190 do sexo feminino. Ele compreendia aproximadamente 3.964 gravações, incluindo gravações de uma única frase e de múltiplas frases de cada falante. Tabela 2 resume as características demográficas, cobertura linguística, propriedades das gravações, estratégia de particionamento dos dados e configurações de pré-processamento utilizadas para os conjuntos de dados de fala na estrutura proposta do VoiceNet-RAI.

Extração de características

Os arquivos de áudio foram processados para extrair propriedades essenciais, que posteriormente foram armazenadas em um arquivo CSV. Metadados, incluindo idade, gênero e pronúncia do locutor, foram extraídos dos arquivos README correspondentes. Python, juntamente com o pacote SciPy, foi utilizado para processar os arquivos WAV e extrair características relevantes. A Transformada Rápida de Fourier (FFT) do NumPy e funções de frequência foram empregadas para converter os sinais de áudio do domínio do tempo para o domínio da frequência. Os arquivos WAV representavam a amplitude como uma função do tempo; no entanto, características relacionadas à frequência que poderiam distinguir vozes masculinas e femininas eram de maior interesse para a tarefa de classificação33.

Para transformar os sinais de áudio em representações no domínio da frequência, a Transformada Discreta de Fourier (DFT) foi implementada usando o algoritmo FFT. A transformada de Fourier converte um sinal no domínio do tempo em um espectro de frequência. Como esse espectro não preserva informações temporais, o sinal de áudio foi dividido em segmentos sobrepostos e a transformada de Fourier foi aplicada a cada segmento usando a abordagem da Transformada de Fourier de Curto Tempo (STFT). A função np.fft.fft gerou o espectro de frequência complexo, enquanto np.fft.fftfreq forneceu as frequências das amostras correspondentes. No diretório de amostras, havia 10 arquivos de áudio disponíveis para um único locutor. Cada arquivo WAV foi processado usando janelas deslizantes de 200 ms para extrair as frequências dominantes. Por exemplo, uma gravação de áudio de 4 segundos produziu uma lista de 20 valores de frequência. Para um diretório contendo 10 gravações, as 10 listas correspondentes, cada uma contendo 20 valores de frequência, foram combinadas em uma lista de listas. As frequências foram filtradas para manter valores entre 20 Hz e 280 Hz, enquanto ruídos potenciais em torno de 50 Hz foram excluídos.

Representação híbrida de características MFCC e wav2vec 2.0

Para capturar representações contextuais de alto nível da fala e características acústicas de baixo nível, este estudo empregou uma estratégia híbrida de extração de características que integrou características MFCC com incorporações baseadas no Transformer wav2vec 2.0.

Extração de características MFCC

Os coeficientes cepstrais na escala Mel (MFCCs) são características amplamente utilizadas no processamento de sinais de áudio e fala, especialmente em aplicações como reconhecimento de fala e identificação de falante34,35. Neste estudo, a extração de MFCCs transformou os sinais de áudio em vetores de características que representam propriedades perceptualmente relevantes da fala. O processo iniciou-se com a pré-enfatização para realçar os componentes de alta frequência, seguida por segmentação e janelamento para dividir o sinal em quadros curtos e sobrepostos. Cada amostra de áudio foi primeiramente reamostrada para 16 kHz e segmentada em quadros de 25 ms com sobreposição de 10 ms. A Transformada Rápida de Fourier foi então aplicada a cada quadro para converter o sinal do domínio do tempo para o domínio da frequência.

O espectro de frequência resultante foi submetido a uma série de bancos de filtros Mel que aproximaram a resposta de frequência não linear da percepção auditiva humana. Esses bancos de filtros enfatizaram frequências mais relevantes à percepção, ao mesmo tempo que reduziram a contribuição das menos informativas. O logaritmo da saída de cada banco de filtros foi posteriormente calculado para aproximar a sensibilidade logarítmica da audição humana em relação à intensidade sonora. Uma Transformada Cosseno Discreta (DCT) foi então aplicada às energias logarítmicas dos bancos de filtros para descorrelacionar os coeficientes e gerar uma representação compacta do sinal de áudio. Os coeficientes resultantes, conhecidos como MFCCs, capturaram características espectrais importantes da fala. Os MFCCs foram utilizados para classificação de gênero e idade porque capturam características acústicas que diferenciam vozes de acordo com esses atributos.

extração de incorporação wav2vec 2.0

O modelo Wav2vec 2.0 Base foi pré-treinado em grandes corpora de fala não rotulados. O modelo consistia em um codificador Transformer de múltiplas camadas que processava entradas de forma de onda bruta e gerava incorporações de fala contextualizadas36.

Dada uma forma de onda de entrada x ∈ RT, o modelo wav2vec 2.0 produziu uma sequência de representações latentes:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

em que cada vetor de incorporação tinha uma dimensionalidade de 768. Para obter uma representação de comprimento fixo adequada para classificação, foi aplicada uma operação de agrupamento temporal médio em todos os passos de tempo.

figure-protocol-1   (2)

Mecanismo de fusão de características

As características MFCC e wav2vec 2.0 foram fundidas por meio de concatenação no nível de características. Especificamente, as características MFCC foram inicialmente agregadas utilizando média temporal para produzir um vetor de comprimento fixo.

m ∈ R40  (3)

O vetor de características híbrido final foi obtido como:

h = [m || zpooled] ∈ R808  (4)

onde || denota concatenação. Essa fusão combinou incorporações contextuais profundas com características espectrais elaboradas manualmente, permitindo que o modelo capturasse tanto informações semânticas de alto nível quanto padrões acústicos finos.

Todas as amostras de áudio foram primeiramente reamostradas para 16 kHz. As características MFCC foram calculadas por quadro e médias temporalmente para produzir um vetor fixo de 40 dimensões, enquanto os embeddings do wav2vec 2.0 foram agrupados pela média ao longo do tempo para gerar uma representação de 768 dimensões. Como ambos os conjuntos de características foram convertidos em vetores de comprimento fixo antes da fusão, não foi necessária a alinhação temporal no nível dos quadros. As representações resultantes de MFCC e wav2vec foram então concatenadas em um vetor de características híbrido de 808 dimensões antes de serem fornecidas ao modelo de classificação.

Integração com EfficientNet-Lite

O vetor de características fundido, h, foi remodelado em um formato adequado para aprendizado de características e fornecido como entrada para o modelo EfficientNet-Lite para treinamento. Uma camada de projeção totalmente conectada primeiro mapeou o vetor de 808 dimensões para um espaço latente de maior dimensão, após o que os blocos EfficientNet-Lite refinaram as características hierárquicas. Camadas de normalização por lote e dropout foram empregadas para reduzir o sobreajuste e melhorar a generalização do modelo. A função de ativação SoftMax foi utilizada para gerar as probabilidades finais previstas para as classes de gênero e idade. A representação fundida, h ∈ R808, foi inicialmente tratada como um vetor de características unidimensional e passada por uma camada de projeção totalmente conectada que a mapeou para 4.096 dimensões. A representação projetada foi então remodelada em um tensor 1 × 64 × 64 antes de ser fornecida à arquitetura EfficientNet-Lite.

Para acomodar a representação de características de fala de canal único, em vez da entrada convencional de imagem de três canais, a camada convolucional de entrada do EfficientNet-Lite original foi modificada de três para um canal de entrada. Os demais blocos de extração de características do EfficientNet-Lite foram mantidos sem modificações arquitetônicas significativas. Uma camada de agrupamento médio global adaptativo foi aplicada aos mapas de características finais para produzir uma representação de comprimento fixo. A cabeça de classificação original foi substituída por uma camada totalmente conectada específica para a tarefa, contendo duas unidades de saída para classificação de gênero e o número correspondente de unidades de saída para os grupos etários predefinidos. Por fim, a função de ativação SoftMax foi aplicada para gerar as probabilidades das classes. A representação híbrida proposta combinou incorporações de fala modernas auto-supervisionadas com características tradicionais de processamento de sinal. As incorporações wav2vec 2.0 capturaram informações contextuais e dependências de longo alcance, enquanto as características MFCC forneceram informações acústicas complementares de baixo nível. A integração dessas representações melhorou o desempenho da classificação, particularmente em condições de fala ruidosa e multilíngue.

Classificador ML

Nesta pesquisa, o desempenho de múltiplos algoritmos de ML foi analisado para a classificação baseada na voz por gênero e grupo etário.

Floresta Aleatória

A Floresta Aleatória (RF) foi utilizada como um classificador robusto de Aprendizado de Máquina (ML), combinando múltiplas Árvores de Decisão (DTs) para melhorar a precisão das previsões e reduzir o sobreajuste. O RF operou por meio de um procedimento de aprendizado conjunto, no qual as previsões de múltiplas árvores eram agregadas para gerar a previsão final37,38. Essa abordagem permitiu ao RF capturar padrões diversos nos dados, ao mesmo tempo que reduzia o sobreajuste comumente associado a DTs individuais. A aleatoriedade introduzida durante a construção das árvores melhorou a generalização do modelo, tornando o RF adequado para tarefas de classificação, como classificação de gênero e idade a partir de dados de voz.

Regressão Logística

A regressão logística (RL) foi utilizada como um modelo estatístico de aprendizado de máquina para classificação39. Para classificação binária, a RL estima a probabilidade de um resultado com base nas características de entrada usando a função logística (sigmoide), e as probabilidades resultantes são usadas para gerar previsões de classe. A RL também era aplicável a problemas de classificação multiclasse envolvendo mais de duas classes. Para classificação multiclasse, a RL utilizava abordagens como um-contra-todos ou regressão SoftMax, dependendo do contexto de classificação.

Classificador Extra Tree

O classificador Extra Trees (ETC) foi utilizado como um algoritmo de aprendizado conjunto que combina várias árvores de decisão (DTs) para gerar previsões40,41. Diferentemente da RF, o ETC introduz aleatoriedade adicional ao selecionar aleatoriamente as características candidatas e os limites de divisão durante a construção da árvore. Esse procedimento gerou árvores menos correlacionadas e reduziu a sensibilidade do modelo a características individuais, aumentando assim a robustez ao ruído. O índice de Gini foi utilizado como critério de divisão para avaliar a importância das características e particionar os dados.

Máquina de Vetores de Suporte

A máquina de vetores de suporte (SVM) foi utilizada como classificador de aprendizado de máquina para identificar um limite de decisão ótimo em um espaço de características de alta dimensão42. O objetivo era determinar um hiperplano que maximizasse a margem entre as classes. Uma margem maior entre o limite de decisão e os pontos de dados mais próximos geralmente favorecia uma melhor separação entre classes e generalização. A SVM era aplicável a diversas tarefas de aprendizado de máquina, incluindo classificação, regressão e análise de dados baseada em características.

Redes Neurais Convolucionais

Redes Neurais Convolucionais (CNNs) foram utilizadas como modelos de Aprendizado Profundo (DL) para tarefas de classificação envolvendo representações estruturadas de dados de imagem e áudio. Redes neurais convolucionais unidimensionais (1D-CNNs) também têm sido amplamente aplicadas a dados sequenciais e textuais. As arquiteturas de CNNs utilizaram filtros convolucionais e operações de agrupamento para extrair características discriminativas dos dados de entrada43,44. Para classificação de gênero e idade a partir de dados de voz, as CNNs foram aplicadas a representações derivadas da fala para aprender padrões associados ao tom, frequência, entonação e outras características vocais relevantes para distinguir grupos de gênero e idade.

VGG19

A VGG19 foi utilizada como uma arquitetura de aprendizado profundo caracterizada por uma estrutura hierárquica profunda e relativamente uniforme de extração de características45. Sua arquitetura empregou pequenos filtros convolucionais de 3 × 3 ao longo de 19 camadas, permitindo a extração progressiva de características discriminativas. Quando aplicada a representações derivadas da fala, a VGG19 capturou tanto padrões acústicos de baixo nível, como variações de tom e frequência, quanto características discriminativas de nível superior. Sua arquitetura profunda permitiu a abstração progressiva de características para modelar as características vocais associadas ao gênero e à idade.

EfficientNet-Lite

O EfficientNet-Lite foi utilizado como uma arquitetura de DL eficiente computacionalmente46,47. O modelo empregou uma estratégia de dimensionamento equilibrado para alcançar um bom desempenho de classificação, exigindo menos recursos computacionais do que arquiteturas de DL mais pesadas. Sua abordagem de dimensionamento composto considerou conjuntamente a profundidade, largura do modelo e resolução da entrada para obter uma extração eficiente de características.

O EfficientNet-Lite foi selecionado para o framework proposto VoiceNet-RAI devido à sua arquitetura leve e ao equilíbrio favorável entre desempenho de classificação e complexidade do modelo. Em comparação com arquiteturas mais pesadas, ele utilizou blocos convolucionais eficientes e dimensionamento composto para alcançar um aprendizado eficaz de características com menos parâmetros e menores requisitos computacionais. Essas características tornaram o EfficientNet-Lite adequado para o framework de classificação de fala proposto e proporcionaram potencial para implantação em ambientes com restrição de recursos.

MobileNet

O MobileNet foi utilizado como uma arquitetura de aprendizado profundo leve para aplicações com recursos computacionais limitados, incluindo ambientes de computação móvel e de borda48. Sua eficiência computacional foi alcançada principalmente por meio de convoluções separáveis por profundidade, que reduziram o número de parâmetros e operações computacionais em comparação com arquiteturas convolucionais tradicionais. Essas características tornaram o MobileNet adequado para avaliar a classificação de gênero e idade a partir de dados de voz, mantendo requisitos computacionais relativamente baixos.

InceptionV3

O InceptionV3 foi utilizado como uma arquitetura profunda para extrair características hierárquicas de representações derivadas da fala49. A arquitetura incorporou operações convolucionais, de agrupamento e mistas para extrair características em diferentes níveis de abstração. Para classificação de gênero e idade a partir de dados de voz, o InceptionV3 foi usado para aprender padrões acústicos complexos e representações hierárquicas associadas às variações nas características vocais.

Parâmetros de avaliação

A acurácia foi uma das métricas de avaliação mais frequentemente utilizadas para tarefas de classificação50. Embora a acurácia forneça uma medida útil do desempenho geral da classificação, ela nem sempre oferece uma avaliação abrangente, especialmente para conjuntos de dados desbalanceados. Portanto, métricas adicionais, incluindo precisão, revocação e pontuação F1, foram utilizadas para avaliar o desempenho do modelo. Essas métricas forneceram uma avaliação mais completa ao considerar as previsões corretas e incorretas para cada classe.

A acurácia foi definida como a razão entre as observações corretamente classificadas e o número total de observações. Embora a acurácia seja particularmente informativa para conjuntos de dados balanceados, o conjunto de dados utilizado neste estudo era desbalanceado. Portanto, os Verdadeiros Positivos (TP), Falsos Positivos (FP), Verdadeiros Negativos (TN) e Falsos Negativos (FN) foram considerados ao calcular e interpretar as métricas de classificação. A equação abaixo representa a definição padrão de acurácia:

Precisão =  (VP+VN)/(VP+VN+FP+FN)×100  (5)

A precisão avalia a capacidade do classificador de retornar apenas instâncias relevantes:

Precisão=  VP/(VP+FP)  ×100   (6)

A sensibilidade, também conhecida como revocação, mede a capacidade do classificador de identificar todas as instâncias relevantes:

Recall=  TP/(FN+TP) × 100   (7)

O valor F1 combina precisão e revocação em uma única medida e é particularmente útil para avaliar o desempenho de classificação em conjuntos de dados desbalanceados:

Pontuação F1 = 2 × (PPV × TPR)/(TPR + PPV) × 100   (8)

Resultados

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Discussão

Este estudo desenvolveu e avaliou um framework automatizado para classificação de gênero e idade a partir de dados de voz, integrando características MFCC e incorporações wav2vec 2.0 com EfficientNet-Lite. Nos experimentos iniciais, o EfficientNet-Lite alcançou uma acurácia de 83,48%, precisão de 82,87%, revocação de 84,28% e pontuação F1 de 83,54% utilizando as características originais. Após a integração das características MFCC, o desempenho melhorou substancialmente, com acurácia de 92,64%, precisão de 93,79%, revocação de 94,92% e pontuação F1 de 94,84% no conjunto de dados composto por 28 idiomas. Utilizando a representação híbrida MFCC–wav2vec 2.0 no subconjunto de língua inglesa, o EfficientNet-Lite alcançou acurácia de 97,87%, precisão de 98,61%, revocação de 98,70% e pontuação F1 de 98,65%, revocação de 98,70%, precisão de 98,61% e pontuação F1 de 98,65%. A generalização foi avaliada adicionalmente utilizando o conjunto de dados Mozilla Common Voice, no qual o framework proposto também demonstrou bom desempenho. Além disso, a estabilidade do modelo foi avaliada por meio de validação cruzada de cinco dobras.

A melhoria observada após a integração das características MFCC indicou que características espectrais de baixo nível, incluindo altura, timbre e informações sobre o trato vocal, permaneceram altamente discriminativas para a classificação de gênero e idade. O ganho adicional de desempenho alcançado com a representação híbrida MFCC–wav2vec 2.0 sugeriu que os embeddings baseados em Transformer com contexto forneceram informações complementares não totalmente capturadas por características acústicas manualmente projetadas. Essa complementaridade pode explicar o melhor desempenho da representação híbrida proposta em comparação com as configurações original e somente MFCC. O desempenho superior observado no subconjunto de idioma inglês também sugeriu que a variabilidade linguística pode ter contribuído para a dificuldade de classificação. Quando vários idiomas foram combinados, diferenças na pronúncia, sotaque, estrutura fonética e distribuição das amostras podem ter introduzido variabilidade adicional, enquanto a configuração de um único idioma forneceu um espaço de características mais homogêneo. A validação utilizando o conjunto de dados Mozilla Common Voice reforçou ainda a ideia de que a representação proposta generaliza além do conjunto de dados principal, embora diferenças nas condições de gravação e nas distribuições demográficas ainda possam ter afetado o desempenho.

No geral, os resultados indicaram que o desempenho do VoiceNet-RAI foi impulsionado pelas contribuições complementares das representações espectrais e contextuais da fala, e não por um único tipo de característica. No entanto, as variações residuais de desempenho entre idiomas e grupos etários destacaram a necessidade de uma avaliação mais ampla por subgrupos, testes de robustez ao ruído e comparações adicionais com modelos recentes de fala auto-supervisionados.

Abordagens alternativas para classificação de gênero e idade baseadas na fala incluem características acústicas elaboradas manualmente com classificadores convencionais de aprendizado de máquina, aprendizado baseado em CNN a partir de representações de fala, métodos em conjunto e modelos auto-supervisionados, como HuBERT, WavLM e data2vec. Em contraste, o VoiceNet-RAI combina informações espectrais baseadas em MFCC com incorporações contextuais do wav2vec 2.0 para explorar os pontos fortes complementares das representações de fala elaboradas manualmente e das aprendidas.

Este estudo teve várias limitações. Primeiro, o conjunto de dados primário apresentava distribuições desbalanceadas entre gênero, idiomas e grupos etários, o que pode ter influenciado o desempenho dos subgrupos e limitado a generalização para populações sub-representadas. Segundo, variações nos dispositivos de gravação, sotaques, pronúncia e condições acústicas podem ter afetado a confiabilidade da classificação. Terceiro, embora a validação com o conjunto de dados Mozilla Common Voice tenha apoiado a generalização além do conjunto de dados primário, uma avaliação mais ampla com outros conjuntos de dados do mundo real ainda era necessária. Por fim, a implantação de classificação demográfica baseada na voz levantou preocupações sobre privacidade, equidade e aspectos éticos, especialmente em aplicações não controladas ou de alto impacto. Portanto, monitoramento contínuo do desempenho, supervisão humana e práticas de implantação atentas à privacidade seriam necessários para uma implementação responsável. A estrutura demonstrou potencial para aplicações em interação humano-computador, autenticação baseada na voz, análise de fala e perícia digital. Trabalhos futuros compararão o VoiceNet-RAI com modelos recentes de fala auto-supervisionados, incluindo HuBERT, WavLM e data2vec, e explorarão mecanismos de atenção específicos para a tarefa sobre a representação fundida MFCC–wav2vec 2.0. Diferentemente do mecanismo interno de autoatenção do wav2vec 2.0, o mecanismo futuro proposto ponderaria explicitamente as informações temporais e em nível de características relevantes para a classificação de gênero e idade.

Divulgações

Os autores não têm conflitos de interesse a declarar.

Agradecimentos

Os autores gostaria de agradecer ao Projeto de Apoio aos Pesquisadores da Universidade Princess Nourah bint Abdulrahman, número (PNURSP2026R748), Universidade Princess Nourah bint Abdulrahman, Riade, Arábia Saudita, pelo financiamento desta pesquisa.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Conjunto de Voz Desafiador BVCBiometrics Vision and Computing Group / OgeNIConjunto de Voz Desafiador BVChttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, variante exata utilizadahttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Unidade de Processamento GráficoNVIDIATesla K80https://www.nvidia.com/
Conjunto de Dados Mozilla Common VoiceFundação MozillaCommon Voice, versão utilizada nos experimentoshttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyDesenvolvedores do NumPyVersão exata utilizada nos experimentoshttps://numpy.org/
ProcessadorIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonFundação Python SoftwareVersão exata utilizada nos experimentoshttps://www.python.org/
PyTorchFundação PyTorchVersão exata utilizada nos experimentoshttps://pytorch.org/
Scikit-learnDesenvolvedores do Scikit-learnVersão exata utilizada nos experimentoshttps://scikit-learn.org/
SciPyDesenvolvedores do SciPyVersão exata utilizada nos experimentoshttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 11MicrosoftWindows 11, edição/versão exata, se disponívelhttps://www.microsoft.com/windows/windows-11

Referências

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Reimpressões e permissões

Etiquetas

Classifica o de Fala Multil ngueClassifica o de G neroIA Respons velFramework VoiceNetWav2vec 2 0Recursos MFCCDeep Learning de FalaEfficientNet LiteDemografia da Fala