Article de recherche

VoiceNet : Un cadre de parole multilingue d'intelligence artificielle responsable pour la classification du genre et de l'âge

49 vues

11 septembre 2026

Dans cet article

Résumé

VoiceNet-RAI intègre des caractéristiques MFCC, des intégrations multilingues wav2vec 2.0 et EfficientNet-Lite pour la classification du sexe et de l'âge à partir de données vocales. Le cadre atteint une précision maximale de 97,87 % sur le sous-ensemble en langue anglaise et prend en charge des applications responsables en reconnaissance vocale, authentification et informatique forensique.

Résumé

Une classification précise du sexe et de l'âge à partir de données vocales est importante pour une interaction homme-machine (IHM) personnalisée, sécurisée et éthique. Avec l'utilisation croissante de grands modèles de parole pré-entraînés tels que wav2vec 2.0, il devient nécessaire d'exploiter ces représentations de manière responsable pour une inférence démographique multilingue et respectueuse de la vie privée. Cette étude propose VoiceNet-RAI, un cadre d'apprentissage profond (DL) qui intègre des coefficients cepstraux en échelle de fréquence mélique (MFCC) avec des intégrations multilingues basées sur des transformeurs wav2vec 2.0 au sein d'une architecture EfficientNet-Lite afin de permettre une classification précise, équitable et transparente dans divers contextes linguistiques. Ce cadre combine des informations spectrales et contextuelles pour améliorer la robustesse dans des conditions d'enregistrement variables. Des expériences menées sur des données de parole multilingues couvrant 28 langues montrent des performances élevées en matière de classification, le sous-ensemble anglais atteignant une exactitude de 97,87 %, une précision de 98,61 %, un rappel de 98,70 % et un score F1 de 98,65 %. Une validation externe à l'aide du jeu de données Mozilla Common Voice a donné une exactitude de 98,27 % pour la classification du sexe, démontrant ainsi la généralisation à un jeu de données indépendant. Une analyse par ablation a en outre montré que la combinaison des caractéristiques MFCC et wav2vec 2.0 améliorait les performances par rapport aux représentations brutes ou aux seuls MFCC. Ces résultats démontrent le potentiel des représentations hybrides de la parole, combinant aspects spectraux et contextuels, pour une classification robuste et responsable du sexe et de l'âge.

Introduction

La reconnaissance vocale est un élément fondamental de la communication humaine, par laquelle les individus expriment leurs émotions, leurs pensées et leurs objectifs. Les voix humaines sont produites par un processus biologique au cours duquel l'air est expulsé des poumons et modelé en son par des organes articulatoires tels que les lèvres, la langue et les dents1. L'oreille joue un rôle essentiel dans l'identification de la voix et peut distinguer les voix masculines des voix féminines selon des caractéristiques telles que le volume et le ton. L'un des facteurs contribuant à des différences importantes de ton vocal entre les hommes et les femmes est le dimorphisme sexuel2. La classification par âge et par sexe à partir de la voix est pertinente pour de nombreuses applications, notamment l'interaction homme-machine, la reconnaissance automatisée du sexe, les salutations personnalisées, la pré-classification des émotions dans la parole et la classification des appels selon le sexe3.

La parole est une composante intrinsèque de l'interaction humaine. La voix humaine possède de multiples caractéristiques qui varient selon les individus et peuvent fournir des informations sur les états émotionnels et mentaux, ainsi que sur l'âge et le sexe. Ces caractéristiques multidimensionnelles peuvent être exploitées dans des applications telles que les systèmes de sécurité basés sur la voix et les assistants d'intelligence artificielle (IA) orientés vers la parole. D'autres domaines où l'analyse de la voix est importante incluent les systèmes de vérification automatique du locuteur (ASV) et les systèmes d'IA fondés sur les émotions. Les systèmes d'entrée basés sur la voix peuvent également réduire l'espace de recherche dans les bases de données4,5. De plus, les systèmes de sécurité basés sur l'IA peuvent utiliser les données vocales dans des applications telles que les enquêtes criminelles ou la protection des victimes. Les voix masculines et féminines présentent des caractéristiques différentes en raison des variations des propriétés de résonance du conduit vocal. Ces caractéristiques peuvent être extraites des signaux de parole sous une forme adaptée au traitement informatique, permettant ainsi la classification du sexe à partir de données vocales6,7. Par conséquent, des algorithmes d'apprentissage efficaces sont nécessaires pour la classification du sexe à partir de la voix. Les algorithmes d'apprentissage profond (DL) sont particulièrement adaptés à la classification liée à la parole en raison de leur capacité à apprendre des motifs complexes à partir de données audio. De tels modèles peuvent comporter des couches convolutionnelles, récurrentes, temporelles-convolutionnelles ou entièrement connectées, selon l'architecture. Ces couches peuvent apprendre des caractéristiques acoustiques pertinentes, notamment le ton et le timbre. Une fois entraîné, un modèle peut classer le sexe à partir d'enregistrements audio jamais vus auparavant8. Un autre domaine important de recherche en apprentissage machine (ML) est la classification de l'âge à partir d'enregistrements vocaux. Les algorithmes de ML peuvent utiliser des caractéristiques acoustiques telles que le timbre, le ton et l'amplitude pour identifier des motifs liés à l'âge. Des techniques telles que l'analyse en composantes principales (PCA) peuvent également être appliquées pour extraire des motifs informatifs à partir des données de parole et potentiellement améliorer les performances de classification9.

L'apprentissage profond (DL) a démontré des performances élevées dans des applications telles que la reconnaissance d'images, d'émotions et de la parole. Les réseaux neuronaux profonds (DNN), en particulier, sont largement utilisés pour les tâches liées à la parole. Dans cette étude, des approches basées sur l'apprentissage profond sont appliquées à la classification vocale en combinaison avec des techniques établies d'extraction de caractéristiques. Les coefficients cepstraux en échelle de fréquence de Mel (MFCC) capturent les caractéristiques spectrales pertinentes des signaux de parole et fournissent une représentation efficace pour le traitement ultérieur. Les caractéristiques extraites sont ensuite intégrées dans un cadre d'apprentissage par transfert pour la classification du genre et de l'âge basée sur la voix10,11.

Des études récentes ont de plus en plus adopté des représentations de la parole auto-supervisées et basées sur les Transformers pour la classification des attributs du locuteur. Les chercheurs ont examiné les biais démographiques, notamment les biais de genre et d'âge, dans les modèles de parole auto-supervisés tels que HuBERT et wav2vec 2.0, soulignant l'importance d'une évaluation prenant en compte l'équité12. Plus récemment, des approches indépendantes de la langue basées sur les Transformers ont démontré l'efficacité des représentations contextuelles apprises de la parole pour la reconnaissance du genre dans des conditions multilingues et bruitées13. Sinha et al. ont approfondi l'analyse des représentations de wav2vec 2.0 couche par couche pour la classification par âge et par genre, montrant que différentes couches du Transformer capturent des niveaux variés d'informations liées au locuteur14. Ces avancées motivent le cadre proposé VoiceNet-RAI, qui combine des informations spectrales classiques basées sur les MFCC avec des représentations contextuelles de wav2vec 2.0, tout en intégrant des considérations multilingues et liées à l'Intelligence Artificielle Responsable.

Des études récentes ont démontré que l'âge et le sexe du locuteur peuvent être caractérisés à l'aide de caractéristiques acoustiques classiques et de représentations fondées sur l'apprentissage profond. Les approches combinant des informations acoustiques et temporelles ont montré que des caractéristiques complémentaires de la parole peuvent améliorer les performances de classification de l'âge et du sexe15,16. Des recherches connexes ont également démontré que des caractéristiques de parole transformées, générées à l'aide de représentations profondes en goulot d'étranglement, peuvent améliorer les performances de classification de l'âge et du sexe du locuteur17. Ces résultats soutiennent l'utilisation plus large de représentations spectrales, temporelles et apprises pour des tâches de classification impliquant des signaux vocaux ou dérivés de la parole.

Plusieurs études ont examiné la reconnaissance de l'âge et du sexe à partir de la parole en utilisant des approches d'apprentissage automatique et d'apprentissage profond18,19,20,21,22,23,24,25,26,27,28,29,30. Des approches plus récentes ont exploré des représentations transformées des coefficients cepstraux en fréquences de Mel (MFCC) et des réseaux neuronaux profonds pour la classification de l'âge et du sexe du locuteur31, tandis que la variabilité multilingue et dépendante de la langue demeure une considération importante lors du développement de systèmes robustes de classification démographique basés sur la voix. Les différences de prononciation, de structure phonétique, de caractéristiques des locuteurs et de conditions d'enregistrement peuvent réduire la généralisabilité des modèles à travers les langues et les populations. Par conséquent, l'utilisation de représentations complémentaires du spectre et du contexte de la parole pourrait améliorer la robustesse dans des contextes multilingues.

Bien que des approches hybrides aient précédemment combiné plusieurs caractéristiques acoustiques ou des classificateurs ensemblistes pour la reconnaissance démographique par la voix, VoiceNet-RAI se distingue en intégrant deux niveaux complémentaires de représentation de la parole au sein d'un cadre unifié. Plus précisément, les caractéristiques classiques de coefficients cepstraux en fréquences de Mel (MFCC) préservent les caractéristiques spectrales et vocales localisées, tandis que wav2vec 2.0 fournit des représentations contextualisées apprises à partir de signaux vocaux bruts à l'aide d'un encodeur de type Transformeur. Plutôt que de s'appuyer exclusivement sur des descripteurs acoustiques conçus manuellement ou sur une unique représentation profonde, VoiceNet-RAI effectue une fusion au niveau des caractéristiques des représentations MFCC et wav2vec 2.0 agrégées temporellement, puis affine la représentation hybride résultante à l'aide d'EfficientNet-Lite. La nouveauté scientifique réside donc dans l'intégration coordonnée de représentations spectrales, contextuelles auto-supervisées et profondes légères pour la classification du sexe et de l'âge, associée à une évaluation multilingue, une validation sur des jeux de données indépendants et une analyse de l'équité selon les sous-groupes. Cette combinaison étend les pipelines classiques de classification de la parole au-delà de la fusion de caractéristiques orientée vers la précision, en proposant un cadre qui prend simultanément en compte la complémentarité des représentations, la conception de modèles légers, la généralisabilité et l'IA responsable.

Les principales contributions de cette recherche comprennent le développement d'une approche permettant d'identifier le sexe et l'âge à partir de données vocales en intégrant les caractéristiques MFCC et celles de wav2vec 2.0 avec EfficientNet-Lite. Des expériences approfondies sont menées sur un ensemble de données d'enregistrements vocaux provenant de 28 langues, les caractéristiques originales, les caractéristiques MFCC, les caractéristiques wav2vec 2.0 ainsi que leurs combinaisons étant évaluées à l'aide de modèles d'apprentissage automatique (ML) et de modèles d'apprentissage profond (DL). Les performances des modèles sont évaluées à l’aide de l’ensemble de données multilingue complet ainsi que d’un sous-ensemble en langue anglaise. Le cadre est par ailleurs évalué selon des perspectives multilingues et d’intelligence artificielle responsable, grâce à des analyses par sous-groupes spécifiques au sexe et à la langue, à une évaluation indépendante du locuteur et à une validation utilisant le jeu de données Mozilla Common Voice. En outre, les performances du cadre proposé sont comparées à celles des approches de pointe rapportées dans la littérature existante, et des résultats de validation croisée sont fournis. Un grand nombre d’études connexes ont été réalisées, et le tableau 1 résume ces travaux, incluant les modèles, les ensembles de données et les résultats rapportés19,20,21,22,23,24,25,26,27,28,29,30,31.

Protocole

Cette étude a utilisé les ensembles de données publics BVC Challenging Voice Set et Mozilla Common Voice sans implication directe de participants. Par conséquent, une approbation éthique institutionnelle et un consentement éclairé supplémentaire n'étaient pas requis. Seules les données nécessaires à la classification par sexe et par âge ont été traitées, et aucune tentative n'a été faite pour identifier les locuteurs individuels. La méthodologie complète du flux de travail du cadre proposé est présentée dans Figure 1.

Acquisition des données

L'ensemble de données utilisé dans l'approche proposée était constitué de fichiers audio au format .wav obtenus à partir du BVC Challenging Voice Set, un ensemble de voix accessible publiquement élaboré par le groupe Biometrics Vision and Computing (BVC) et hébergé sur GitHub32. L'ensemble de données comprenait des enregistrements vocaux de 526 individus, dont 336 hommes et 190 femmes. Il comprenait environ 3 964 enregistrements, incluant des enregistrements d'une seule phrase ainsi que de plusieurs phrases pour chaque locuteur. Tableau 2 résume les caractéristiques démographiques, la couverture linguistique, les propriétés des enregistrements, la stratégie de partitionnement des données et les paramètres de prétraitement utilisés pour les ensembles de données vocales dans le cadre proposé VoiceNet-RAI.

Extraction de caractéristiques

Les fichiers audio ont été traités afin d'en extraire les propriétés essentielles, qui ont ensuite été stockées dans un fichier CSV. Les métadonnées, incluant l'âge, le sexe et la prononciation des locuteurs, ont été extraites des fichiers README correspondants. Python, associé au package SciPy, a été utilisé pour traiter les fichiers WAV et en extraire les caractéristiques pertinentes. La transformation de Fourier rapide (FFT) de NumPy et les fonctions de fréquence ont été utilisées pour convertir les signaux audio du domaine temporel vers le domaine fréquentiel. Les fichiers WAV représentaient l'amplitude en fonction du temps ; toutefois, les caractéristiques liées à la fréquence, capables de distinguer les voix masculines et féminines, présentaient un intérêt plus grand pour la tâche de classification33.

Pour transformer les signaux audio en représentations dans le domaine fréquentiel, la transformation de Fourier discrète (DFT) a été mise en œuvre à l'aide de l'algorithme FFT. La transformation de Fourier convertit un signal dans le domaine temporel en un spectre de fréquences. Étant donné que ce spectre ne conservait pas l'information temporelle, le signal audio a été divisé en segments superposés, et la transformation de Fourier a été appliquée à chaque segment selon l'approche de la transformation de Fourier à court terme (STFT). La fonction np.fft.fft a généré le spectre de fréquences complexe, tandis que np.fft.fftfreq a fourni les fréquences d'échantillonnage correspondantes. Dans le répertoire d'exemples, 10 fichiers audio étaient disponibles pour un seul locuteur. Chaque fichier WAV a été traité à l'aide de fenêtres glissantes de 200 ms afin d'extraire les fréquences dominantes. Par exemple, un enregistrement audio de 4 secondes a produit une liste de 20 valeurs de fréquence. Pour un répertoire contenant 10 enregistrements, les 10 listes correspondantes, chacune composée de 20 valeurs de fréquence, ont été combinées en une liste de listes. Les fréquences ont été filtrées afin de conserver uniquement les valeurs comprises entre 20 Hz et 280 Hz, tandis que les bruits potentiels autour de 50 Hz ont été exclus.

Représentation hybride des caractéristiques MFCC et wav2vec 2.0

Afin de capturer à la fois les représentations contextuelles de haut niveau du discours et les caractéristiques acoustiques de bas niveau, cette étude a utilisé une stratégie hybride d'extraction de caractéristiques combinant les coefficients cepstraux en fréquence de Mel (MFCC) à des intégrations basées sur le modèle wav2vec 2.0 utilisant un transformeur.

Extraction des caractéristiques MFCC

Les coefficients cepstraux en fréquence mélique (MFCC) sont des caractéristiques largement utilisées en traitement du signal de parole et audio, notamment pour des applications telles que la reconnaissance vocale et l'identification du locuteur34,35. Dans cette étude, l'extraction des MFCC a transformé les signaux audio en vecteurs de caractéristiques représentant des propriétés perceptuellement pertinentes de la parole. Le processus a commencé par une préaccentuation afin d'amplifier les composantes à haute fréquence, suivie d'un découpage en trames et d'un fenêtrage pour diviser le signal en trames courtes et chevauchantes. Chaque échantillon audio a d'abord été rééchantillonné à 16 kHz puis segmenté en trames de 25 ms avec un chevauchement de 10 ms. La transformée de Fourier rapide a ensuite été appliquée à chaque trame pour convertir le signal du domaine temporel vers le domaine fréquentiel.

Le spectre de fréquence obtenu a été transmis à travers une série de bancs de filtres de type Mel, qui ont permis d'approcher la réponse fréquentielle non linéaire de la perception auditive humaine. Ces bancs de filtres ont mis en évidence les fréquences les plus pertinentes sur le plan perceptuel, tout en réduisant la contribution des fréquences moins informatives. Le logarithme de chaque sortie de banc de filtres a ensuite été calculé afin d'approcher la sensibilité logarithmique de l'audition humaine à la sonie. Une transformée en cosinus discrète (DCT) a ensuite été appliquée aux énergies logarithmiques des bancs de filtres afin de décorréler les coefficients et de produire une représentation compacte du signal audio. Les coefficients obtenus, appelés coefficients cepstraux en fréquences de Mel (MFCC), capturaient des caractéristiques spectrales importantes de la parole. Les MFCC ont été utilisés pour la classification par sexe et par âge, car ils permettent de saisir des caractéristiques acoustiques différenciant les voix selon ces attributs.

Extraction des plongements wav2vec 2.0

Le modèle Wav2vec 2.0 Base a été pré-entraîné sur de vastes corpus de parole non étiquetés. Le modèle était composé d'un encodeur Transformer multicouche qui traitait des entrées de forme d'onde brute et générait des intégrations de parole contextualisées36.

Étant donné une forme d'onde d'entrée x ∈ RT, le modèle wav2vec 2.0 produit une séquence de représentations latentes :

Z = {z1,z1,....,zn},zi ∈ R768  (1)

où chaque vecteur d'incorporation avait une dimension de 768. Pour obtenir une représentation de longueur fixe adaptée à la classification, une opération de moyennage temporel a été appliquée sur toutes les étapes temporelles.

figure-protocol-1   (2)

Mécanisme de fusion de caractéristiques

Les caractéristiques MFCC et wav2vec 2.0 ont été fusionnées par concaténation au niveau des caractéristiques. Plus précisément, les caractéristiques MFCC ont d'abord été agrégées à l'aide d'une moyenne temporelle afin de produire un vecteur de longueur fixe.

m ∈ R40  (3)

Le vecteur de caractéristiques hybride final a été obtenu comme suit :

h = [m || zpooled] ∈ R808  (4)

où || désigne la concaténation. Cette fusion combinait des intégrations contextuelles profondes avec des caractéristiques spectrales conçues manuellement, permettant au modèle de capturer à la fois des informations sémantiques de haut niveau et des motifs acoustiques fins.

Tous les échantillons audio ont d'abord été rééchantillonnés à 16 kHz. Les caractéristiques MFCC ont été calculées trame par trame puis moyennées temporellement afin de produire un vecteur fixe de 40 dimensions, tandis que les intégrations wav2vec 2.0 ont été moyennées dans le temps pour obtenir une représentation de 768 dimensions. Étant donné que les deux ensembles de caractéristiques ont été convertis en vecteurs de longueur fixe avant leur fusion, aucun alignement temporel au niveau des trames n'était nécessaire. Les représentations MFCC et wav2vec ainsi obtenues ont ensuite été concaténées en un vecteur de caractéristiques hybride de 808 dimensions, avant d'être transmises au modèle de classification.

Intégration avec EfficientNet-Lite

Le vecteur de caractéristiques fusionné, h, a été remodelé dans un format adapté à l'apprentissage des caractéristiques et fourni en entrée au modèle EfficientNet-Lite pour l'entraînement. Une couche de projection entièrement connectée a d'abord projeté le vecteur de dimension 808 dans un espace latent de dimension supérieure, puis les blocs EfficientNet-Lite ont affiné les caractéristiques hiérarchiques. Des couches de normalisation par lot et de dropout ont été utilisées pour réduire le surapprentissage et améliorer la généralisation du modèle. La fonction d'activation SoftMax a été utilisée pour générer les probabilités prédites finales pour les classes de sexe et d'âge. La représentation fusionnée, h ∈ R808, a d'abord été traitée comme un vecteur de caractéristiques unidimensionnel et transmise à travers une couche de projection entièrement connectée qui l'a projetée vers 4 096 dimensions. La représentation projetée a ensuite été remodelée en un tenseur 1 × 64 × 64 avant d'être fournie à l'architecture EfficientNet-Lite.

Pour prendre en compte la représentation des caractéristiques de la parole à canal unique, plutôt que l'entrée d'image conventionnelle à trois canaux, la couche de convolution d'entrée d'EfficientNet-Lite a été modifiée, passant de trois à un canal d'entrée. Les blocs restants d'extraction de caractéristiques d'EfficientNet-Lite ont été conservés sans modifications architecturales majeures. Une couche de moyennage global adaptatif a été appliquée aux cartes de caractéristiques finales afin de produire une représentation de longueur fixe. La tête de classification d'origine a été remplacée par une couche entièrement connectée spécifique à la tâche, comprenant deux unités de sortie pour la classification du genre et le nombre correspondant d'unités de sortie pour les groupes d'âge prédéfinis. Enfin, la fonction d'activation SoftMax a été appliquée pour générer les probabilités de classe. La représentation hybride proposée combine des intégrations vocales auto-supervisées modernes avec des caractéristiques traditionnelles issues du traitement du signal. Les intégrations wav2vec 2.0 capturent l'information contextuelle et les dépendances à longue portée, tandis que les caractéristiques MFCC fournissent des informations acoustiques complémentaires de bas niveau. L'intégration de ces représentations améliore les performances de classification, en particulier dans des conditions de parole bruyantes et multilingues.

Classificateur ML

Dans cette étude, les performances de plusieurs algorithmes d'apprentissage automatique ont été analysées pour la classification du sexe et des groupes d'âge à partir de la voix.

Forêt aléatoire

La forêt aléatoire (RF) a été utilisée comme classificateur robuste d'apprentissage automatique (ML), combinant plusieurs arbres de décision (DT) afin d'améliorer la précision des prédictions et de réduire le surapprentissage. RF fonctionne selon une procédure d'apprentissage ensembliste, dans laquelle les prédictions issues de plusieurs arbres sont agrégées pour produire la prédiction finale37,38. Cette approche permet à RF de capturer des motifs variés dans les données tout en atténuant le surapprentissage fréquemment associé aux arbres de décision individuels. L'introduction d'aléatoire lors de la construction des arbres améliore la généralisation du modèle, ce qui rend RF adapté aux tâches de classification telles que la classification du sexe ou de l'âge à partir de données vocales.

Régression logistique

La régression logistique (LR) a été utilisée comme modèle statistique d'apprentissage machine pour la classification39. Pour la classification binaire, la LR estime la probabilité d'un résultat en fonction des caractéristiques d'entrée à l'aide de la fonction logistique (sigmoïde), et les probabilités obtenues sont utilisées pour générer des prédictions de classe. La LR s'applique également aux problèmes de classification multiclasse impliquant plus de deux classes. Pour la classification multiclasse, la LR utilise des approches telles que un contre le reste ou la régression SoftMax, selon le contexte de classification.

Classificateur Extra Tree

Le classificateur Extra Trees (ETC) a été utilisé comme algorithme d'apprentissage ensembliste combinant plusieurs arbres de décision (DT) pour générer des prédictions40,41. Contrairement à la forêt aléatoire (RF), l'ETC introduit un aléa supplémentaire en sélectionnant aléatoirement les caractéristiques candidates et les seuils de division lors de la construction des arbres. Cette procédure produit des arbres moins corrélés et réduit la sensibilité du modèle aux caractéristiques individuelles, améliorant ainsi la robustesse au bruit. L'indice de Gini a été utilisé comme critère de division pour évaluer l'importance des caractéristiques et partitionner les données.

Machine à vecteurs de support

La machine à vecteurs de support (SVM) a été utilisée comme classificateur d'apprentissage automatique afin d'identifier une frontière de décision optimale dans un espace de caractéristiques à haute dimension42. L'objectif consistait à déterminer un hyperplan qui maximisait la marge entre les classes. Une marge plus grande entre la frontière de décision et les points de données les plus proches soutenait généralement une meilleure séparation des classes et une meilleure généralisation. La SVM s'applique à plusieurs tâches d'apprentissage automatique, notamment la classification, la régression et l'analyse de données basée sur des caractéristiques.

Réseaux neuronaux convolutifs

Les réseaux neuronaux convolutifs (CNN) ont été utilisés comme modèles d'apprentissage profond (DL) pour des tâches de classification impliquant des représentations structurées de données d'image et audio. Les CNN unidimensionnels (1D-CNN) ont également été largement appliqués aux données séquentielles et textuelles. Les architectures CNN utilisaient des filtres convolutifs et des opérations de regroupement pour extraire des caractéristiques discriminantes à partir des données d'entrée43,44. Pour la classification du sexe et de l'âge à partir de données vocales, les CNN ont été appliqués à des représentations dérivées de la parole afin d'apprendre des motifs associés au ton, à la fréquence, à l'intonation et à d'autres caractéristiques vocales pertinentes pour distinguer les groupes d'âge et de sexe.

VGG19

Le VGG19 a été utilisé comme architecture d'apprentissage profond caractérisée par une structure hiérarchique profonde et relativement uniforme d'extraction de caractéristiques45. Son architecture utilise de petits filtres de convolution 3 × 3 répartis sur 19 couches, permettant une extraction progressive de caractéristiques discriminantes. Appliqué à des représentations dérivées de la parole, le VGG19 capture à la fois des motifs acoustiques de bas niveau, tels que les variations de hauteur et de fréquence, et des caractéristiques discriminantes de niveau supérieur. Sa structure profonde permet une abstraction progressive des caractéristiques pour modéliser les traits vocaux associés au sexe et à l'âge.

EfficientNet-Lite

EfficientNet-Lite a été utilisé comme architecture d'apprentissage profond (DL) efficace sur le plan computationnel46,47. Le modèle a mis en œuvre une stratégie d'échelle équilibrée afin d'obtenir de bonnes performances de classification tout en nécessitant moins de ressources computationnelles que les architectures d'apprentissage profond plus lourdes. Son approche de mise à l'échelle composée prenait conjointement en compte la profondeur, la largeur du modèle et la résolution des entrées afin d'assurer une extraction efficace des caractéristiques.

EfficientNet-Lite a été choisi pour le cadre proposé VoiceNet-RAI en raison de son architecture légère et de son bon équilibre entre performance de classification et complexité du modèle. Comparé à des architectures plus lourdes, il utilise des blocs de convolution efficaces et une mise à l'échelle composée pour réaliser un apprentissage efficace des caractéristiques avec moins de paramètres et des exigences de calcul réduites. Ces caractéristiques rendent EfficientNet-Lite adapté au cadre de classification de la parole proposé et offrent un potentiel de déploiement dans des environnements à ressources limitées.

MobileNet

MobileNet a été utilisé comme une architecture d'apprentissage profond légère pour des applications aux ressources computationnelles limitées, notamment les environnements de calcul mobile et embarqué48. Son efficacité computationnelle a été principalement obtenue grâce aux convolutions séparables par profondeur, qui ont réduit le nombre de paramètres et d'opérations de calcul par rapport aux architectures convolutionnelles classiques. Ces caractéristiques rendent MobileNet adapté à l'évaluation de la classification du sexe et de l'âge à partir de données vocales, tout en maintenant des exigences computationnelles relativement faibles.

InceptionV3

InceptionV3 a été utilisé comme architecture profonde pour extraire des caractéristiques hiérarchiques à partir de représentations dérivées de la parole49. L'architecture intégrait des opérations de convolution, de regroupement et des opérations mixtes afin d'extraire des caractéristiques à différents niveaux d'abstraction. Pour la classification du sexe et de l'âge à partir de données vocales, InceptionV3 a été utilisé pour apprendre des motifs acoustiques complexes et des représentations hiérarchiques associés aux variations des caractéristiques vocales.

Paramètres d'évaluation

La précision était l'une des métriques d'évaluation les plus fréquemment utilisées pour les tâches de classification50. Bien que la précision fournisse une mesure utile de la performance globale de la classification, elle n'offrait pas toujours une évaluation complète, en particulier pour les ensembles de données déséquilibrés. Par conséquent, des métriques supplémentaires, notamment la justesse, le rappel et le score F1, ont été utilisées pour évaluer la performance du modèle. Ces métriques permettaient une évaluation plus complète en tenant compte des prédictions correctes et incorrectes pour chaque classe.

La précision a été définie comme le rapport entre le nombre d'observations correctement classées et le nombre total d'observations. Bien que la précision soit particulièrement informative pour des jeux de données équilibrés, le jeu de données utilisé dans cette étude était déséquilibré. Par conséquent, les vrais positifs (VP), les faux positifs (FP), les vrais négatifs (VN) et les faux négatifs (FN) ont été pris en compte lors du calcul et de l'interprétation des métriques de classification. L'équation ci-dessous représente la définition classique de la précision :

Précision =  (VP+VN)/(VP+VN+FP+FN)×100  (5)

La précision évalue la capacité du classificateur à ne renvoyer que des instances pertinentes :

Précision=  VP/(VP+FP)  ×100   (6)

Le rappel, également connu sous le nom de sensibilité, mesure la capacité du classificateur à identifier toutes les instances pertinentes :

Rappel=  TP/(FN+TP) × 100   (7)

Le score F1 combine la précision et le rappel en une seule mesure et est particulièrement utile pour évaluer la performance de classification sur des ensembles de données déséquilibrés :

Score F1 = 2 × (VPP × SENS) / (SENS + VPP) × 100   (8)

Résultats

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Discussion

Cette étude a développé et évalué un cadre automatisé de classification du sexe et de l'âge à partir de données vocales, en intégrant des caractéristiques MFCC et des intégrations wav2vec 2.0 avec EfficientNet-Lite. Lors des premières expériences, EfficientNet-Lite a atteint une exactitude de 83,48 %, une précision de 82,87 %, un rappel de 84,28 % et un score F1 de 83,54 % en utilisant les caractéristiques d'origine. Après l'intégration des caractéristiques MFCC, les performances se sont nettement améliorées, avec une exactitude de 92,64 %, une précision de 93,79 %, un rappel de 94,92 % et un score F1 de 94,84 % sur le jeu de données comprenant 28 langues. En utilisant la représentation hybride MFCC–wav2vec 2.0 sur le sous-ensemble en langue anglaise, EfficientNet-Lite a atteint une exactitude de 97,87 %, une précision de 98,61 %, un rappel de 98,70 % et un score F1 de 98,65 %, un rappel de 98,70 %, une précision de 98,61 % et un score F1 de 98,65 %. La généralisabilité a été évaluée davantage à l'aide du jeu de données Mozilla Common Voice, sur lequel le cadre proposé a également démontré de bonnes performances. En outre, la stabilité du modèle a été évaluée par validation croisée en cinq parties.

L'amélioration observée après l'intégration des caractéristiques MFCC indique que les caractéristiques spectrales de bas niveau, notamment la hauteur, le timbre et les informations sur le conduit vocal, restent fortement discriminantes pour la classification du sexe et de l'âge. Le gain supplémentaire de performance obtenu avec la représentation hybride MFCC–wav2vec 2.0 suggère que les intégrations contextuelles basées sur des Transformers fournissent des informations complémentaires non entièrement capturées par les caractéristiques acoustiques conçues manuellement. Cette complémentarité pourrait expliquer la performance améliorée de la représentation hybride proposée par rapport aux configurations initiale et MFCC uniquement. La performance supérieure observée dans le sous-ensemble en langue anglaise suggère également que la variabilité linguistique pourrait avoir contribué à la difficulté de classification. Lorsque plusieurs langues étaient combinées, les différences de prononciation, d'accent, de structure phonétique et de répartition des échantillons ont pu introduire une variabilité supplémentaire, tandis que le cadre monolingue offrait un espace de caractéristiques plus homogène. La validation à l'aide du jeu de données Mozilla Common Voice suggère en outre que la représentation proposée se généralise au-delà du jeu de données principal, bien que les différences de conditions d'enregistrement et de répartitions démographiques aient pu encore affecter la performance.

Dans l'ensemble, les résultats ont indiqué que les performances de VoiceNet-RAI étaient dues aux contributions complémentaires des représentations spectrales et contextuelles de la parole, plutôt qu'à un seul type de caractéristique. Toutefois, les variations résiduelles des performances selon les langues et les groupes d'âge ont mis en évidence la nécessité d'une évaluation plus large par sous-groupes, de tests de robustesse au bruit et de comparaisons supplémentaires avec des modèles récents de parole auto-supervisés.

Des approches alternatives pour la classification du sexe et de l'âge basées sur la parole incluent des caractéristiques acoustiques conçues manuellement combinées à des classificateurs ML classiques, l'apprentissage basé sur les réseaux de neurones convolutifs (CNN) à partir de représentations de la parole, des méthodes d'ensemble, ainsi que des modèles auto-supervisés tels que HuBERT, WavLM et data2vec. En revanche, VoiceNet-RAI combine les informations spectrales basées sur les coefficients cepstraux en fréquence (MFCC) avec des intégrations contextuelles de wav2vec 2.0 afin d'exploiter les forces complémentaires des représentations de la parole conçues manuellement et de celles apprises automatiquement.

Cette étude présentait plusieurs limites. Premièrement, le jeu de données principal présentait des distributions déséquilibrées selon le sexe, les langues et les groupes d'âge, ce qui aurait pu influencer les performances par sous-groupe et limiter la généralisabilité aux populations sous-représentées. Deuxièmement, les variations liées aux appareils d'enregistrement, aux accents, à la prononciation et aux conditions acoustiques auraient pu affecter la fiabilité de la classification. Troisièmement, bien que la validation à l'aide du jeu de données Mozilla Common Voice ait soutenu la généralisabilité au-delà du jeu de données principal, une évaluation plus large à l'aide d'autres jeux de données du monde réel restait nécessaire. Enfin, le déploiement de la classification démographique basée sur la voix soulevait des préoccupations en matière de confidentialité, d'équité et d'éthique, notamment dans des applications non contrôlées ou à fort impact. Par conséquent, une surveillance continue des performances, une supervision humaine et des pratiques de déploiement respectueuses de la vie privée seraient nécessaires pour une mise en œuvre responsable. Le cadre proposé démontrait un potentiel pour des applications en interaction homme-machine, en authentification basée sur la voix, en analyse de la parole et en informatique forensique. Les travaux futurs compareront VoiceNet-RAI avec des modèles récents de parole auto-supervisés, notamment HuBERT, WavLM et data2vec, et exploreront une attention spécifique à la tâche sur la représentation fusionnée MFCC–wav2vec 2.0. Contrairement au mécanisme interne d'auto-attention de wav2vec 2.0, le mécanisme futur proposé pondérerait explicitement les informations temporelles et au niveau des caractéristiques pertinentes pour la classification du sexe et de l'âge.

Déclarations de divulgation

Les auteurs n'ont aucun conflit d'intérêts à divulguer.

Remerciements

Les auteurs tiennent à remercier le projet de soutien à la recherche de l'Université Princess Nourah bint Abdulrahman (PNURSP2026R748), Université Princess Nourah bint Abdulrahman, Riyad, Arabie saoudite, pour le financement de cette recherche.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Ensemble de voix difficile BVCBiometrics Vision and Computing Group / OgeNIEnsemble de voix difficile BVChttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, variante exacte utiliséehttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Unité de traitement graphiqueNVIDIATesla K80https://www.nvidia.com/
Jeu de données Mozilla Common VoiceFondation MozillaCommon Voice, version utilisée dans les expérienceshttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyDéveloppeurs de NumPyVersion exacte utilisée dans les expérienceshttps://numpy.org/
ProcesseurIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonFondation Python SoftwareVersion exacte utilisée dans les expérienceshttps://www.python.org/
PyTorchFondation PyTorchVersion exacte utilisée dans les expérienceshttps://pytorch.org/
Scikit-learnDéveloppeurs de Scikit-learnVersion exacte utilisée dans les expérienceshttps://scikit-learn.org/
SciPyDéveloppeurs de SciPyVersion exacte utilisée dans les expérienceshttps://scipy.org/
Wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 11MicrosoftWindows 11, édition/version exacte si disponiblehttps://www.microsoft.com/windows/windows-11

Références

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Réimpressions et autorisations

Étiquettes

Classification multilingue de la paroleClassification du genreIA responsableFramework VoiceNetWav2vec 2 0Caract ristiques MFCCApprentissage profond de la paroleEfficientNet LiteD mographie vocale