Onderzoeksartikel

VoiceNet: Een verantwoord meertalig spraakframework op basis van kunstmatige intelligentie voor gender- en leeftijdclassificatie

49 weergaven

11 september 2026

In dit artikel

Samenvatting

VoiceNet-RAI integreert MFCC-kenmerken, meertalige wav2vec 2.0-embeddings en EfficientNet-Lite voor de classificatie van geslacht en leeftijd op basis van stemgegevens. Het framework behaalt een nauwkeurigheid tot 97,87% op de Engelstalige subset en ondersteunt verantwoorde toepassingen in spraakherkenning, authenticatie en digitale forensica.

Samenvatting

Nauwkeurige classificatie van geslacht en leeftijd op basis van stemgegevens is essentieel voor gepersonaliseerde, veilige en ethische mens-computerinteractie (HCI). Met het toenemende gebruik van grote, vooraf getrainde spraakmodellen zoals wav2vec 2.0, is er behoefte aan een verantwoorde benutting van deze representaties voor meertalige en privacybewuste demografische inferentie. Deze studie stelt VoiceNet-RAI voor, een deep learning (DL) raamwerk dat Mel-Frequency Cepstral Coefficients (MFCC's) integreert met transformer-gebaseerde meertalige wav2vec 2.0-embeddings binnen een EfficientNet-Lite-architectuur om nauwkeurige, eerlijke en transparante classificatie in diverse linguïstische contexten te ondersteunen. Het raamwerk combineert contextuele en spectrale informatie om de robuustheid onder variabele opnameomstandigheden te verbeteren. Experimenten met meertalige spraakgegevens uit 28 talen tonen sterke classificatieprestaties aan, waarbij de Engelse subset een nauwkeurigheid van 97,87%, een precisie van 98,61%, een recall van 98,70% en een F1-score van 98,65% behaalde. Externe validatie met de Mozilla Common Voice-dataset leverde een nauwkeurigheid van 98,27% op voor geslachtclassificatie, wat de generaliseerbaarheid naar een onafhankelijke dataset aantoont. Ablatieanalyse toonde verder aan dat het combineren van MFCC- en wav2vec 2.0-kenmerken de prestaties verbeterde in vergelijking met ruwe representaties of representaties die uitsluitend op MFCC's waren gebaseerd. Deze resultaten tonen het potentieel aan van hybride spectraal-contextuele spraakrepresentaties voor robuuste en verantwoorde classificatie van geslacht en leeftijd.

Inleiding

Stemherkenning is een kerncomponent van menselijke communicatie waarmee individuen hun gevoelens, gedachten en doelen uiten. Menselijke stemmen worden geproduceerd via een biologisch proces waarbij lucht uit de longen wordt uitgeademd en door articulatieorganen zoals de lippen, tong en tanden in geluid wordt omgezet1. Het oor speelt een essentiële rol bij stemidentificatie en kan onderscheid maken tussen mannenstemmen en vrouwenstemmen op basis van kenmerken zoals volume en toonhoogte. Eén kenmerk dat bijdraagt aan aanzienlijke verschillen in stemtoonhoogte tussen mannen en vrouwen is seksueel dimorfisme2. Leeftijds- en geslachtclassificatie op basis van de stem is relevant voor talrijke toepassingen, waaronder mens-machine-interactie, geautomatiseerde geslachtsherkenning, gepersonaliseerde begroetingen, preclassificatie van spraakemoties en geslacht-gebaseerde oproepclassificatie3.

Spraak is een intrinsiek onderdeel van menselijke interactie. De menselijke stem bevat meerdere kenmerken die per individu verschillen en informatie kunnen verschaffen over emotionele en mentale toestanden, evenals over leeftijd en geslacht. Deze multidimensionale kenmerken kunnen worden benut in toepassingen zoals stemgebaseerde beveiligingssystemen en spraakgerichte systemen voor kunstmatige intelligentie (AI). Andere gebieden waarin stemanalyse belangrijk is, zijn systemen voor automatische sprekersverificatie (ASV) en emotiegebaseerde AI-systemen. Stemgebaseerde invoersystemen kunnen daarnaast de zoekruimte binnen databases verkleinen4,5. Bovendien kunnen op AI gebaseerde beveiligingssystemen stemgegevens gebruiken voor toepassingen zoals strafrechtelijke onderzoeken en slachtofferbescherming. Mannelijke en vrouwelijke stemmen vertonen verschillende kenmerken vanwege variaties in de resonantie-eigenschappen van het spraakkanaal. Deze kenmerken kunnen uit spraaksignalen worden geëxtraheerd in een vorm die geschikt is voor computationele verwerking, waardoor genderclassificatie op basis van stemgegevens mogelijk wordt6,7. Daarom zijn effectieve leeralgoritmen vereist voor stemgebaseerde genderclassificatie. Deep Learning (DL)-algoritmen zijn bijzonder geschikt voor spraakgerelateerde classificatie vanwege hun vermogen om complexe patronen uit audiogegevens te leren. Afhankelijk van de architectuur kunnen dergelijke modellen convolutionele, recurrente, temporeel-convolutionele of volledig verbonden lagen bevatten. Deze lagen kunnen relevante akoestische kenmerken leren, waaronder toon en toonhoogte. Eenmaal getraind kan een model het geslacht classificeren op basis van eerder niet geziene audio-opnamen8. Een ander belangrijk onderzoeksgebied binnen machine learning (ML) is leeftijdsclassificatie op basis van stemopnamen. ML-algoritmen kunnen akoestische kenmerken zoals toonhoogte, timbre en amplitude gebruiken om leeftijdsgerelateerde patronen te identificeren. Technieken zoals Principal Component Analysis (PCA) kunnen ook worden toegepast om informatieve patronen uit spraakgegevens te extraheren en potentieel de classificatieprestaties te verbeteren9.

DL heeft sterke prestaties getoond in toepassingen zoals beeld-, emotie- en spraakherkenning. Diepe Neurale Netwerken (DNN's) worden in het bijzonder veelvuldig gebruikt voor spraakgerelateerde taken. In deze studie worden DL-gebaseerde benaderingen toegepast op stemclassificatie in combinatie met gevestigde technieken voor kenmerkextractie. Mel-Frequency Cepstral Coefficients (MFCC's) leggen relevante spectrale kenmerken van spraaksignalen vast en bieden een efficiënte representatie voor verdere verwerking. De geëxtraheerde kenmerken worden vervolgens geïntegreerd in een transfer-learning framework voor stemgebaseerde gender- en leeftijdclassificatie10,1.

Recente studies hebben in toenemende mate zelf-gesuperviseerde en op Transformers gebaseerde spraakrepresentaties aangenomen voor de classificatie van sprekerkenmerken. Onderzoekers hebben demografische biases, waaronder gender- en leeftijdsbiases, onderzocht in zelf-gesuperviseerde spraakmodellen zoals HuBERT en wav2vec 2.0, waarbij het belang van fairness-aware evaluatie werd benadrukt12. Recentelijk hebben op Transformers gebaseerde taal-onafhankelijke benaderingen de effectiviteit aangetoond van geleerde contextuele spraakrepresentaties voor genderherkenning onder meertalige en ruisachtige omstandigheden13. Sinha et al. onderzochten verder laag-specifieke wav2vec 2.0 representaties voor leeftijd- en genderclassificatie en toonden aan dat verschillende Transformer-lagen variërende niveaus van spreker-gerelateerde informatie vastleggen14. Deze ontwikkelingen vormen de motivatie voor het voorgestelde VoiceNet-RAI framework, dat conventionele op MFCC gebaseerde spectrale informatie combineert met contextuele wav2vec 2.0 representaties, terwijl meertalige overwegingen en Responsible AI worden geïntegreerd.

Recente studies hebben aangetoond dat de leeftijd en het geslacht van een spreker kunnen worden gekenmerkt met behulp van zowel conventionele akoestische kenmerken als representaties op basis van deep learning. Benaderingen die akoestische en temporele informatie combineren, hebben aangetoond dat complementaire spraakkenmerken de prestaties van de classificatie van leeftijd en geslacht kunnen verbeteren15,16. Verwant onderzoek heeft ook aangetoond dat getransformeerde spraakkenmerken, gegenereerd met behulp van deep bottleneck-representaties, de prestaties van de classificatie van de leeftijd en het geslacht van de spreker kunnen verbeteren17. Deze bevindingen ondersteunen het bredere gebruik van spectrale, temporele en geleerde representaties voor classificatietaken met spraak en uit spraak afgeleide signalen.

Verschillende studies hebben de herkenning van leeftijd en geslacht uit spraak onderzocht met behulp van machine-learning en deep-learning benaderingen18,19,20,21,2,23,24,25,26,27,28,29,30. Recentere benaderingen hebben getransformeerde MFCC-representaties en diepe neurale netwerken verkend voor de classificatie van de leeftijd en het geslacht van de spreker31, terwijl meertalige en taalafhankelijke variabiliteit belangrijke overwegingen blijven bij de ontwikkeling van robuuste stemgebaseerde demografische classificatiesystemen. Verschillen in uitspraak, fonetische structuur, sprekerkenmerken en opnameomstandigheden kunnen de generaliseerbaarheid van modellen over talen en populaties heen verminderen. Bijgevolg kan het gebruik van complementaire spectrale en contextuele spraakrepresentaties de robuustheid in meertalige omgevingen verbeteren.

Hoewel hybride benaderingen voorheen meerdere akoestische kenmerken of ensemble-classificatoren hebben gecombineerd voor stemgebaseerde demografische herkenning, onderscheidt VoiceNet-RAI zich door twee complementaire niveaus van spraakrepresentatie te integreren binnen een uniform raamwerk. Specifiek behouden conventionele MFCC-kenmerken gelokaliseerde spectrale en vocale eigenschappen, terwijl wav2vec 2.0 contextualiseerde representaties biedt die zijn geleerd uit ruwe spraak met behulp van een Transformer-encoder. In plaats van uitsluitend te vertrouwen op handmatig ontworpen akoestische descriptoren of een enkele diepe representatie, voert VoiceNet-RAI een fusie op kenmerkniveau uit van temporeel geaggregeerde MFCC- en wav2vec 2.0-representaties, om vervolgens de resulterende hybride representatie te verfijnen met EfficientNet-Lite. De wetenschappelijke noviteit ligt daarom in de gecoördineerde integratie van spectrale, zelf-gesuperviseerde contextuele en lichtgewicht diepe representaties voor gender- en leeftijdclassificatie, samen met meertalige evaluatie, validatie met onafhankelijke datasets en een analyse van subgroup fairness. Deze combinatie breidt conventionele hybride spraakclassificatie-pipelines uit voorbij nauwkeurigheid-georiënteerde kenmerkfusie naar een raamwerk dat gelijktijdig rekening houdt met representatiecomplementariteit, lichtgewicht modelontwerp, generaliseerbaarheid en Responsible AI.

De belangrijkste bijdragen van dit onderzoek omvatten de ontwikkeling van een methode voor het identificeren van geslacht en leeftijd op basis van stemgegevens door MFCC- en wav2vec 2.0-kenmerken te integreren met EfficientNet-Lite. Er zijn uitgebreide experimenten uitgevoerd op een dataset van stemopnamen uit 28 talen, waarbij originele kenmerken, MFCC-kenmerken, wav2vec 2.0-kenmerken en hun combinaties zijn geëvalueerd met ML- en DL-modellen. De modelprestaties worden beoordeeld met behulp van zowel de volledige meertalige dataset als de Engelstalige subset. Het raamwerk wordt verder geëvalueerd vanuit meertalige en Responsible AI-perspectieven via subgroup-analyses specifiek voor geslacht en taal, spreker-onafhankelijke evaluatie en validatie met behulp van de Mozilla Common Voice-dataset. Daarnaast worden de prestaties van het voorgestelde raamwerk vergeleken met state-of-the-art benaderingen uit de bestaande literatuur, en worden cross-validatieresultaten verstrekt. Er is een aanzienlijke hoeveelheid gerelateerd onderzoek uitgevoerd, en Tabel 1 vat deze studies samen, inclusief de modellen, datasets en gerapporteerde resultaten19,20,21,2,23,24,25,26,27,28,29,30,31.

Protocol

Voor deze studie werden de publiek beschikbare BVC Challenging Voice Set en Mozilla Common Voice-datasets gebruikt zonder directe betrokkenheid van deelnemers. Daarom waren institutionele ethische goedkeuring en aanvullende geïnformeerde toestemming niet vereist. Er werden alleen gegevens verwerkt die noodzakelijk waren voor de classificatie van geslacht en leeftijd, en er is geen poging ondernomen om individuele sprekers te identificeren. De volledige workflow-methodologie van het voorgestelde framework wordt weergegeven in Figuur 1.

Gegevensverwerving

De dataset die in de voorgestelde benadering is gebruikt, bestond uit .wav-audiobestanden afkomstig van de BVC Challenging Voice Set, een openbaar beschikbare stemdataset ontwikkeld door de Biometrics Vision and Computing (BVC)-groep en gehost op GitHub32. De dataset bevatte stemopnamen van 526 personen, waaronder 36 mannelijke en 190 vrouwelijke sprekers. Deze bestond uit ongeveer 3.964 opnamen, inclusief zowel enkelvoudige als meervoudige zinopnamen van elke spreker. Tabel 2 vat de demografische kenmerken, taaldekking, opname-eigenschappen, data-partitioneringsstrategie en voorbewerkingsinstellingen samen die zijn gebruikt voor de spraakdatasets in het voorgestelde VoiceNet-RAI-framework.

Kenmerkextractie

Audiobestanden werden verwerkt om essentiële eigenschappen te extraheren, die vervolgens in een CSV-bestand werden opgeslagen. Metadata, waaronder leeftijd, geslacht en de uitspraak van de spreker, werd geëxtraheerd uit de bijbehorende README-bestanden. Python, samen met het SciPy-pakket, werd gebruikt om de WAV-bestanden te verwerken en relevante kenmerken te extraheren. De Fast Fourier Transform (FFT) en frequentiefuncties van NumPy werden ingezet om de audiosignalen om te zetten van het tijddomein naar het frequentiedomein. De WAV-bestanden representeerden de amplitude als functie van de tijd; echter waren frequentiegerelateerde kenmerken die mannen- en vrouwenstemmen konden onderscheiden van groter belang voor de classificatietaak3.

Om de audiosignalen om te zetten in representaties in het frequentiedomein, werd de Discrete Fourier-transformatie (DFT) geïmplementeerd met behulp van het FFT-algoritme. De Fourier-transformatie zet een signaal in het tijddomein om in een frequenciespectrum. Omdat dit spectrum geen temporele informatie behoudt, werd het audiosignaal verdeeld in overlappende segmenten en werd de Fourier-transformatie op elk segment toegepast met de Short-Time Fourier Transform (STFT)-methode. De functie np.fft.fft genereerde het complexe frequenciespectrum, terwijl np.fft.fftfreq de bijbehorende steekproeffrequenties leverde. In de voorbeeldmap waren 10 audiobestanden van één spreker beschikbaar. Elk WAV-bestand werd verwerkt met glijdende vensters van 20 ms om de dominante frequenties te extraheren. Een audio-opname van 4 seconden produceerde bijvoorbeeld een lijst van 20 frequentiewaarden. Voor een map met 10 opnames werden de 10 bijbehorende lijsten, elk met 20 frequentiewaarden, gecombineerd tot een lijst van lijsten. Frequenties werden gefilterd om waarden tussen 20 Hz en 280 Hz te behouden, terwijl potentiële ruis rond 50 Hz werd uitgesloten.

Hybride MFCC- en wav2vec 2.0-kenmerkrepresentatie

Om zowel hoogwaardige contextuele spraakrepresentaties als laagwaardige akoestische kenmerken vast te leggen, maakte deze studie gebruik van een hybride kenmerkextractiestrategie die MFCC-kenmerken integreerde met Transformer-gebaseerde wav2vec 2.0-embeddings.

MFCC-kenmerkextractie

Mel-Frequency Cepstral Coefficients (MFCC's) zijn veelgebruikte kenmerken in spraak- en audiosignaalverwerking, in het bijzonder voor toepassingen zoals spraakherkenning en sprekeridentificatie34,35. In deze studie transformeerde de MFCC-extractie de audiosignalen in kenmerkvectoren die perceptueel relevante eigenschappen van spraak vertegenwoordigen. Het proces begon met pre-emphasis om hoge-frequentiecomponenten te versterken, gevolgd door framing en windowing om het signaal op te delen in korte, overlappende frames. Elk audiofragment werd eerst geresampled naar 16 kHz en gesegmenteerd in frames van 25 ms met een overlap van 10 ms. Vervolgens werd de Fast Fourier Transform op elk frame toegepast om het signaal van het tijdsdomein naar het frequentiedomein om te zetten.

Het resulterende frequentiespectrum werd door een reeks Mel-filterbanken geleid die de niet-lineaire frequentierespons van de menselijke auditieve perceptie benaderden. Deze filterbanken legden de nadruk op perceptueel relevantere frequenties, terwijl de bijdrage van minder informatieve frequenties werd verminderd. Vervolgens werd het logaritme van de output van elke filterbank berekend om de logaritmische gevoeligheid van het menselijk gehoor voor luidheid te benaderen. Daarna werd een Discrete Cosinus Transformatie (DCT) toegepast op de logaritmische energieën van de filterbanken om de coëfficiënten te decorreleren en een compacte representatie van het audiosignaal te genereren. De resulterende coëfficiënten, bekend als MFCC's, legden belangrijke spectrale kenmerken van spraak vast. MFCC's werden gebruikt voor gender- en leeftijdclassificatie omdat ze akoestische kenmerken vastleggen die stemmen op basis van deze eigenschappen differentiëren.

wav2vec 2.0 embedding-extractie

Het wav2vec 2.0 Base-model is vooraf getraind op grootschalige niet-gelabelde spraakcorpora. Het model bestond uit een meerlaagse Transformer-encoder die ruwe golfvorm-inputs verwerkte en gecontextualiseerde spraak-embeddings genereerde36.

Gegeven een invoergolfvorm x ∈ RT, produceerde het wav2vec 2.0-model een reeks latente representaties:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

waarbij elke embedding-vector een dimensionaliteit van 768 had. Om een representatie met een vaste lengte te verkrijgen die geschikt is voor classificatie, werd een temporele mean pooling-operatie toegepast over alle tijdstappen.

figure-protocol-1   (2)

Mechanisme voor kenmerkfusie

De MFCC- en wav2vec 2.0-kenmerken werden gefuseerd via concatenatie op kenmerkniveau. Specifiek werden de MFCC-kenmerken eerst geaggregeerd middels temporele middeling om een vector met een vaste lengte te produceren.

m ∈ R40  (3)

De uiteindelijke hybride kenmerkvector werd als volgt verkregen:

h = [m || zpooled] ∈ R808  (4)

waarbij || concatenatie aanduidt. Deze fusie combineerde diepe contextuele embeddings met handmatig ontworpen spectrale kenmerken, waardoor het model zowel hoogwaardige semantische informatie als fijnmazige akoestische patronen kon vastleggen.

Alle audiofragmenten werden eerst geresampled naar 16 kHz. MFCC-kenmerken werden per frame berekend en temporeel gemiddeld om een vaste 40-dimensionale vector te produceren, terwijl wav2vec 2.0-embeddings via mean-pooling over de tijd werden verwerkt om een 768-dimensionale representatie te verkrijgen. Omdat beide sets kenmerken vóór de fusie werden omgezet in vectoren met een vaste lengte, was temporele uitlijning op frameniveau niet vereist. De resulterende MFCC- en wav2vec-representaties werden vervolgens geconcateneerd tot een hybride kenmerkvector van 808 dimensies voordat deze aan het classificatiemodel werden doorgegeven.

Integratie met EfficientNet-Lite

De gefuseerde kenmerkvector, h, werd herschaald naar een formaat dat geschikt was voor kenmerkleren en werd als input aan het EfficientNet-Lite-model geleverd voor training. Een volledig verbonden projectielaag bracht de 808-dimensionale vector eerst over naar een hoger-dimensionale latente ruimte, waarna de EfficientNet-Lite-blokken de hiërarchische kenmerken verfijnden. Batch-normalisatielagen en dropout-lagen werden gebruikt om overfitting te verminderen en de generalisatie van het model te verbeteren. De SoftMax-activatiefunctie werd gebruikt om de uiteindelijke voorspelde kansen voor de gender- en leeftijdsklassen te genereren. De gefuseerde representatie, h ∈ R808, werd aanvankelijk behandeld als een eendimensionale kenmerkvector en via een volledig verbonden projectielaag geleid die deze naar 4.096 dimensies bracht. De geprojecteerde representatie werd vervolgens herschaald naar een 1 × 64 × 64 tensor voordat deze aan de EfficientNet-Lite-architectuur werd toegevoerd.

Om de representatie van spraakkenmerken met één enkel kanaal te kunnen verwerken, in plaats van de conventionele invoer van afbeeldingen met drie kanalen, is de oorspronkelijke convolutionele invoerlaag van EfficientNet-Lite aangepast van drie naar één invoerkanaal. De overige feature-extractieblokken van EfficientNet-Lite zijn behouden zonder grote architecturale wijzigingen. Er is een adaptieve global average pooling-laag toegepast op de uiteindelijke feature maps om een representatie van vaste lengte te genereren. De oorspronkelijke classificatiekop is vervangen door een taakspecifieke fully connected-laag met twee output-units voor genderclassificatie en het corresponderende aantal output-units voor de vooraf gedefinieerde leeftijdsgroepen. Ten slotte is de SoftMax-activatiefunctie toegepast om klassewaarschijnlijkheden te genereren. De voorgestelde hybride representatie combineerde moderne self-supervised spraak-embeddings met traditionele signaalverwerkingskenmerken. De wav2vec 2.0-embeddings legden contextuele informatie en lange-afstandsafhankelijkheden vast, terwijl de MFCC-kenmerken aanvullende akoestische informatie op laag niveau boden. De integratie van deze representaties verbeterde de classificatieprestaties, in het bijzonder onder ruisgevoelige en meertalige spraakcondities.

ML-classifier

In dit onderzoek werd de prestatie van meerdere ML-algoritmen geanalyseerd voor stemgebaseerde classificatie van geslacht en leeftijdsgroep.

Random Forest

Random Forest (RF) werd gebruikt als een robuuste Machine Learning (ML)-classifier, waarbij meerdere Decision Trees (DT's) werden gecombineerd om de voorspellingsnauwkeurigheid te verbeteren en overfitting te verminderen. RF werkte via een ensemble-learningprocedure waarbij voorspellingen van meerdere bomen werden samengevoegd om de uiteindelijke voorspelling te genereren37,38. Deze aanpak stelde RF in staat om diverse patronen in de data vast te leggen, terwijl de overfitting die gewoonlijk geassocieerd wordt met individuele DT's werd verminderd. De willekeurigheid die tijdens de constructie van de bomen werd geïntroduceerd, verbeterde de generaliseerbaarheid van het model, waardoor RF geschikt was voor classificatietaken zoals de classificatie van geslacht en leeftijd op basis van stemgegevens.

Logistische regressie

Logistische Regressie (LR) werd gebruikt als statistisch ML-model voor classificatie39. Bij binaire classificatie schat LR de waarschijnlijkheid van een uitkomst op basis van de inputkenmerken met behulp van de logistische (sigmoïde) functie, en de resulterende waarschijnlijkheden worden gebruikt om klassevoorspellingen te genereren. LR was ook toepasbaar op multiclasse-classificatieproblemen waarbij meer dan twee klassen betrokken waren. Voor multiclasse-classificatie maakte LR gebruik van benaderingen zoals one-vs-rest of SoftMax-regressie, afhankelijk van de classificatie-instelling.

Extra Tree Classifier

De Extra Trees Classifier (ETC) werd gebruikt als een ensemble learning-algoritme dat meerdere DT's combineerde om voorspellingen te genereren40,41. In tegenstelling tot RF introduceert ETC extra willekeur door tijdens de constructie van de bomen willekeurig kandidaat-kenmerken en splitsingsdrempels te selecteren. Deze procedure genereerde minder gecorreleerde bomen en verminderde de gevoeligheid van het model voor individuele kenmerken, waardoor de robuustheid tegen ruis werd verbeterd. De Gini-index werd gebruikt als splitsingscriterium om het belang van kenmerken te evalueren en de gegevens te partitioneren.

Support Vector Machine

Support Vector Machine (SVM) werd gebruikt als een ML-classifier om een optimale beslissingsgrens in een hoogdimensionale kenmerkruimte te identificeren42. Het doel was om een hypervlak te bepalen dat de marge tussen klassen maximaliseerde. Een grotere marge tussen de beslissingsgrens en de dichtstbijzijnde datapunten ondersteunde over het algemeen een betere klassenseparatie en generalisatie. SVM was toepasbaar op verschillende ML-taken, waaronder classificatie, regressie en kenmerkgebaseerde data-analyse.

Convolutionele Neurale Netwerken

Convolutionele Neurale Netwerken (CNN's) werden gebruikt als Deep Learning (DL)-modellen voor classificatietaken met gestructureerde representaties van beeld- en audiogegevens. Eendimensionale CNN's (1D-CNN's) zijn daarnaast veelvuldig toegepast op sequentiële en tekstuele gegevens. CNN-architecturen maakten gebruik van convolutionele filters en pooling-operaties om discriminerende kenmerken uit de inputgegevens te extraheren43,4. Voor de classificatie van geslacht en leeftijd op basis van stemgegevens werden CNN's toegepast op spraakafgeleide representaties om patronen te leren die geassocieerd zijn met toonhoogte, frequentie, klankkleur en andere vocale kenmerken die relevant zijn voor het onderscheiden van geslacht- en leeftijdsgroepen.

VGG19

VGG19 werd gebruikt als DL-architectuur, gekenmerkt door een diepe, relatief uniforme hiërarchische structuur voor kenmerkextractie45. De architectuur maakte gebruik van kleine 3 × 3 convolutionele filters over 19 lagen, waardoor progressieve extractie van discriminerende kenmerken mogelijk was. Wanneer VGG19 werd toegepast op spraakafgeleide representaties, legde het zowel laagwaardige akoestische patronen, zoals variaties in toonhoogte en frequentie, als hoogwaardige discriminerende kenmerken vast. De diepe architectuur maakte progressieve kenmerkabstractie mogelijk voor het modelleren van vocale eigenschappen geassocieerd met geslacht en leeftijd.

EfficientNet-Lite

EfficientNet-Lite werd gebruikt als een computationeel efficiënte DL-architectuur46,47. Het model maakte gebruik van een gebalanceerde schalingsstrategie om sterke classificatieprestaties te behalen, terwijl er minder computationele middelen nodig waren dan bij zwaardere DL-architecturen. De compound scaling-benadering hield gezamenlijk rekening met de modeldiepte, breedte en inputresolutie om een efficiënte kenmerkextractie te realiseren.

EfficientNet-Lite werd gekozen voor het voorgestelde VoiceNet-RAI-framework vanwege de lichtgewicht architectuur en de gunstige balans tussen classificatieprestaties en modelcomplexiteit. In vergelijking met zwaardere architecturen maakte het gebruik van efficiënte convolutionele blokken en compound scaling om effectief kenleerproces te bereiken met minder parameters en lagere computationele vereisten. Deze eigenschappen maakten EfficientNet-Lite geschikt voor het voorgestelde framework voor spraakclassificatie en boden het potentieel voor implementatie in omgevingen met beperkte middelen.

MobileNet

MobileNet werd gebruikt als een lichtgewicht DL-architectuur voor toepassingen met beperkte computationele middelen, waaronder mobiele omgevingen en edge computing48. De computationele efficiëntie werd primair bereikt door depthwise separable convolutions, die het aantal parameters en computationele bewerkingen verminderden in vergelijking met conventionele convolutionele architecturen. Deze kenmerken maakten MobileNet geschikt voor het evalueren van gender- en leeftijdclassificatie op basis van stemgegevens, terwijl de computationele vereisten relatief laag bleven.

InceptionV3

InceptionV3 werd gebruikt als diepe architectuur om hiërarchische kenmerken te extraheren uit spraakafgeleide representaties49. De architectuur maakte gebruik van convolutionele, pooling- en mixed-operaties om kenmerken op verschillende abstractieniveaus te extraheren. Voor de classificatie van geslacht en leeftijd op basis van stemgegevens werd InceptionV3 ingezet om complexe akoestische patronen en hiërarchische representaties te leren die geassocieerd zijn met variaties in vocale kenmerken.

Evaluatieparameters

Nauwkeurigheid was een van de meest gebruikte evaluatiematen voor classificatietaken50. Hoewel nauwkeurigheid een nuttige maatstaf bood voor de algehele classificatieprestaties, leverde het niet altijd een volledige beoordeling op, met name bij ongebalanceerde datasets. Daarom werden aanvullende metrieken, waaronder precisie, recall en de F1-score, gebruikt om de modelprestaties te evalueren. Deze metrieken boden een completere beoordeling door rekening te houden met correcte en incorrecte voorspellingen voor elke klasse.

Nauwkeurigheid werd gedefinieerd als de verhouding tussen correct geclassificeerde waarnemingen en het totale aantal waarnemingen. Hoewel nauwkeurigheid bijzonder informatief is voor gebalanceerde datasets, was de dataset die in deze studie is gebruikt ongebalanceerd. Daarom werden True Positives (TP), False Positives (FP), True Negatives (TN) en False Negatives (FN) meegewogen bij het berekenen en interpreteren van de classificatiemetrieken. De onderstaande vergelijking representeert de standaarddefinitie van nauwkeurigheid:

Nauwkeurigheid =  (TP+TN)/(TP+TN+FP+FN)×10  (5)

Precisie beoordeelt het vermogen van de classifier om uitsluitend relevante instanties terug te geven:

Precisie=  TP/(TP+FP)  ×10   (6)

Recall, ook bekend als sensitiviteit, meet het vermogen van de classifier om alle relevante instanties te identificeren:

Recall=  TP/(FN+TP) × 10   (7)

De F1-score combineert precisie en recall in één enkele maatstaf en is bijzonder nuttig voor het evalueren van de classificatieprestaties bij ongebalanceerde datasets:

F1-score = 2 ×(PPV ×TPR)/(TPR+PPV) × 10   (8)

Resultaten

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Discussie

In deze studie is een geautomatiseerd raamwerk ontwikkeld en geëvalueerd voor de classificatie van geslacht en leeftijd op basis van stemgegevens door de integratie van MFCC-kenmerken en wav2vec 2.0-embeddings met EfficientNet-Lite. In de initiële experimenten behaalde EfficientNet-Lite een nauwkeurigheid van 83,48%, een precisie van 82,87%, een recall van 84,28% en een F1-score van 83,54% met behulp van de oorspronkelijke kenmerken. Na de integratie van MFCC-kenmerken verbeterde de prestatie aanzienlijk, met een nauwkeurigheid van 92,64%, een precisie van 93,79%, een recall van 94,92% en een F1-score van 94,84% op de dataset bestaande uit 28 talen. Met gebruik van de hybride MFCC–wav2vec 2.0-representatie op de Engelstalige subset behaalde EfficientNet-Lite een nauwkeurigheid van 97,87%, een precisie van 98,61%, een recall van 98,70% en een F1-score van 98,65%. De generaliseerbaarheid werd verder beoordeeld met de Mozilla Common Voice-dataset, waarop het voorgestelde raamwerk eveneens sterke prestaties vertoonde. Daarnaast werd de stabiliteit van het model geëvalueerd middels vijfvoudige kruisvalidatie.

De verbetering die werd waargenomen na de integratie van MFCC-kenmerken gaf aan dat spectrale kenmerken op laag niveau, waaronder toonhoogte, timbre en informatie over het spraakkanaal, zeer onderscheidend bleven voor de classificatie van geslacht en leeftijd. De aanvullende prestatiewinst die werd behaald met de hybride MFCC–wav2vec 2.0-representatie suggereerde dat contextuele embeddings op basis van Transformers complementaire informatie boden die niet volledig werd vastgelegd door handmatig ontworpen akoestische kenmerken alleen. Deze complementariteit kan de verbeterde prestaties van de voorgestelde hybride representatie verklaren in vergelijking met de oorspronkelijke configuraties en de configuraties die enkel op MFCC waren gebaseerd. De sterkere prestaties die werden waargenomen in de Engelstalige subset suggereerden daarnaast dat linguïstische variabiliteit mogelijk heeft bijgedragen aan de moeilijkheidsgraad van de classificatie. Wanneer meerdere talen werden gecombineerd, kunnen verschillen in uitspraak, accent, fonetische structuur en steekproefverdeling extra variabiliteit hebben geïntroduceerd, terwijl de setting met één taal een homogener kenmerkruimte bood. Validatie met behulp van de Mozilla Common Voice-dataset suggereerde verder dat de voorgestelde representatie generaliseerde buiten de primaire dataset, hoewel verschillen in opnameomstandigheden en demografische verdelingen de prestaties nog steeds kunnen hebben beïnvloed.

Over het algemeen gaven de resultaten aan dat de prestaties van VoiceNet-RAI werden gestuurd door de complementaire bijdragen van spectrale en contextuele spraakrepresentaties, in plaats van door één enkel type kenmerk. De resterende variaties in prestaties tussen talen en leeftijdsgroepen benadrukten echter de noodzaak voor een bredere evaluatie van subgroepen, tests voor ruisrobuustheid en aanvullende vergelijkingen met recente zelfgesuperviseerde spraakmodellen.

Alternatieve benaderingen voor spraakgebaseerde classificatie van geslacht en leeftijd omvatten handmatig ontworpen akoestische kenmerken met conventionele ML-classificatoren, CNN-gebaseerd leren uit spraakrepresentaties, ensemble-methoden en zelf-gesuperviseerde modellen zoals HuBERT, WavLM en data2vec. In tegenstelling hiermee combineert VoiceNet-RAI MFCC-gebaseerde spectrale informatie met contextuele wav2vec 2.0 embeddings om de complementaire sterktes van handmatig ontworpen en geleerde spraakrepresentaties te benutten.

Deze studie kende verschillende beperkingen. Ten eerste vertoonde de primaire dataset ongebalanceerde distributies over geslacht, talen en leeftijdsgroepen, wat de prestaties van subgroepen kan hebben beïnvloed en de generaliseerbaarheid naar ondervertegenwoordigde populaties kan hebben beperkt. Ten tweede kunnen variaties in opnameapparatuur, accenten, uitspraak en akoestische omstandigheden de betrouwbaarheid van de classificatie hebben beïnvloed. Ten derde, hoewel validatie met behulp van de Mozilla Common Voice-dataset de generaliseerbaarheid buiten de primaire dataset ondersteunde, bleef een bredere evaluatie met aanvullende real-world datasets noodzakelijk. Ten slotte riep de implementatie van spraakgebaseerde demografische classificatie zorgen op over privacy, eerlijkheid en ethiek, met name in ongecontroleerde of high-impact toepassingen. Daarom zouden continue prestatiemonitoring, menselijk toezicht en privacy-bewuste implementatiepraktijken noodzakelijk zijn voor een verantwoorde toepassing. Het raamwerk toonde potentieel voor toepassingen in mens-computerinteractie, spraakgebaseerde authenticatie, spraakanalyse en digitale forensica. Toekomstig werk zal VoiceNet-RAI vergelijken met recente zelf-gesuperviseerde spraakmodellen, waaronder HuBERT, WavLM en data2vec, en zal taakspecifieke attention onderzoeken over de gefuseerde MFCC–wav2vec 2.0 representatie. In tegenstelling tot het interne self-attention mechanisme van wav2vec 2.0, zou het voorgestelde toekomstige mechanisme expliciet taakrelevante temporele informatie en informatie op kenmerkniveau wegen voor classificatie van geslacht en leeftijd.

Openbaarmakingen

De auteurs hebben geen belangenconflicten te melden.

Dankbetuigingen

De auteurs willen graag het Princess Nourah bint Abdulrahman University Researchers Supporting Project nummer (PNURSP2026R748), Princess Nourah bint Abdulrahman University, Riyadh, Saoedi-Arabië bedanken voor de financiering van dit onderzoek.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
BVC Challenging Voice SetBiometrics Vision and Computing Group / OgeNIBVC Challenging Voice Sethttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, exacte gebruikte varianthttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Grafische Processor (GPU)NVIDIATesla K80https://www.nvidia.com/
Mozilla Common Voice DatasetMozilla FoundationCommon Voice, versie gebruikt in experimentenhttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyNumPy DevelopersExacte versie gebruikt in experimentenhttps://numpy.org/
ProcessorIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonPython Software FoundationExacte versie gebruikt in experimentenhttps://www.python.org/
PyTorchPyTorch FoundationExacte versie gebruikt in experimentenhttps://pytorch.org/
Scikit-learnScikit-learn DevelopersExacte versie gebruikt in experimentenhttps://scikit-learn.org/
SciPySciPy DevelopersExacte versie gebruikt in experimentenhttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 1MicrosoftWindows 1, exacte editie/build indien beschikbaarhttps://www.microsoft.com/windows/windows-1

Referenties

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Herprints en machtigingen

Tags

Meertalige spraakclassificatiegenderclassificatieverantwoorde AIVoiceNet-frameworkWav2vec 2.0MFCC-kenmerkendeep learning voor spraakEfficientNet-Litespraakdemografie