Artykuł badawczy

VoiceNet: Odpowiedzialny wielojęzyczny system sztucznej inteligencji do rozpoznawania mowy w celu klasyfikacji płci i wieku

48 wyświetleń

11 września 2026

W tym artykule

Podsumowanie

VoiceNet-RAI integruje cechy MFCC, wielojęzyczne osadzenia wav2vec 2.0 oraz EfficientNet-Lite w celu klasyfikacji płci i wieku na podstawie danych głosowych. System ten osiąga dokładność do 97,87% w podzbiorze języka angielskiego i wspiera odpowiedzialne zastosowania w rozpoznawaniu mowy, uwierzytelnianiu oraz informatyce śledczej.

Streszczenie

Dokładna klasyfikacja płci i wieku na podstawie danych głosowych jest istotna dla spersonalizowanej, bezpiecznej i etycznej interakcji człowiek-komputer (HCI). W związku z rosnącym wykorzystaniem dużych, wstępnie wytrenowanych modeli mowy, takich jak wav2vec 2.0, istnieje potrzeba odpowiedzialnego wykorzystania tych reprezentacji do wielojęzycznego i świadomego kwestii prywatności wnioskowania demograficznego. Niniejsze badanie proponuje VoiceNet-RAI, ramy głębokiego uczenia (DL), które integrują mel-częstotliwościowe współczynniki cepstralne (MFCCs) z wielojęzycznymi embeddingami wav2vec 2.0 opartymi na transformerach w architekturze EfficientNet-Lite, aby wspierać dokładną, sprawiedliwą i przejrzystą klasyfikację w różnych kontekstach językowych. System ten łączy informacje kontekstowe i spektralne, aby zwiększyć odporność w zmiennych warunkach nagrywania. Eksperymenty na wielojęzycznych danych mowy obejmujących 28 języków wykazują wysoką skuteczność klasyfikacji, przy czym podzbiór języka angielskiego osiągnął dokładność 97,87%, precyzję 98,61%, czułość 98,70% oraz wynik F1 na poziomie 98,65%. Walidacja zewnętrzna z wykorzystaniem zbioru danych Mozilla Common Voice przyniosła dokładność 98,27% dla klasyfikacji płci, co dowodzi zdolności do generalizacji na niezależnym zbiorze danych. Analiza ablacyjna wykazała ponadto, że połączenie cech MFCC i wav2vec 2.0 poprawia wydajność w porównaniu z reprezentacjami surowymi oraz opartymi wyłącznie na MFCC. Wyniki te demonstrują potencjał hybrydowych spektralno-kontekstowych reprezentacji mowy dla odpornej i odpowiedzialnej klasyfikacji płci i wieku.

Wprowadzenie

Rozpoznawanie głosu jest kluczowym elementem ludzkiej komunikacji, za pomocą którego jednostki wyrażają swoje uczucia, myśli i cele. Ludzki głos powstaje w procesie biologicznym, w którym powietrze wydychane z płuc jest kształtowane w dźwięk przez organy artykulacyjne, takie jak wargi, język i zęby1. Ucho odgrywa istotną rolę w identyfikacji głosu i potrafi odróżnić głosy męskie od żeńskich na podstawie takich cech jak głośność i wysokość dźwięku. Jedną z cech przyczyniających się do znacznych różnic w wysokości głosu między mężczyznami a kobietami jest dymorfizm płciowy2. Klasyfikacja wieku i płci na podstawie głosu ma zastosowanie w wielu obszarach, w tym w interakcji człowiek-maszyna, zautomatyzowanym rozpoznawaniu płci, spersonalizowanych powitaniach, wstępnej klasyfikacji emocji w mowie oraz klasyfikacji połączeń w oparciu o płeć3.

Mowa jest nieodłącznym elementem ludzkich interakcji. Ludzki głos posiada wiele cech, które różnią się między osobnikami i mogą dostarczać informacji o stanach emocjonalnych i psychicznych, a także o wieku i płci. Te wielowymiarowe cechy mogą być wykorzystywane w takich zastosowaniach, jak systemy bezpieczeństwa oparte na głosie oraz asystenci Sztucznej Inteligencji (AI) zorientowani na mowę. Inne obszary, w których analiza głosu jest istotna, to systemy automatycznej weryfikacji mówcy (ASV) oraz systemy AI oparte na emocjach. Systemy wprowadzania danych oparte na głosie mogą również zredukować przestrzeń wyszukiwania w bazach danych4,5. Ponadto systemy bezpieczeństwa oparte na AI mogą wykorzystywać dane głosowe w takich zastosowaniach, jak dochodzenia kryminalne i ochrona ofiar. Głosy męskie i żeńskie wykazują różne cechy ze względu na różnice w właściwościach rezonansowych traktu głosowego. Cechy te mogą być ekstrahowane z sygnałów mowy w formie odpowiedniej do przetwarzania obliczeniowego, co umożliwia klasyfikację płci na podstawie danych głosowych6,7. W związku z tym niezbędne są efektywne algorytmy uczenia dla klasyfikacji płci opartej na głosie. Algorytmy głębokiego uczenia (DL) są szczególnie odpowiednie do klasyfikacji związanej z mową ze względu na ich zdolność do uczenia się złożonych wzorców z danych audio. Takie modele, w zależności od architektury, mogą zawierać warstwy splotowe, rekurencyjne, sploty czasowe lub warstwy w pełni połączone. Warstwy te mogą uczyć się istotnych cech akustycznych, w tym barwy i wysokości dźwięku. Po przeszkoleniu model może klasyfikować płeć z wcześniej nieznanych nagrań audio8. Kolejnym ważnym obszarem badań nad uczeniem maszynowym (ML) jest klasyfikacja wieku na podstawie nagrań głosu. Algorytmy ML mogą wykorzystywać cechy akustyczne, takie jak wysokość, barwa i amplituda, do identyfikacji wzorców związanych z wiekiem. Techniki takie jak analiza głównych składowych (PCA) mogą być również stosowane do ekstrahowania informacyjnych wzorców z danych mowy i potencjalnego poprawienia wydajności klasyfikacji9.

DL wykazuje wysoką skuteczność w zastosowaniach takich jak rozpoznawanie obrazów, emocji i mowy. W szczególności głębokie sieci neuronowe (DNN) są szeroko wykorzystywane w zadaniach związanych z mową. W niniejszym badaniu podejścia oparte na DL zastosowano do klasyfikacji głosu w połączeniu z uznanymi technikami ekstrakcji cech. Mel-częstotliwościowe współczynniki cepstralne (MFCC) wychwytują istotne charakterystyki widmowe sygnałów mowy i zapewniają wydajną reprezentację do dalszego przetwarzania. Wyekstrahowane cechy są następnie integrowane w ramach struktury uczenia transferowego (transfer learning) w celu klasyfikacji płci i wieku na podstawie głosu10,11.

W niedawnych badaniach coraz częściej stosuje się reprezentacje mowy oparte na uczeniu nadzorowanym (self-supervised) oraz modelu Transformer do klasyfikacji cech mówcy. Badacze analizowali uprzedzenia demograficzne, w tym związane z płcią i wiekiem, w modelach mowy z uczeniem nadzorowanym, takich jak HuBERT i wav2vec 2.0, podkreślając znaczenie ewaluacji uwzględniającej sprawiedliwość (fairness-aware evaluation)12. W ostatnim czasie podejścia oparte na modelu Transformer, niezależne od języka, wykazały skuteczność wyuczonych kontekstowych reprezentacji mowy w rozpoznawaniu płci w warunkach wielojęzycznych i zaszumionych13. Sinha i współpracownicy przeprowadzili dalsze badania nad reprezentacjami modelu wav2vec 2.0 w poszczególnych warstwach pod kątem klasyfikacji wieku i płci, wykazując, że różne warstwy Transformera przechwytują zróżnicowane poziomy informacji związanych z mówcą14. Rozwoje te stanowią podstawę do zaproponowania frameworka VoiceNet-RAI, który łączy konwencjonalne informacje widmowe oparte na MFCC z kontekstowymi reprezentacjami wav2vec 2.0, uwzględniając jednocześnie kwestie wielojęzyczności oraz zasad odpowiedzialnej sztucznej inteligencji (Responsible AI).

Niedawne badania wykazały, że wiek i płeć mówcy mogą być charakteryzowane przy użyciu zarówno konwencjonalnych cech akustycznych, jak i reprezentacji opartych na głębokim uczeniu. Podejścia łączące informacje akustyczne i czasowe wykazały, że komplementarne charakterystyki mowy mogą poprawić skuteczność klasyfikacji wieku i płci15,16. Powiązane badania dowiodły również, że przekształcone cechy mowy generowane przy użyciu głębokich reprezentacji wąskiego gardła (deep bottleneck representations) mogą zwiększyć dokładność klasyfikacji wieku i płci mówcy17. Wyniki te wspierają szersze zastosowanie reprezentacji spektralnych, czasowych oraz wyuczonych w zadaniach klasyfikacji obejmujących mowę i sygnały pochodne od mowy.

Wiele badań analizowało rozpoznawanie wieku i płci z mowy z wykorzystaniem metod uczenia maszynowego i głębokiego uczenia18,19,20,21,22,23,24,25,26,27,28,29,30. Nowsze podejścia badały przekształcone reprezentacje MFCC oraz głębokie sieci neuronowe w celu klasyfikacji wieku i płci mówcy31, podczas gdy zmienność wielojęzyczna i zależna od języka pozostaje istotnym zagadnieniem przy opracowywaniu odpornych systemów demograficznej klasyfikacji głosu. Różnice w wymowie, strukturze fonetycznej, charakterystyce mówcy oraz warunkach nagrywania mogą ograniczać generalizowalność modelu w odniesieniu do różnych języków i populacji. W związku z tym zastosowanie komplementarnych reprezentacji widmowych i kontekstowych mowy może zwiększyć odporność systemów w środowiskach wielojęzycznych.

Choć w podejściach hybrydowych wcześniej łączono wiele cech akustycznych lub klasyfikatory zespołowe w celu rozpoznawania demografii na podstawie głosu, VoiceNet-RAI różni się poprzez integrację dwóch komplementarnych poziomów reprezentacji mowy w ramach jednolitego schematu. W szczególności konwencjonalne cechy MFCC zachowują lokalne charakterystyki widmowe i wokalne, podczas gdy wav2vec 2.0 dostarcza kontekstualnych reprezentacji wyuczonych z surowej mowy przy użyciu kodera Transformer. Zamiast polegać wyłącznie na ręcznie opracowanych deskryptorach akustycznych lub pojedynczej głębokiej reprezentacji, VoiceNet-RAI wykonuje fuzję na poziomie cech czasowo zagregowanych reprezentacji MFCC i wav2vec 2.0, a następnie dopracowuje wynikową reprezentację hybrydową za pomocą EfficientNet-Lite. Nowością naukowa jest zatem skoordynowana integracja reprezentacji widmowych, kontekstowych z nadzorem własnym oraz lekkich reprezentacji głębokich do klasyfikacji płci i wieku, wraz z ewaluacją wielojęzyczną, walidacją na niezależnym zbiorze danych oraz analizą sprawiedliwości podgrup. Takie połączenie rozszerza konwencjonalne hybrydowe potoki klasyfikacji mowy poza fuzję cech zorientowaną na dokładność, w stronę frameworka, który jednocześnie uwzględnia komplementarność reprezentacji, projekt lekkiego modelu, generalizowalność oraz Odpowiedzialną AI (Responsible AI).

Główne wkłady niniejszej pracy obejmują opracowanie podejścia do identyfikacji płci i wieku na podstawie danych głosowych poprzez integrację cech MFCC i wav2vec 2.0 z modelem EfficientNet-Lite. Przeprowadzono szeroko zakrojone eksperymenty na zbiorze nagrań głosowych w 28 językach, oceniając cechy oryginalne, cechy MFCC, cechy wav2vec 2.0 oraz ich kombinacje za pomocą modeli ML i DL. Wydajność modeli oceniano zarówno na pełnym wielojęzycznym zbiorze danych, jak i na podzbiorze w języku angielskim. Strukturę tę poddano dalszej ocenie z perspektywy wielojęzyczności oraz Odpowiedzialnej Sztucznej Inteligencji (Responsible AI) poprzez analizy podgrup specyficznych dla płci i języka, ewaluację niezależną od mówcy oraz walidację z wykorzystaniem zbioru danych Mozilla Common Voice. Ponadto wydajność zaproponowanej struktury porównano z najnowocześniejszymi podejściami opisanymi w literaturze przedmiotu i przedstawiono wyniki walidacji krzyżowej. Przeprowadzono obszerny przegląd powiązanych badań, a Tabela 1 podsumowuje te studia, uwzględniając modele, zbiory danych oraz raportowane wyniki19,20,21,22,23,24,25,26,27,28,29,30,31.

Protokół

W niniejszym badaniu wykorzystano publicznie dostępne zestawy danych BVC Challenging Voice Set oraz Mozilla Common Voice, bez bezpośredniego udziału uczestników. W związku z tym nie wymagano instytucjonalnej zgody komisji etycznej ani dodatkowej świadomej zgody. Przetwarzano jedynie dane niezbędne do klasyfikacji płci i wieku, nie podejmując prób identyfikacji poszczególnych mówców. Pełna metodologia przepływu pracy proponowanego modelu została przedstawiona na Rysunku 1.

Pozyskiwanie danych

Zbiór danych wykorzystany w proponowanym podejściu składał się z plików audio w formacie .wav pochodzących z BVC Challenging Voice Set, publicznie dostępnego zbioru danych głosowych opracowanego przez grupę Biometrics Vision and Computing (BVC) i hostowanego na GitHub32. Zbiór zawierał nagrania głosowe 526 osób, w tym 336 mężczyzn i 190 kobiet. Obejmował on około 3 964 nagrań, w tym nagrania pojedynczych i wielokrotnych zdań dla każdego mówcy. Tabela 2 podsumowuje charakterystykę demograficzną, zakres językowy, właściwości nagrań, strategię partycjonowania danych oraz ustawienia preprocessingu zastosowane dla zbiorów mowy w proponowanej strukturze VoiceNet-RAI.

Ekstrakcja cech

Pliki audio zostały przetworzone w celu wyodrębnienia kluczowych właściwości, które następnie zapisano w pliku CSV. Metadane, w tym wiek, płeć i sposób wymowy mówcy, wyekstrahowano z odpowiadających im plików README. Do przetwarzania plików WAV i wyodrębniania istotnych cech wykorzystano język Python wraz z pakietem SciPy. Szybką transformatę Fouriera (FFT) oraz funkcje częstotliwości z biblioteki NumPy zastosowano do konwersji sygnałów audio z dziedziny czasu do dziedziny częstotliwości. Pliki WAV przedstawiały amplitudę jako funkcję czasu; jednak dla zadania klasyfikacji większe znaczenie miały charakterystyki związane z częstotliwością, które pozwoliłyby odróżnić głosy męskie od żeńskich33.

W celu przekształcenia sygnałów audio w reprezentacje w dziedzinie częstotliwości zaimplementowano dyskretną transformatę Fouriera (DFT) przy użyciu algorytmu FFT. Transformata Fouriera przekształca sygnał z dziedziny czasu w widmo częstotliwości. Ponieważ widmo to nie zachowywało informacji czasowych, sygnał audio podzielono na nakładające się segmenty, a do każdego z nich zastosowano transformatę Fouriera zgodnie z podejściem krótkoczasowej transformaty Fouriera (STFT). Funkcja np.fft.fft wygenerowała zespolone widmo częstotliwości, natomiast np.fft.fftfreq dostarczyła odpowiadające im częstotliwości próbkowania. W katalogu z próbkami dostępnych było 10 plików audio dla jednego mówcy. Każdy plik WAV przetworzono przy użyciu okien przesuwnych o szerokości 200 ms, aby wyodrębnić częstotliwości dominujące. Przykładowo, 4-sekundowe nagranie audio pozwoliło uzyskać listę 20 wartości częstotliwości. W przypadku katalogu zawierającego 10 nagrań, 10 odpowiadających im list, z których każda zawierała 20 wartości częstotliwości, połączono w listę list. Częstotliwości przefiltrowano tak, aby zachować wartości między 20 Hz a 280 Hz, wykluczając potencjalne szumy w okolicach 50 Hz.

Hybrydowa reprezentacja cech MFCC i wav2vec 2.0

Aby uchwycić zarówno wysokopoziomowe kontekstowe reprezentacje mowy, jak i niskopoziomowe charakterystyki akustyczne, w badaniu zastosowano hybrydową strategię ekstrakcji cech, integrującą cechy MFCC z embeddingami wav2vec 2.0 opartymi na architekturze Transformer.

Ekstrakcja cech MFCC

Współczynniki cepstralne częstotliwości Mel (MFCC) są szeroko stosowanymi cechami w przetwarzaniu mowy i sygnałów audio, szczególnie w takich zastosowaniach jak rozpoznawanie mowy i identyfikacja mówcy34,35. W niniejszym badaniu ekstrakcja MFCC przekształciła sygnały audio w wektory cech reprezentujące istotne pod względem percepcyjnym charakterystyki mowy. Proces rozpoczęto od preemfazy w celu wzmocnienia komponentów wysokoczęstotliwościowych, a następnie zastosowano ramowanie i oknowanie, aby podzielić sygnał na krótkie, nakładające się ramki. Każda próbka audio została najpierw poddana resamplingu do 16 kHz i podzielona na ramki o długości 25 ms z nakładaniem się wynoszącym 10 ms. Następnie do każdej ramki zastosowano szybką transformatę Fouriera, aby przekształcić sygnał z dziedziny czasu do dziedziny częstotliwości.

Otrzymane widmo częstotliwości przepuszczono przez szereg banków filtrów Mel, które przybliżają nieliniową odpowiedź częstotliwościową ludzkiego percepcji słuchowej. Banki filtrów te podkreślały częstotliwości bardziej istotne percepcyjnie, redukując jednocześnie wkład tych mniej informatywnych. Następnie obliczono logarytm wyjścia każdego banku filtrów, aby przybliżyć logarytmiczną czułość ludzkiego słuchu na głośność. Do logarytmicznych energii banków filtrów zastosowano dyskretną transformatę kosinusową (DCT), aby odkorelować współczynniki i uzyskać zwartą reprezentację sygnału audio. Wynikowe współczynniki, znane jako MFCC, uchwyciły istotne charakterystyki widmowe mowy. MFCC zostały wykorzystane do klasyfikacji płci i wieku, ponieważ oddają one cechy akustyczne różnicujące głosy pod względem tych atrybutów.

ekstrakcja osadzeń wav2vec 2.0

Model wav2vec 2.0 Base został wstępnie wytrenowany na wielkoskalowych, nieoznakowanych korpusach mowy. Model składał się z wielowarstwowego kodera Transformer, który przetwarzał wejściowe surowe przebiegi falowe i generował kontekstowe osadzenia mowy36.

Dla wejściowego przebiegu fali x ∈ RT model wav2vec 2.0 wygenerował sekwencję reprezentacji latentnych:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

gdzie każdy wektor zanurzenia miał wymiar 768. Aby uzyskać reprezentację o stałej długości odpowiednią do klasyfikacji, zastosowano operację czasowego uśredniania (temporal mean pooling) we wszystkich krokach czasowych.

figure-protocol-1   (2)

Mechanizm fuzji cech

Cechy MFCC oraz wav2vec 2.0 zostały połączone poprzez konkatenację na poziomie cech. W szczególności cechy MFCC zostały najpierw zagregowane przy użyciu uśredniania czasowego w celu uzyskania wektora o stałej długości.

m ∈ R40  (3)

Końcowy hybrydowy wektor cech uzyskano w następujący sposób:

h = [m || zpooled] ∈ R808  (4)

gdzie || oznacza konkatenację. Fuzja ta połączyła głębokie osadzenia kontekstowe z ręcznie opracowanymi cechami widmowymi, co pozwoliło modelowi uchwycić zarówno wysokopoziomowe informacje semantyczne, jak i precyzyjne wzorce akustyczne.

Wszystkie próbki audio zostały najpierw poddane ponownemu próbkowaniu do częstotliwości 16 kHz. Cechy MFCC obliczono w ramach poszczególnych ramek i uśredniono w czasie, aby uzyskać stały wektor 40-wymiarowy, natomiast osadzenia wav2vec 2.0 poddano uśrednianiu (mean-pooling) w czasie w celu uzyskania reprezentacji 768-wymiarowej. Ponieważ oba zestawy cech zostały przekształcone w wektory o stałej długości przed fuzją, wyrównanie czasowe na poziomie ramek nie było wymagane. Powstałe reprezentacje MFCC i wav2vec zostały następnie złączone w hybrydowy wektor cech o wymiarowości 808 przed przekazaniem do modelu klasyfikacji.

Integracja z EfficientNet-Lite

Złączony wektor cech, h, został przekształcony do formatu odpowiedniego dla uczenia cech i dostarczony jako dane wejściowe do modelu EfficientNet-Lite w celu przeprowadzenia treningu. W pełni połączona warstwa projekcyjna zmapowała najpierw 808-wymiarowy wektor na wyżej wymiarową przestrzeń latentną, po czym bloki EfficientNet-Lite doprecyzowały cechy hierarchiczne. W celu ograniczenia przeuczenia i poprawy generalizacji modelu zastosowano warstwy normalizacji wsadowej (batch normalization) oraz warstwy dropout. Do wygenerowania końcowych przewidywanych prawdopodobieństw dla klas płci i wieku użyto funkcji aktywacji SoftMax. Złączona reprezentacja, h ∈ R808, była początkowo traktowana jako jednowymiarowy wektor cech i przekazana przez w pełni połączoną warstwę projekcyjną, która zmapowała go do 4 096 wymiarów. Następnie rzutowana reprezentacja została przekształcona w tensor o wymiarach 1 × 64 × 64 przed wprowadzeniem do architektury EfficientNet-Lite.

Aby dostosować model do jednokanałowej reprezentacji cech mowy, zamiast konwencjonalnego trójkanałowego wejścia obrazu, zmodyfikowano oryginalną warstwę splotową wejściową EfficientNet-Lite, zmieniając liczbę kanałów wejściowych z trzech na jeden. Pozostałe bloki ekstrakcji cech EfficientNet-Lite zachowano bez istotnych modyfikacji architektonicznych. Do końcowych map cech zastosowano adaptacyjną warstwę globalnego uśredniania (global average pooling), aby uzyskać reprezentację o stałej długości. Oryginalny moduł klasyfikacyjny zastąpiono specyficzną dla zadania warstwą w pełni połączoną, zawierającą dwie jednostki wyjściowe dla klasyfikacji płci oraz odpowiednią liczbę jednostek wyjściowych dla zdefiniowanych grup wiekowych. Na koniec zastosowano funkcję aktywacji SoftMax w celu wygenerowania prawdopodobieństw klas. Zaproponowana reprezentacja hybrydowa połączyła nowoczesne embeddingi mowy z uczeniem samosuperwizowanym z tradycyjnymi cechami przetwarzania sygnałów. Embeddingi wav2vec 2.0 uchwyciły informacje kontekstowe i długodystansowe zależności, podczas gdy cechy MFCC dostarczyły uzupełniających, niskopoziomowych informacji akustycznych. Integracja tych reprezentacji poprawiła wydajność klasyfikacji, szczególnie w warunkach mowy zaszumionej i wielojęzycznej.

Klasyfikator ML

W niniejszym badaniu przeanalizowano wydajność wielu algorytmów ML w zakresie klasyfikacji płci oraz grup wiekowych na podstawie głosu.

Las Losowy

Do stworzenia odpornego klasyfikatora uczenia maszynowego (ML) wykorzystano Random Forest (RF), który łączy wiele drzew decyzyjnych (DT), aby zwiększyć dokładność prognoz i ograniczyć przeuczenie. RF działa w oparciu o procedurę uczenia zespołowego, w której wyniki z wielu drzew są agregowane w celu wygenerowania końcowej predykcji37,38. Podejście to pozwala RF na wychwytywanie różnorodnych wzorców w danych przy jednoczesnym ograniczeniu przeuczenia, które jest częste w przypadku pojedynczych drzew decyzyjnych. Losowość wprowadzona podczas budowy drzew poprawiła zdolność modelu do generalizacji, co sprawia, że RF jest odpowiedni do zadań klasyfikacyjnych, takich jak określanie płci i wieku na podstawie danych głosowych.

Regresja logistyczna

Do klasyfikacji wykorzystano regresję logistyczną (LR) jako statystyczny model uczenia maszynowego (ML)39. W przypadku klasyfikacji binarnej LR szacuje prawdopodobieństwo wystąpienia wyniku na podstawie cech wejściowych przy użyciu funkcji logistycznej (sigmoidalnej), a otrzymane prawdopodobieństwa służą do generowania przewidywań klas. LR była stosowana również w problemach klasyfikacji wieloklasowej obejmującej więcej niż dwie klasy. W klasyfikacji wieloklasowej LR wykorzystywała podejścia takie jak one-vs-rest lub regresję SoftMax, w zależności od ustawień klasyfikacji.

Klasyfikator Extra Trees

Klasyfikator Extra Trees (ETC) został zastosowany jako algorytm uczenia zespołowego, który łączy wiele drzew decyzyjnych (DT) w celu generowania prognoz40,41. W przeciwieństwie do RF, ETC wprowadza dodatkową losowość poprzez przypadkowy wybór cech kandydackich oraz progów podziału podczas budowy drzew. Procedura ta pozwoliła na wygenerowanie mniej skorelowanych drzew i zmniejszyła wrażliwość modelu na pojedyncze cechy, co poprawiło odporność na szum. Jako kryterium podziału do oceny istotności cech i partycjonowania danych wykorzystano indeks Giniego.

Maszyna wektorów wspierających

Maszyna wektorów wspierających (SVM) została wykorzystana jako klasyfikator ML do wyznaczenia optymalnej granicy decyzyjnej w wielowymiarowej przestrzeni cech42. Celem było określenie hiperpłaszczyzny, która maksymalizowała margines między klasami. Większy margines między granicą decyzyjną a najbliższymi punktami danych zazwyczaj sprzyjał lepszej separacji klas i generalizacji. SVM znajdował zastosowanie w wielu zadaniach ML, w tym w klasyfikacji, regresji oraz analizie danych opartej na cechach.

Splotowe sieci neuronowe

Splotowe sieci neuronowe (CNN) były wykorzystywane jako modele głębokiego uczenia (DL) w zadaniach klasyfikacji obejmujących ustrukturyzowane reprezentacje danych obrazowych i dźwiękowych. Jednowymiarowe sieci CNN (1D-CNN) były również szeroko stosowane w analizie danych sekwencyjnych i tekstowych. Architektury CNN wykorzystywały filtry splotowe oraz operacje próbkowania (pooling), aby wyekstrahować dyskryminacyjne cechy z danych wejściowych43,44. W celu klasyfikacji płci i wieku na podstawie danych głosowych, sieci CNN stosowano do reprezentacji pochodnych mowy, aby nauczyć się wzorców związanych z wysokością dźwięku, częstotliwością, tonem i innymi charakterystykami wokalnymi istotnymi dla rozróżniania grup wiekowych i płci.

VGG19

VGG19 został wykorzystany jako architektura DL charakteryzująca się głęboką, stosunkowo jednorodną hierarchiczną strukturą ekstrakcji cech45. Jego architektura wykorzystuje małe filtry splotowe 3 × 3 w 19 warstwach, co umożliwia progresywną ekstrakcję cech dyskryminacyjnych. W zastosowaniu do reprezentacji pochodnych z mowy, VGG19 przechwytywał zarówno niskopoziomowe wzorce akustyczne, takie jak wariacje wysokości i częstotliwości, jak i wyższego poziomu cechy dyskryminacyjne. Jego głęboka architektura umożliwiła progresywną abstrakcję cech do modelowania charakterystyk głosowych związanych z płcią i wiekiem.

EfficientNet-Lite

Jako wydajna obliczeniowo architektura DL zastosowano EfficientNet-Lite46,47. Model wykorzystał strategię zrównoważonego skalowania, aby osiągnąć wysoką skuteczność klasyfikacji przy jednoczesnym zapotrzebowaniu na mniejsze zasoby obliczeniowe niż w przypadku cięższych architektur DL. Zastosowane podejście do skalowania złożonego łączyło głębokość modelu, jego szerokość oraz rozdzielczość wejściową w celu zapewnienia efektywnej ekstrakcji cech.

Do proponowanego frameworku VoiceNet-RAI wybrano model EfficientNet-Lite ze względu na jego lekką architekturę oraz korzystny balans między wydajnością klasyfikacji a złożonością modelu. W porównaniu z cięższymi architekturami, wykorzystuje on wydajne bloki splotowe oraz skalowanie złożone (compound scaling), aby osiągnąć skuteczną naukę cech przy mniejszej liczbie parametrów i niższych wymaganiach obliczeniowych. Cechy te sprawiły, że EfficientNet-Lite jest odpowiedni dla proponowanego frameworku klasyfikacji mowy i stwarza potencjał do wdrożenia w środowiskach o ograniczonych zasobach.

MobileNet

MobileNet został wykorzystany jako lekka architektura DL dla aplikacji o ograniczonych zasobach obliczeniowych, w tym dla środowisk obliczeń mobilnych i krawędziowych48. Jego wydajność obliczeniowa została osiągnięta przede wszystkim dzięki splotom głębokim rozdzielnym (depthwise separable convolutions), które zredukowały liczbę parametrów i operacji obliczeniowych w porównaniu z konwencjonalnymi architekturami splotowymi. Cechy te sprawiły, że MobileNet był odpowiedni do oceny klasyfikacji płci i wieku na podstawie danych głosowych, przy zachowaniu stosunkowo niskich wymagań obliczeniowych.

InceptionV3

Do ekstrakcji hierarchicznych cech z reprezentacji pochodzących z mowy wykorzystano InceptionV3 jako architekturę głęboką49. Architektura ta zawierała operacje splotowe, poolingowe oraz mieszane, aby ekstrahować cechy na różnych poziomach abstrakcji. W celu klasyfikacji płci i wieku na podstawie danych głosowych, InceptionV3 posłużył do nauki złożonych wzorców akustycznych i reprezentacji hierarchicznych związanych ze zmianami w charakterystyce głosowej.

Parametry oceny

Dokładność (accuracy) była jedną z najczęściej stosowanych metryk oceny w zadaniach klasyfikacji50. Chociaż dokładność stanowiła przydatną miarę ogólnej skuteczności klasyfikacji, nie zawsze zapewniała ona kompleksową ocenę, szczególnie w przypadku niezbalansowanych zbiorów danych. Dlatego do oceny wydajności modelu wykorzystano dodatkowe metryki, w tym precyzję (precision), pełność (recall) oraz miarę F1 (F1-score). Metryki te umożliwiły bardziej szczegółową ocenę poprzez uwzględnienie poprawnych i błędnych predykcji dla każdej klasy.

Dokładność zdefiniowano jako stosunek liczby poprawnie sklasyfikowanych obserwacji do całkowitej liczby obserwacji. Chociaż dokładność była szczególnie informacyjna dla zrównoważonych zbiorów danych, zbiór danych wykorzystany w niniejszym badaniu był niezrównoważony. W związku z tym przy obliczaniu i interpretacji metryk klasyfikacji uwzględniono wyniki prawdziwie dodatnie (TP), fałszywie dodatnie (FP), prawdziwie ujemne (TN) oraz fałszywie ujemne (FN). Poniższe równanie przedstawia standardową definicję dokładności:

Dokładność =  (TP+TN)/(TP+TN+FP+FN)×100  (5)

Precyzja ocenia zdolność klasyfikatora do zwracania wyłącznie istotnych instancji:

Precyzja=  TP/(TP+FP)  ×100   (6)

Czułość (ang. recall), znana również jako sensitivity, mierzy zdolność klasyfikatora do zidentyfikowania wszystkich istotnych instancji:

Czułość=  TP/(FN+TP) × 100   (7)

Wskaźnik F1-score łączy precyzję i pełność w jednej mierze i jest szczególnie użyteczny przy ocenie wydajności klasyfikacji na niezbalansowanych zbiorach danych:

F1-Score =2 ×(PPV ×TPR)/(TPR+PPV) × 100   (8)

Wyniki

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Dyskusja

W niniejszej pracy opracowano i oceniono zautomatyzowany system klasyfikacji płci i wieku na podstawie danych głosowych poprzez integrację cech MFCC oraz osadzeń wav2vec 2.0 z modelem EfficientNet-Lite. W wstępnych eksperymentach, przy użyciu pierwotnych cech, model EfficientNet-Lite osiągnął dokładność na poziomie 83,48%, precyzję 82,87%, czułość 84,28% oraz wartość F1-score wynoszącą 83,54%. Po integracji cech MFCC odnotowano znaczną poprawę wydajności, osiągając dokładność 92,64%, precyzję 93,79%, czułość 94,92% oraz F1-score 94,84% na zbiorze danych obejmującym 28 języków. Wykorzystując hybrydową reprezentację MFCC–wav2vec 2.0 na podzbiorze języka angielskiego, model EfficientNet-Lite uzyskał dokładność 97,87%, precyzję 98,61%, czułość 98,70% oraz F1-score 98,65%. Generalizowalność systemu oceniono dodatkowo z wykorzystaniem zbioru danych Mozilla Common Voice, w którym proponowany model również wykazał wysoką wydajność. Ponadto stabilność modelu została zweryfikowana za pomocą pięciokrotnej walidacji krzyżowej.

Poprawa zaobserwowana po zintegrowaniu cech MFCC wskazała, że niskopoziomowe charakterystyki widmowe, w tym wysokość dźwięku, barwa oraz informacje o kanale głosowym, pozostawały wysoce dyskryminacyjne dla klasyfikacji płci i wieku. Dodatkowy wzrost wydajności osiągnięty dzięki hybrydowej reprezentacji MFCC–wav2vec 2.0 zasugerował, że kontekstowe osadzenia oparte na modelu Transformer dostarczyły uzupełniających informacji, których nie udało się w pełni uchwycić za pomocą samych ręcznie opracowanych cech akustycznych. Ta komplementarność może wyjaśniać lepszą wydajność proponowanej reprezentacji hybrydowej w porównaniu z konfiguracjami oryginalną oraz opartą wyłącznie na MFCC. Silniejsza wydajność zaobserwowana w podzbiorze języka angielskiego zasugerowała również, że zmienność lingwistyczna mogła przyczyniać się do trudności w klasyfikacji. W przypadku połączenia wielu języków różnice w wymowie, akcencie, strukturze fonetycznej i rozkładzie próbek mogły wprowadzić dodatkową zmienność, podczas gdy ustawienie jednojęzyczne zapewniło bardziej jednorodną przestrzeń cech. Walidacja z wykorzystaniem zbioru danych Mozilla Common Voice dodatkowo zasugerowała, że proponowana reprezentacja generalizuje poza główny zbiór danych, choć różnice w warunkach nagrywania i rozkładach demograficznych mogły nadal wpływać na wydajność.

Ogólnie rzecz biorąc, wyniki wskazały, że wydajność VoiceNet-RAI była napędzana przez komplementarny wkład reprezentacji mowy spektralnych i kontekstowych, a nie przez pojedynczy typ cech. Jednak pozostałe różnice w wydajności pomiędzy poszczególnymi językami i grupami wiekowymi podkreśliły potrzebę szerszej ewaluacji podgrup, testów odporności na szumy oraz dodatkowych porównań z niedawnymi samonadzorowanymi modelami mowy.

Alternatywne podejścia do klasyfikacji płci i wieku na podstawie mowy obejmują ręcznie opracowane cechy akustyczne z konwencjonalnymi klasyfikatorami ML, uczenie oparte na sieciach CNN z reprezentacji mowy, metody zespołowe oraz modele samonadzorowane, takie jak HuBERT, WavLM i data2vec. W przeciwieństwie do nich VoiceNet-RAI łączy informacje widmowe oparte na MFCC z kontekstowymi osadzeniami wav2vec 2.0, aby wykorzystać komplementarne zalety ręcznie opracowanych i wyuczonych reprezentacji mowy.

Niniejsze badanie miało kilka ograniczeń. Po pierwsze, główny zbiór danych charakteryzował się niezrównoważonym rozkładem w grupach płci, języków i wieku, co mogło wpłynąć na wyniki w poszczególnych podgrupach i ograniczyć możliwość generalizacji wyników na populacje niedostatecznie reprezentowane. Po drugie, różnice w urządzeniach nagrywających, akcentach, wymowie oraz warunkach akustycznych mogły wpłynąć na niezawodność klasyfikacji. Po trzecie, choć walidacja z wykorzystaniem zbioru danych Mozilla Common Voice potwierdziła możliwość generalizacji poza główny zbiór danych, konieczna pozostała szersza ocena z użyciem dodatkowych rzeczywistych zbiorów danych. Wreszcie, wdrożenie klasyfikacji demograficznej opartej na głosie budzi obawy dotyczące prywatności, sprawiedliwości i kwestii etycznych, szczególnie w zastosowaniach niekontrolowanych lub o dużym znaczeniu. Dlatego też w celu odpowiedzialnej implementacji niezbędne byłoby ciągłe monitorowanie wydajności, nadzór ludzki oraz praktyki wdrażania z uwzględnieniem ochrony prywatności. Przedstawione ramy wykazały potencjał do zastosowań w interakcji człowiek–komputer, uwierzytelnianiu głosowym, analityce mowy oraz informatyce śledczej. W przyszłych pracach VoiceNet-RAI zostanie porównany z najnowszymi samo-nadzorowanymi modelami mowy, w tym HuBERT, WavLM i data2vec, a także zbadana zostanie specyficzna dla zadania mechanika uwagi w odniesieniu do połączonej reprezentacji MFCC–wav2vec 2.0. W przeciwieństwie do wewnętrznego mechanizmu self-attention w wav2vec 2.0, proponowany przyszły mechanizm w sposób jawny nadawałby wagi czasowym i cechowym informacjom istotnym dla zadania klasyfikacji płci i wieku.

Oświadczenia

Autorzy nie zgłaszają żadnych konfliktów interesów.

Podziękowania

Autorzy chciałyby podziękować Projektowi Wspierania Badaczy Uniwersytetu Księżniczki Nourah bint Abdulrahman numer (PNURSP2026R748), Uniwersytetowi Księżniczki Nourah bint Abdulrahman w Rijadzie, Arabia Saudyjska, za sfinansowanie tych badań.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Zestaw głosów wymagających BVCGrupa Biometrii, Wizji i Informatyki / OgeNIZestaw głosów utrudniających BVChttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, zastosowany dokładny warianthttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
procesor graficznyNVIDIATesla K80https://www.nvidia.com/
Zbiór danych Mozilla Common VoiceMozilla FoundationCommon Voice, wersja wykorzystana w eksperymentachhttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyProgramiści NumPyDokładna wersja wykorzystana w eksperymentachhttps://numpy.org/
ProcesorIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonPython Software FoundationDokładna wersja wykorzystana w eksperymentachhttps://www.python.org/
PyTorchPyTorch FoundationDokładna wersja użyta w eksperymentachhttps://pytorch.org/
Scikit-learnDeweloperzy Scikit-learnDokładna wersja użyta w eksperymentachhttps://scikit-learn.org/
SciPyProgramiści SciPyDokładna wersja zastosowana w eksperymentachhttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 11MicrosoftWindows 11, dokładna edycja/kompilacja, jeśli dostępnahttps://www.microsoft.com/windows/windows-11

Bibliografia

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Przedruki i uprawnienia

Tagi

Wieloj zyczna klasyfikacja mowyklasyfikacja p ciodpowiedzialna sztuczna inteligencjaframework VoiceNetWav2vec 2 0cechy MFCCg bokie uczenie w przetwarzaniu mowyEfficientNet Litedemografia mowy