Исследовательская статья

VoiceNet: ответственная многоязычная платформа искусственного интеллекта для анализа речи с целью классификации пола и возраста

49 просмотров

11 сентября 2026 г.

В этой статье

Краткое содержание

VoiceNet-RAI объединяет признаки MFCC, многоязычные эмбеддинги wav2vec 2.0 и сеть EfficientNet-Lite для классификации пола и возраста по голосовым данным. Система достигает точности до 97,87% на англоязычном подмножестве данных и поддерживает ответственное применение в области распознавания речи, аутентификации и цифровой криминалистики.

Аннотация

Точная классификация пола и возраста по голосовым данным имеет важное значение для персонализированного, безопасного и этичного человеко-машинного взаимодействия (HCI). С растущим использованием больших предобученных моделей речи, таких как wav2vec 2.0, возникает необходимость ответственного использования этих представлений для многоязычного и учитывающего конфиденциальность вывода демографических данных. В данной работе предлагается VoiceNet-RAI — платформа глубокого обучения (DL), которая интегрирует мел-кепстральные коэффициенты (MFCC) с многоязычными эмбеддингами wav2vec 2.0 на базе трансформера в архитектуре EfficientNet-Lite для обеспечения точной, справедливой и прозрачной классификации в различных лингвистических контекстах. Платформа объединяет контекстную и спектральную информацию для повышения устойчивости к различным условиям записи. Эксперименты на многоязычных речевых данных, охватывающих 28 языков, демонстрируют высокую эффективность классификации: для английского подмножества достигнута точность (accuracy) 97,87%, прецизионность (precision) 98,61%, полнота (recall) 98,70% и F1-мера 98,65%. Внешняя валидация с использованием набора данных Mozilla Common Voice показала точность 98,27% при классификации пола, что подтверждает обобщающую способность модели на независимом наборе данных. Абляционный анализ дополнительно показал, что сочетание признаков MFCC и wav2vec 2.0 улучшает производительность по сравнению с использованием только необработанных данных или только MFCC. Эти результаты демонстрируют потенциал гибридных спектрально-контекстных представлений речи для надежной и ответственной классификации пола и возраста.

Введение

Распознавание голоса является основным компонентом человеческого общения, посредством которого люди выражают свои чувства, мысли и цели. Человеческий голос формируется в результате биологического процесса, при котором воздух выдыхается из легких и превращается в звук органами артикуляции, такими как губы, язык и зубы1. Ухо играет важнейшую роль в идентификации голоса и может различать мужские и женские голоса на основе таких характеристик, как громкость и высота тона. Одной из характеристик, способствующих существенным различиям в высоте голоса между мужчинами и женщинами, является половой диморфизм2. Классификация возраста и пола по голосу актуальна для множества приложений, включая взаимодействие человека и машины, автоматическое распознавание пола, персонализированные приветствия, предварительную классификацию эмоций в речи и классификацию вызовов на основе пола3.

Речь является неотъемлемой частью человеческого взаимодействия. Человеческий голос обладает множеством характеристик, которые варьируются у разных людей и могут предоставлять информацию об эмоциональном и психическом состоянии, а также о возрасте и поле. Эти многомерные характеристики могут быть использованы в таких приложениях, как системы безопасности на основе голосового управления и ориентированные на речь помощники с искусственным интеллектом (ИИ). Другие области, в которых важен анализ голоса, включают системы автоматической верификации говорящего (ASV) и системы ИИ для распознавания эмоций. Системы голосового ввода также могут сократить пространство поиска в базах данных4,5. Кроме того, системы безопасности на базе ИИ могут использовать голосовые данные для таких целей, как уголовные расследования и защита потерпевших. Мужские и женские голоса обладают различными характеристиками из-за различий в резонансных свойствах голосового тракта. Эти характеристики могут быть извлечены из речевых сигналов в форме, подходящей для компьютерной обработки, что позволяет осуществлять классификацию пола по голосовым данным6,7. Следовательно, для классификации пола по голосу требуются эффективные алгоритмы обучения. Алгоритмы глубокого обучения (DL) особенно хорошо подходят для классификации речевых данных благодаря их способности выявлять сложные закономерности в аудиоданных. Такие модели могут содержать сверточные, рекуррентные, временно-сверточные или полносвязные слои, в зависимости от архитектуры. Эти слои могут изучать соответствующие акустические характеристики, включая тон и высоту звука. После обучения модель может определять пол по ранее не использованным аудиозаписям8. Еще одной важной областью исследований в машинном обучении (ML) является классификация возраста по голосовым записям. Алгоритмы ML могут использовать такие акустические характеристики, как высота, тембр и амплитуда, для выявления возрастных закономерностей. Такие методы, как анализ главных компонентов (PCA), также могут быть применены для извлечения информативных паттернов из речевых данных и потенциального повышения точности классификации9.

Глубокое обучение (DL) продемонстрировало высокую эффективность в таких приложениях, как распознавание изображений, эмоций и речи. В частности, глубокие нейронные сети (DNN) широко используются для задач, связанных с речью. В данном исследовании подходы на основе DL применяются для классификации голоса в сочетании с общепринятыми методами извлечения признаков. Мел-кепстральные коэффициенты (MFCC) фиксируют соответствующие спектральные характеристики речевых сигналов и обеспечивают эффективное представление для последующей обработки. Извлеченные признаки затем интегрируются в структуру переносимого обучения (transfer learning) для классификации пола и возраста на основе голоса10,11.

В последних исследованиях для классификации атрибутов говорящего все чаще применяются представления речи на основе самообучения (self-supervised) и архитектуры Transformer. Исследователи изучали демографические искажения, включая предвзятость по гендерному и возрастному признакам, в моделях самообучения речи, таких как HuBERT и wav2vec 2.0, подчеркивая важность оценки с учетом принципов справедливости12. Недавно языконезависимые подходы на базе Transformer продемонстрировали эффективность выученных контекстных представлений речи для распознавания пола в многоязычных условиях и в условиях зашумленности13. Sinha и соавторы дополнительно исследовали послойные представления wav2vec 2.0 для классификации возраста и пола, показав, что различные слои Transformer фиксируют разный уровень информации о говорящем14. Эти достижения послужили основанием для разработки предлагаемой структуры VoiceNet-RAI, которая объединяет традиционную спектральную информацию на основе MFCC с контекстными представлениями wav2vec 2.0, учитывая при этом многоязычность и принципы ответственного искусственного интеллекта (Responsible AI).

Недавние исследования показали, что возраст и пол говорящего могут быть охарактеризованы с помощью как традиционных акустических признаков, так и представлений на основе глубокого обучения. Подходы, сочетающие акустическую и временную информацию, продемонстрировали, что взаимодополняющие характеристики речи могут повысить точность классификации по возрасту и полу15,16. Соответствующие исследования также показали, что преобразованные признаки речи, созданные с использованием глубоких узкобутылочных представлений (deep bottleneck representations), могут улучшить эффективность классификации возраста и пола говорящего17. Эти результаты обосновывают более широкое применение спектральных, временных и выученных представлений для задач классификации, связанных с речью и сигналами, производными от речи.

В нескольких исследованиях изучались вопросы распознавания возраста и пола по речи с использованием методов машинного и глубокого обучения18,19,20,21,22,23,24,25,26,27,28,29,30. В более современных подходах исследовались преобразованные представления MFCC и глубокие нейронные сети для классификации возраста и пола говорящего31, при этом многоязычная и языковая вариативность остаются важными аспектами при разработке надежных систем демографической классификации на основе голоса. Различия в произношении, фонетической структуре, характеристиках говорящего и условиях записи могут снизить обобщающую способность модели для разных языков и популяций. Соответственно, использование взаимодополняющих спектральных и контекстуальных представлений речи может повысить устойчивость системы в многоязычной среде.

Хотя в гибридных подходах ранее комбинировались многочисленные акустические признаки или ансамблевые классификаторы для демографического распознавания по голосу, VoiceNet-RAI отличается интеграцией двух дополняющих друг друга уровней представления речи в рамках единой структуры. В частности, традиционные признаки MFCC сохраняют локализованные спектральные и вокальные характеристики, в то время как wav2vec 2.0 предоставляет контекстуализированные представления, полученные из необработанной речи с помощью энкодера Transformer. Вместо того чтобы полагаться исключительно на созданные вручную акустические дескрипторы или единое глубокое представление, VoiceNet-RAI выполняет слияние на уровне признаков временно агрегированных представлений MFCC и wav2vec 2.0, после чего уточняет полученное гибридное представление с помощью EfficientNet-Lite. Таким образом, научная новизна заключается в скоординированной интеграции спектральных, самообучающихся контекстуальных и легковесных глубоких представлений для классификации пола и возраста, наряду с многоязычной оценкой, валидацией на независимом наборе данных и анализом справедливости для подгрупп. Эта комбинация расширяет возможности традиционных гибридных конвейеров классификации речи, переходя от слияния признаков, ориентированного только на точность, к структуре, которая одновременно учитывает взаимодополняемость представлений, легковесный дизайн модели, обобщающую способность и принципы Responsible AI.

Основные результаты данного исследования включают разработку подхода для определения пола и возраста по голосовым данным путем интеграции признаков MFCC и wav2vec 2.0 с архитектурой EfficientNet-Lite. Проведены обширные эксперименты на наборе данных голосовых записей на 28 языках, в которых оценивались оригинальные признаки, признаки MFCC, признаки wav2vec 2.0 и их комбинации с использованием моделей машинного обучения (ML) и глубокого обучения (DL). Эффективность моделей оценивалась как на полном многоязычном наборе данных, так и на подмножестве английского языка. Структура системы дополнительно анализировалась с точки зрения многоязычности и ответственного ИИ (Responsible AI) посредством анализа подгрупп по полу и языку, оценки независимо от говорящего и валидации с использованием набора данных Mozilla Common Voice. Кроме того, эффективность предлагаемой системы сравнивается с передовыми подходами, описанными в существующей литературе, и приводятся результаты кросс-валидации. Был проведен анализ значительного объема связанных исследований, и в Таблице 1 обобщены эти работы, включая используемые модели, наборы данных и зарегистрированные результаты19,20,21,22,23,24,25,26,27,28,29,30,31.

Протокол

В данном исследовании использовались общедоступные наборы данных BVC Challenging Voice Set и Mozilla Common Voice без прямого участия испытуемых. Таким образом, одобрение институционального комитета по этике и дополнительное информированное согласие не требовались. Обработке подвергались только данные, необходимые для классификации пола и возраста; попыток идентифицировать отдельных говорящих не предпринималось. Полная методология рабочего процесса предлагаемой структуры представлена на Рисунке 1.

Сбор данных

Набор данных, использованный в предлагаемом подходе, состоял из аудиофайлов формата .wav, полученных из BVC Challenging Voice Set — общедоступного набора голосовых данных, разработанного группой Biometrics Vision and Computing (BVC) и размещенного на GitHub32. Набор данных содержал голосовые записи 526 человек, включая 336 мужчин и 190 женщин. Он включал примерно 3 964 записи, в том числе как однопредложные, так и многопредложные записи каждого говорящего. В Таблице 2 обобщены демографические характеристики, языковой охват, свойства записей, стратегия разделения данных и настройки предобработки, использованные для наборов речевых данных в предлагаемой архитектуре VoiceNet-RAI.

Извлечение признаков

Аудиофайлы были обработаны для извлечения основных свойств, которые впоследствии были сохранены в файл CSV. Метаданные, включая возраст, пол и произношение говорящего, были извлечены из соответствующих файлов README. Для обработки WAV-файлов и извлечения соответствующих признаков использовался язык Python с пакетом SciPy. Функции быстрого преобразования Фурье (FFT) и частотные функции NumPy применялись для преобразования аудиосигналов из временной области в частотную. В WAV-файлах амплитуда была представлена как функция времени, однако для задачи классификации наибольший интерес представляли частотные характеристики, позволяющие различать мужские и женские голоса33.

Для преобразования аудиосигналов в представления в частотной области с помощью алгоритма БПФ был реализован дискретный преобразователь Фурье (ДПФ). Преобразование Фурье переводит сигнал из временной области в частотный спектр. Поскольку этот спектр не сохраняет временную информацию, аудиосигнал был разделен на перекрывающиеся сегменты, и к каждому сегменту было применено преобразование Фурье с использованием метода коротковременного преобразования Фурье (STFT). Функция np.fft.fft генерировала комплексный частотный спектр, а np.fft.fftfreq предоставляла соответствующие частоты дискретизации. В каталоге образцов было доступно 10 аудиофайлов одного говорящего. Каждый WAV-файл обрабатывался с использованием скользящего окна длительностью 200 ms для извлечения доминирующих частот. Например, 4-секундная аудиозапись давала список из 20 значений частоты. Для каталога, содержащего 10 записей, 10 соответствующих списков, каждый из которых содержал 20 значений частоты, были объединены в список списков. Частоты фильтровались для сохранения значений в диапазоне от 20 Hz до 280 Hz, при этом потенциальный шум в районе 50 Hz исключался.

Гибридное представление признаков MFCC и wav2vec 2.0

Для захвата как высокоуровневых контекстных представлений речи, так и низкоуровневых акустических характеристик в данном исследовании была применена гибридная стратегия извлечения признаков, объединяющая коэффициенты MFCC с эмбеддингами wav2vec 2.0 на базе Transformer.

Извлечение признаков MFCC

Мел-кепстральные коэффициенты (MFCC) являются широко используемыми признаками в обработке речи и аудиосигналов, в частности, для таких приложений, как распознавание речи и идентификация говорящего34,35. В данном исследовании извлечение MFCC позволило преобразовать аудиосигналы в векторы признаков, представляющие перцептивно значимые характеристики речи. Процесс начинался с преакцентирования (pre-emphasis) для усиления высокочастотных компонентов, за которым следовали фрейминг и оконное преобразование для разделения сигнала на короткие перекрывающиеся кадры. Каждый аудиообразец сначала был передискретизирован до 16 kHz и сегментирован на кадры длительностью 25 ms с перекрытием 10 ms. Затем к каждому кадру применялось быстрое преобразование Фурье для перевода сигнала из временной области в частотную.

Полученный частотный спектр пропускали через серию банков Mel-фильтров, которые аппроксимировали нелинейную частотную характеристику слухового восприятия человека. Эти банки фильтров усиливали более значимые с точки зрения восприятия частоты, снижая при этом вклад менее информативных. Затем вычислялся логарифм выхода каждого банка фильтров для аппроксимации логарифмической чувствительности человеческого слуха к громкости. После этого к логарифмам энергий банков фильтров применялось дискретное косинусное преобразование (DCT) для декорреляции коэффициентов и создания компактного представления аудиосигнала. Полученные коэффициенты, известные как MFCC, отражали важные спектральные характеристики речи. MFCC использовались для классификации по полу и возрасту, так как они фиксировали акустические особенности, позволяющие дифференцировать голоса по этим признакам.

извлечение эмбеддингов wav2vec 2.0

Базовая модель wav2vec 2.0 была предварительно обучена на крупномасштабных неразмеченных корпусах речи. Модель состояла из многослойного кодировщика Transformer, который обрабатывал необработанные формы волны на входе и генерировал контекстуализированные речевые эмбеддинги36.

Для заданной входной формы волны x ∈ RT модель wav2vec 2.0 генерирует последовательность латентных представлений:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

где каждый вектор вложения имел размерность 768. Для получения представления фиксированной длины, подходящего для классификации, была применена операция темпорального усредняющего пулинга по всем временным шагам.

figure-protocol-1   (2)

Механизм слияния признаков

Признаки MFCC и wav2vec 2.0 были объединены путем конкатенации на уровне признаков. В частности, признаки MFCC сначала были агрегированы с помощью временного усреднения для получения вектора фиксированной длины.

m ∈ R40  (3)

Итоговый гибридный вектор признаков был получен следующим образом:

h = [m || zpooled] ∈ R808  (4)

где || обозначает конкатенацию. Это слияние объединило глубокие контекстуальные эмбеддинги с вручную подобранными спектральными признаками, что позволило модели фиксировать как семантическую информацию высокого уровня, так и детальные акустические паттерны.

Все аудиообразцы были предварительно передискретизированы до 16 kHz. Признаки MFCC вычислялись по кадрам и усреднялись во времени для получения фиксированного 40-мерного вектора, в то время как эмбеддинги wav2vec 2.0 подвергались среднему пулингу по времени для получения 768-мерного представления. Поскольку оба набора признаков были преобразованы в векторы фиксированной длины перед слиянием, временное выравнивание на уровне кадров не потребовалось. Полученные представления MFCC и wav2vec затем объединялись в гибридный вектор признаков размерностью 808 перед передачей в модель классификации.

Интеграция с EfficientNet-Lite

Объединенный вектор признаков, h, был преобразован в формат, подходящий для обучения признаков, и использован в качестве входных данных для модели EfficientNet-Lite в процессе обучения. Сначала полносвязный проекционный слой отобразил 808-мерный вектор в более высокоразмерное латентное пространство, после чего блоки EfficientNet-Lite уточнили иерархические признаки. Для уменьшения переобучения и улучшения обобщающей способности модели были применены слои пакетной нормализации (batch normalization) и исключения (dropout). Функция активации SoftMax использовалась для получения конечных предсказанных вероятностей для классов пола и возраста. Объединенное представление, h ∈ R808, изначально рассматривалось как одномерный вектор признаков и пропускалось через полносвязный проекционный слой, который отображал его в 4 096 измерений. Затем спроецированное представление было преобразовано в тензор размером 1 × 64 × 64 перед подачей в архитектуру EfficientNet-Lite.

Для обеспечения работы с одноканальным представлением признаков речи, вместо традиционного трехканального входного изображения, исходный входной сверточный слой EfficientNet-Lite был изменен с трех на один входной канал. Остальные блоки извлечения признаков EfficientNet-Lite были сохранены без значительных архитектурных изменений. Для получения представления фиксированной длины к финальным картам признаков был применен слой адаптивного глобального усредняющего пулинга. Оригинальный классификационный блок был заменен на специализированный полносвязный слой, содержащий два выходных модуля для классификации пола и соответствующее количество выходных модулей для предопределенных возрастных групп. Наконец, для генерации вероятностей классов была применена функция активации SoftMax. Предложенное гибридное представление объединило современные самообучающиеся эмбеддинги речи с традиционными признаками обработки сигналов. Эмбеддинги wav2vec 2.0 зафиксировали контекстную информацию и долгосрочные зависимости, в то время как признаки MFCC предоставили дополнительную низкоуровневую акустическую информацию. Интеграция этих представлений позволила повысить точность классификации, особенно в условиях шумной и многоязычной речи.

ML-классификатор

В данном исследовании была проанализирована эффективность нескольких алгоритмов машинного обучения (ML) для классификации пола и возрастной группы по голосу.

Случайный лес

Случайный лес (Random Forest, RF) использовался в качестве надежного классификатора машинного обучения (ML), объединяющего несколько деревьев решений (Decision Trees, DTs) для повышения точности прогнозирования и снижения переобучения. RF работал по принципу ансамблевого обучения, при котором прогнозы от множества деревьев агрегировались для формирования окончательного результата37,38. Такой подход позволил RF выявлять разнообразные закономерности в данных, минимизируя переобучение, характерное для отдельных деревьев решений. Рандомизация, вводимая при построении деревьев, улучшила обобщающую способность модели, что сделало RF подходящим для таких задач классификации, как определение пола и возраста по голосовым данным.

Логистическая регрессия

Логистическая регрессия (LR) использовалась в качестве статистической модели машинного обучения (ML) для классификации39. При бинарной классификации LR оценивает вероятность исхода на основе входных признаков с помощью логистической (сигмовидной) функции, и полученные вероятности используются для формирования прогнозов по классам. LR также была применима к задачам многоклассовой классификации, включающим более двух классов. Для многоклассовой классификации LR использовала такие подходы, как «один против всех» (one-vs-rest) или регрессия SoftMax, в зависимости от условий классификации.

Классификатор «экстра-деревьев» (Extra Tree Classifier)

Классификатор экстремальных деревьев (Extra Trees Classifier, ETC) использовался в качестве алгоритма ансамблевого обучения, объединяющего несколько деревьев решений (DT) для создания прогнозов40,41. В отличие от случайного леса (RF), ETC вносит дополнительную случайность, выбирая подходящие признаки и пороги разделения случайным образом в процессе построения деревьев. Эта процедура позволила создать менее коррелированные деревья и снизить чувствительность модели к отдельным признакам, тем самым повысив устойчивость к шуму. В качестве критерия разделения для оценки значимости признаков и разбиения данных использовался индекс Джини.

Метод опорных векторов

Метод опорных векторов (SVM) использовался в качестве классификатора машинного обучения (ML) для определения оптимальной решающей границы в многомерном пространстве признаков42. Целью было определение гиперплоскости, которая максимизирует зазор между классами. Более широкий зазор между решающей границей и ближайшими точками данных, как правило, способствует лучшему разделению классов и обобщающей способности модели. SVM применим для решения ряда задач машинного обучения, включая классификацию, регрессию и анализ данных на основе признаков.

Сверточные нейронные сети

Сверточные нейронные сети (CNN) использовались в качестве моделей глубокого обучения (DL) для задач классификации структурированных представлений данных изображений и аудио. Одномерные сверточные сети (1D-CNN) также широко применялись для работы с последовательными и текстовыми данными. Архитектуры CNN использовали сверточные фильтры и операции пулинга для извлечения дискриминативных признаков из входных данных43,44. Для классификации пола и возраста по голосовым данным CNN применялись к представлениям речевого сигнала для изучения закономерностей, связанных с высотой голоса, частотой, тембром и другими вокальными характеристиками, которые имеют значение для разграничения групп по полу и возрасту.

VGG19

В качестве архитектуры глубокого обучения (DL) использовалась сеть VGG19, характеризующаяся глубокой и относительно однородной иерархической структурой извлечения признаков45. Ее архитектура включает небольшие сверточные фильтры размером 3 × 3 в 19 слоях, что обеспечивает прогрессивное извлечение дискриминантных признаков. При применении к представлениям речевых сигналов VGG19 улавливала как низкоуровневые акустические паттерны, такие как вариации высоты тона и частоты, так и высокоуровневые дискриминантные признаки. Глубокая архитектура сети позволила осуществлять последовательную абстракцию признаков для моделирования вокальных характеристик, связанных с полом и возрастом.

EfficientNet-Lite

В качестве вычислительно эффективной архитектуры глубокого обучения (DL) была использована EfficientNet-Lite46,47. Модель применяла стратегию сбалансированного масштабирования для достижения высоких показателей классификации при меньших затратах вычислительных ресурсов по сравнению с более тяжелыми архитектурами DL. Подход комбинированного масштабирования совместно учитывал глубину, ширину модели и разрешение входных данных для обеспечения эффективного извлечения признаков.

Для предлагаемой платформы VoiceNet-RAI была выбрана модель EfficientNet-Lite благодаря ее легковесной архитектуре и оптимальному балансу между точностью классификации и сложностью модели. По сравнению с более массивными архитектурами, в ней используются эффективные сверточные блоки и составное масштабирование, что позволяет добиться эффективного извлечения признаков при меньшем количестве параметров и более низких требованиях к вычислительным ресурсам. Эти характеристики делают EfficientNet-Lite подходящей для предлагаемой платформы классификации речи и обеспечивают возможность ее развертывания в условиях ограниченных ресурсов.

MobileNet

MobileNet использовалась в качестве легковесной архитектуры глубокого обучения (DL) для приложений с ограниченными вычислительными ресурсами, включая мобильные среды и среды граничных вычислений48. Ее вычислительная эффективность была достигнута преимущественно за счет использования глубинных разделяемых сверток, которые сократили количество параметров и вычислительных операций по сравнению с традиционными сверточными архитектурами. Эти характеристики сделали MobileNet подходящей для оценки классификации пола и возраста по голосовым данным при сохранении относительно низких требований к вычислительным ресурсам.

InceptionV3

InceptionV3 была использована в качестве глубокой архитектуры для извлечения иерархических признаков из представлений, полученных из речи49. Архитектура включала операции свертки, пулинга и смешанные операции для извлечения признаков на различных уровнях абстракции. Для классификации пола и возраста по голосовым данным InceptionV3 применялась для изучения сложных акустических паттернов и иерархических представлений, связанных с вариациями вокальных характеристик.

Параметры оценки

Точность (accuracy) была одной из наиболее часто используемых метрик оценки для задач классификации50. Хотя точность обеспечивала полезную меру общей эффективности классификации, она не всегда позволяла провести комплексную оценку, особенно для несбалансированных наборов данных. Поэтому для оценки эффективности модели использовались дополнительные метрики, включая точность (precision), полноту (recall) и F1-меру. Эти метрики обеспечили более комплексную оценку за счет учета правильных и неправильных прогнозов для каждого класса.

Точность определялась как отношение количества правильно классифицированных наблюдений к общему числу наблюдений. Хотя точность была особенно информативной для сбалансированных наборов данных, набор данных, использованный в этом исследовании, был несбалансированным. Поэтому при расчете и интерпретации метрик классификации учитывались истинно положительные результаты (TP), ложноположительные результаты (FP), истинно отрицательные результаты (TN) и ложноотрицательные результаты (FN). Уравнение ниже представляет стандартное определение точности:

Точность =  (TP+TN)/(TP+TN+FP+FN)×100  (5)

Точность (precision) оценивает способность классификатора возвращать только релевантные экземпляры:

Точность=  TP/(TP+FP)  ×100   (6)

Полнота, также называемая чувствительностью, определяет способность классификатора выявлять все релевантные экземпляры:

Полнота (Recall)=  TP/(FN+TP) × 100   (7)

F1-мера объединяет точность и полноту в единый показатель и особенно полезна для оценки эффективности классификации на несбалансированных наборах данных:

F1-Score =2 ×(PPV ×TPR)/(TPR+PPV) × 100   (8)

Результаты

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Обсуждение

В данном исследовании была разработана и оценена автоматизированная система классификации пола и возраста по голосовым данным путем интеграции признаков MFCC и эмбеддингов wav2vec 2.0 с моделью EfficientNet-Lite. В ходе первичных экспериментов EfficientNet-Lite при использовании исходных признаков достигла точности (accuracy) 83,48%, прецизионности (precision) 82,87%, полноты (recall) 84,28% и F1-меры 83,54%. После интеграции признаков MFCC производительность существенно повысилась: на наборе данных, включающем 28 языков, были достигнуты точность 92,64%, прецизионность 93,79%, полнота 94,92% и F1-мера 94,84%. При использовании гибридного представления MFCC–wav2vec 2.0 на подмножестве английского языка EfficientNet-Lite достигла точности 97,87%, прецизионности 98,61%, полноты 98,70% и F1-меры 98,65%, полноты 98,70%, прецизионности 98,61% и F1-меры 98,65%. Обобщающая способность системы была дополнительно оценена с помощью набора данных Mozilla Common Voice, на котором предложенная архитектура также продемонстрировала высокие результаты. Кроме того, стабильность модели была проверена с помощью пятикратной кросс-валидации.

Улучшение, наблюдаемое после интеграции признаков MFCC, показало, что низкоуровневые спектральные характеристики, включая высоту тона, тембр и информацию о голосовом тракте, остаются высокодискриминативными для классификации пола и возраста. Дополнительный прирост производительности, достигнутый с помощью гибридного представления MFCC–wav2vec 2.0, свидетельствует о том, что контекстуальные эмбеддинги на основе Transformer предоставляют дополнительную информацию, которая не полностью охватывается только вручную подобранными акустическими признаками. Эта взаимодополняемость может объяснять более высокую эффективность предложенного гибридного представления по сравнению с оригинальной конфигурацией и конфигурацией только с MFCC. Более высокие показатели, наблюдаемые в англоязычном подмножестве, также указывают на то, что лингвистическая вариативность могла способствовать затруднению классификации. При объединении нескольких языков различия в произношении, акценте, фонетической структуре и распределении выборок могли внести дополнительную вариативность, тогда как одноязычная среда обеспечила более гомогенное пространство признаков. Валидация с использованием набора данных Mozilla Common Voice дополнительно показала, что предложенное представление применимо и за пределами основного набора данных, хотя различия в условиях записи и демографическом распределении все еще могли повлиять на производительность.

В целом, результаты показали, что эффективность VoiceNet-RAI была обусловлена взаимодополняющим вкладом спектральных и контекстуальных представлений речи, а не одним типом признаков. Однако сохраняющиеся различия в производительности между языками и возрастными группами подчеркивают необходимость более широкой оценки подгрупп, тестирования устойчивости к шуму и проведения дополнительных сравнений с современными самообучающимися моделями обработки речи.

Альтернативные подходы к классификации пола и возраста по речи включают использование вручную подобранных акустических признаков с традиционными классификаторами машинного обучения (ML), обучение на основе сверточных нейронных сетей (CNN) с использованием представлений речи, ансамблевые методы и модели с самообучением, такие как HuBERT, WavLM и data2vec. В отличие от них, VoiceNet-RAI сочетает спектральную информацию на основе MFCC с контекстными эмбеддингами wav2vec 2.0, чтобы использовать взаимодополняющие преимущества вручную созданных и изученных представлений речи.

Данное исследование имело несколько ограничений. Во-первых, основной набор данных характеризовался несбалансированным распределением по полу, языкам и возрастным группам, что могло повлиять на эффективность работы в подгруппах и ограничить возможность обобщения результатов для недостаточно представленных групп населения. Во-вторых, различия в записывающих устройствах, акцентах, произношении и акустических условиях могли повлиять на надежность классификации. В-третьих, хотя валидация с использованием набора данных Mozilla Common Voice подтвердила возможность обобщения за пределы основного датасета, оставалась необходимость в более широкой оценке с использованием дополнительных реальных наборов данных. Наконец, внедрение голосовой демографической классификации вызвало вопросы конфиденциальности, справедливости и этики, особенно в неконтролируемых приложениях или приложениях с высокой степенью влияния. Следовательно, для ответственного внедрения необходимы постоянный мониторинг эффективности, человеческий контроль и методы развертывания с учетом конфиденциальности. Разработанная структура продемонстрировала потенциал для применения в области человеко-машинного взаимодействия, голосовой аутентификации, речевой аналитики и цифровой криминалистики. В будущих работах будет проведено сравнение VoiceNet-RAI с современными моделями речи с самообучением, включая HuBERT, WavLM и data2vec, а также будет изучено специфическое для конкретных задач внимание к объединенному представлению MFCC–wav2vec 2.0. В отличие от внутреннего механизма самовнимания wav2vec 2.0, предлагаемый в будущем механизм будет явно взвешивать релевантную для задачи временную информацию и информацию на уровне признаков для классификации пола и возраста.

Раскрытие информации

Авторы заявляют об отсутствии конфликта интересов.

Благодарности

Авторы выражают благодарность Университету принцессы Нуры бинт Абдуррахман и Проекту поддержки исследователей (номер PNURSP2026R748), Университет принцессы Нуры бинт Абдуррахман, Эр-Рияд, Саудовская Аравия, за финансирование данного исследования.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
BVC Challenging Voice SetBiometrics Vision and Computing Group / OgeNIBVC Challenging Voice Sethttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, использованный вариантhttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Графический процессорNVIDIATesla K80https://www.nvidia.com/
Набор данных Mozilla Common VoiceMozilla FoundationCommon Voice, версия, использованная в экспериментахhttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyNumPy DevelopersТочная версия, использованная в экспериментахhttps://numpy.org/
ПроцессорIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonPython Software FoundationТочная версия, использованная в экспериментахhttps://www.python.org/
PyTorchPyTorch FoundationТочная версия, использованная в экспериментахhttps://pytorch.org/
Scikit-learnScikit-learn DevelopersТочная версия, использованная в экспериментахhttps://scikit-learn.org/
SciPySciPy DevelopersТочная версия, использованная в экспериментахhttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 11MicrosoftWindows 11, точное издание/сборка, если доступноhttps://www.microsoft.com/windows/windows-11

Ссылки

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Перепечатки и разрешения

Теги

Многоязычная классификация речиклассификация по полуответственный ИИплатформа VoiceNetWav2vec 2.0признаки MFCCглубокое обучение речиEfficientNet-Liteдемография речи