Artículo de investigación

VoiceNet: Un marco de trabajo de inteligencia artificial responsable y multilingüe de reconocimiento de voz para la clasificación de género y edad

48 visualizaciones

11 de septiembre de 2026

En este artículo

Resumen

VoiceNet-RAI integra características MFCC, incorporaciones multilingües wav2vec 2.0 y EfficientNet-Lite para la clasificación de género y edad a partir de datos de voz. El marco logra una precisión de hasta el 97,87 % en el subconjunto de idioma inglés y permite aplicaciones responsables en reconocimiento de voz, autenticación y peritaje digital.

Resumen

La clasificación precisa del género y la edad a partir de datos de voz es importante para una interacción humano-ordenador (IHO) personalizada, segura y ética. Con el creciente uso de modelos de voz preentrenados de gran tamaño, como wav2vec 2.0, surge la necesidad de aprovechar estas representaciones de forma responsable para inferir datos demográficos en múltiples idiomas y con conciencia de la privacidad. Este estudio propone VoiceNet-RAI, un marco de aprendizaje profundo (DL) que integra coeficientes cepstrales en frecuencia mel (MFCC) con incrustaciones multilingües basadas en transformadores de wav2vec 2.0 dentro de una arquitectura EfficientNet-Lite, para apoyar una clasificación precisa, justa y transparente en diversos contextos lingüísticos. El marco combina información espectral y contextual para mejorar la robustez bajo condiciones variables de grabación. Los experimentos con datos de voz multilingües que abarcan 28 idiomas demuestran un rendimiento elevado en la clasificación, alcanzando el subconjunto en inglés una exactitud del 97,87 %, una precisión del 98,61 %, una recuperación del 98,70 % y una puntuación F1 del 98,65 %. La validación externa utilizando el conjunto de datos Mozilla Common Voice arrojó una exactitud del 98,27 % en la clasificación de género, lo que demuestra su generalización a un conjunto de datos independiente. Un análisis de ablación mostró además que la combinación de características MFCC y wav2vec 2.0 mejoró el rendimiento en comparación con representaciones basadas únicamente en datos brutos o en MFCC. Estos hallazgos demuestran el potencial de las representaciones híbridas de voz espectral-contextual para una clasificación robusta y responsable del género y la edad.

Introducción

El reconocimiento de voz es un componente fundamental de la comunicación humana mediante el cual los individuos expresan sus sentimientos, pensamientos y objetivos. Las voces humanas se producen mediante un proceso biológico en el que el aire es exhalado desde los pulmones y moldeado en sonido por órganos articulatorios como los labios, la lengua y los dientes1. El oído desempeña un papel esencial en la identificación de la voz y puede distinguir entre voces masculinas y femeninas según características como el volumen y el tono. Una característica que contribuye a diferencias significativas en el tono vocal entre hombres y mujeres es el dimorfismo sexual2. La clasificación por edad y género a partir de la voz es relevante para numerosas aplicaciones, incluyendo la interacción humano-máquina, el reconocimiento automático de género, saludos personalizados, preclasificación de emociones en el habla y clasificación de llamadas basada en género3.

El habla es una parte intrínseca de la interacción humana. La voz humana contiene múltiples características que varían entre individuos y pueden proporcionar información sobre estados emocionales y mentales, así como sobre la edad y el sexo. Estas características multidimensionales pueden utilizarse en aplicaciones como sistemas de seguridad basados en voz y asistentes de inteligencia artificial (IA) orientados al habla. Otras áreas en las que el análisis de voz es importante incluyen los sistemas de verificación automática del hablante (ASV) y los sistemas de IA basados en emociones. Los sistemas de entrada basados en voz también pueden reducir el espacio de búsqueda dentro de bases de datos4,5. Además, los sistemas de seguridad basados en IA pueden utilizar datos de voz en aplicaciones como investigaciones criminales y protección de víctimas. Las voces masculinas y femeninas presentan características diferentes debido a variaciones en las propiedades resonantes del tracto vocal. Estas características pueden extraerse de señales de voz en una forma adecuada para su procesamiento computacional, lo que permite la clasificación del género a partir de datos de voz6,7. Por lo tanto, se requieren algoritmos de aprendizaje eficaces para la clasificación del género basada en la voz. Los algoritmos de aprendizaje profundo (DL) son particularmente adecuados para la clasificación relacionada con el habla debido a su capacidad para aprender patrones complejos a partir de datos de audio. Dichos modelos pueden contener capas convolucionales, recurrentes, convolucionales temporales o completamente conectadas, dependiendo de la arquitectura. Estas capas pueden aprender características acústicas relevantes, incluyendo el tono y el tono fundamental. Una vez entrenado, un modelo puede clasificar el género a partir de grabaciones de audio previamente no vistas8. Otra área importante de investigación en aprendizaje automático (ML) es la clasificación de la edad a partir de grabaciones de voz. Los algoritmos de ML pueden utilizar características acústicas como el tono, el timbre y la amplitud para identificar patrones relacionados con la edad. Técnicas como el análisis de componentes principales (PCA) también pueden aplicarse para extraer patrones informativos de los datos de voz y potencialmente mejorar el rendimiento de la clasificación9.

El aprendizaje profundo (DL) ha demostrado un rendimiento sólido en aplicaciones como el reconocimiento de imágenes, emociones y voz. Las redes neuronales profundas (DNN), en particular, se utilizan ampliamente para tareas relacionadas con el habla. En este estudio, se aplican enfoques basados en DL a la clasificación de voz en combinación con técnicas establecidas de extracción de características. Los coeficientes cepstrales en escala Mel (MFCC) capturan características espectrales relevantes de las señales de voz y proporcionan una representación eficiente para el procesamiento posterior. Las características extraídas se integran posteriormente en un marco de aprendizaje por transferencia para la clasificación de género y edad basada en la voz10,11.

Estudios recientes han adoptado cada vez más representaciones de voz basadas en transformadores y auto-supervisadas para la clasificación de atributos del hablante. Los investigadores han examinado sesgos demográficos, incluyendo sesgos de género y edad, en modelos de voz auto-supervisados como HuBERT y wav2vec 2.0, destacando la importancia de una evaluación consciente de la equidad12. Más recientemente, enfoques basados en transformadores e independientes del idioma han demostrado la eficacia de las representaciones de voz contextuales aprendidas para el reconocimiento de género en condiciones multilingües y ruidosas13. Sinha et al. investigaron además las representaciones por capas de wav2vec 2.0 para la clasificación de edad y género, y mostraron que diferentes capas del transformador capturan niveles variables de información relacionada con el hablante14. Estos avances motivan el marco propuesto VoiceNet-RAI, que combina información espectral convencional basada en MFCC con representaciones contextuales de wav2vec 2.0, incorporando al mismo tiempo consideraciones multilingües y de Inteligencia Artificial Responsable.

Estudios recientes han demostrado que la edad y el género del hablante pueden caracterizarse utilizando tanto características acústicas convencionales como representaciones basadas en aprendizaje profundo. Los enfoques que combinan información acústica y temporal han mostrado que características complementarias del habla pueden mejorar el rendimiento en la clasificación de edad y género15,16. Investigaciones relacionadas también han demostrado que las características de habla transformadas generadas mediante representaciones profundas de cuello de botella pueden mejorar el rendimiento en la clasificación de edad y género del hablante17. Estos hallazgos respaldan el uso más amplio de representaciones espectrales, temporales y aprendidas para tareas de clasificación que involucran señales de habla y derivadas del habla.

Varios estudios han investigado el reconocimiento de edad y género a partir de la voz mediante enfoques de aprendizaje automático y aprendizaje profundo18,19,20,21,22,23,24,25,26,27,28,29,30. Enfoques más recientes han explorado representaciones transformadas de los coeficientes cepstrales en frecuencia mel (MFCC) y redes neuronales profundas para la clasificación de edad y género del hablante31, mientras que la variabilidad multilingüe y dependiente del idioma sigue siendo una consideración importante al desarrollar sistemas robustos de clasificación demográfica basados en la voz. Las diferencias en la pronunciación, la estructura fonética, las características del hablante y las condiciones de grabación pueden reducir la generalización del modelo entre idiomas y poblaciones. Por consiguiente, el uso de representaciones espectrales y contextuales del habla complementarias podría mejorar la robustez en entornos multilingües.

Aunque enfoques híbridos han combinado previamente múltiples características acústicas o clasificadores de conjunto para el reconocimiento demográfico basado en la voz, VoiceNet-RAI se diferencia al integrar dos niveles complementarios de representación del habla dentro de un marco unificado. Específicamente, las características convencionales de MFCC preservan características espectrales y vocales localizadas, mientras que wav2vec 2.0 proporciona representaciones contextualizadas aprendidas a partir de señales de voz en bruto mediante un codificador Transformer. En lugar de depender exclusivamente de descriptores acústicos diseñados manualmente o de una única representación profunda, VoiceNet-RAI realiza una fusión a nivel de características de las representaciones de MFCC y wav2vec 2.0 agregadas temporalmente, y luego perfecciona la representación híbrida resultante utilizando EfficientNet-Lite. La novedad científica, por tanto, radica en la integración coordinada de representaciones espectrales, contextualizadas auto-supervisadas y profundas ligeras para la clasificación de género y edad, junto con una evaluación multilingüe, validación en conjuntos de datos independientes y análisis de equidad en subgrupos. Esta combinación extiende las canalizaciones convencionales de clasificación de habla más allá de la fusión de características orientada a la precisión, hacia un marco que considera simultáneamente la complementariedad de las representaciones, el diseño ligero del modelo, la generalización y la Inteligencia Artificial Responsable.

Las principales contribuciones de esta investigación incluyen el desarrollo de un enfoque para identificar el género y la edad a partir de datos de voz mediante la integración de características MFCC y wav2vec 2.0 con EfficientNet-Lite. Se realizaron experimentos exhaustivos en un conjunto de datos de grabaciones de voz de 28 idiomas, evaluando las características originales, las características MFCC, las características wav2vec 2.0 y sus combinaciones con modelos de ML y DL. El desempeño del modelo se evaluó utilizando tanto el conjunto de datos multilingüe completo como el subconjunto en idioma inglés. El marco se evaluó además desde perspectivas multilingües y de Inteligencia Artificial Responsable mediante análisis de subgrupos específicos por género e idioma, evaluación independiente del hablante y validación utilizando el conjunto de datos Mozilla Common Voice. Además, se comparó el desempeño del marco propuesto con los enfoques más avanzados reportados en la literatura existente, y se presentaron los resultados de la validación cruzada. Se ha llevado a cabo una amplia cantidad de investigaciones relacionadas, y Tabla 1 resume estos estudios, incluyendo los modelos, conjuntos de datos y resultados reportados19,20,21,22,23,24,25,26,27,28,29,30,31.

Protocolo

Este estudio utilizó conjuntos de datos públicos de BVC Challenging Voice Set y Mozilla Common Voice sin participación directa de sujetos. Por lo tanto, no se requirió aprobación ética institucional ni consentimiento informado adicional. Solo se procesaron los datos necesarios para la clasificación por género y edad, y no se realizó ningún intento para identificar a los hablantes individuales. La metodología completa del flujo de trabajo del marco propuesto se muestra en Figura 1.

Adquisición de datos

El conjunto de datos utilizado en el enfoque propuesto consistió en archivos de audio .wav obtenidos del BVC Challenging Voice Set, un conjunto de datos de voz de acceso público desarrollado por el grupo Biometrics Vision and Computing (BVC) y alojado en GitHub32. El conjunto de datos contenía grabaciones de voz de 526 individuos, incluyendo 336 hablantes masculinos y 190 femeninos. Comprendía aproximadamente 3.964 grabaciones, incluyendo grabaciones de una sola oración y de varias oraciones de cada hablante. Tabla 2 resume las características demográficas, la cobertura lingüística, las propiedades de grabación, la estrategia de particionamiento de los datos y los ajustes de preprocesamiento utilizados para los conjuntos de datos de habla en el marco propuesto de VoiceNet-RAI.

Extracción de características

Los archivos de audio se procesaron para extraer propiedades esenciales, que posteriormente se almacenaron en un archivo CSV. Los metadatos, incluyendo edad, género y pronunciación del hablante, se extrajeron de los archivos README correspondientes. Se utilizó Python junto con el paquete SciPy para procesar los archivos WAV y extraer características relevantes. Se emplearon la transformada rápida de Fourier (FFT) y las funciones de frecuencia de NumPy para convertir las señales de audio del dominio temporal al dominio frecuencial. Los archivos WAV representaban la amplitud como una función del tiempo; sin embargo, las características relacionadas con la frecuencia que podían distinguir voces masculinas y femeninas eran de mayor interés para la tarea de clasificación33.

Para transformar las señales de audio en representaciones en el dominio de la frecuencia, se implementó la Transformada Discreta de Fourier (DFT) utilizando el algoritmo FFT. La transformada de Fourier convierte una señal en el dominio del tiempo en un espectro de frecuencia. Dado que este espectro no conserva la información temporal, la señal de audio se dividió en segmentos solapados y la transformada de Fourier se aplicó a cada segmento mediante el enfoque de Transformada de Fourier de Tiempo Corto (STFT). La función np.fft.fft generó el espectro de frecuencia complejo, mientras que np.fft.fftfreq proporcionó las frecuencias de muestreo correspondientes. En el directorio de muestras, había disponibles 10 archivos de audio de un solo hablante. Cada archivo WAV se procesó utilizando ventanas deslizantes de 200 ms para extraer las frecuencias dominantes. Por ejemplo, una grabación de audio de 4 segundos produjo una lista de 20 valores de frecuencia. Para un directorio que contiene 10 grabaciones, las 10 listas correspondientes, cada una con 20 valores de frecuencia, se combinaron en una lista de listas. Las frecuencias se filtraron para conservar valores entre 20 Hz y 280 Hz, excluyéndose el ruido potencial alrededor de 50 Hz.

Representación híbrida de características MFCC y wav2vec 2.0

Para capturar tanto representaciones contextuales de habla de alto nivel como características acústicas de bajo nivel, este estudio empleó una estrategia híbrida de extracción de características que integró características MFCC con incrustaciones basadas en el transformador wav2vec 2.0.

Extracción de características MFCC

Los coeficientes cepstrales en escala de frecuencia mel (MFCCs) son características ampliamente utilizadas en el procesamiento de señales de voz y audio, especialmente para aplicaciones como el reconocimiento de voz y la identificación de hablantes34,35. En este estudio, la extracción de MFCC transformó las señales de audio en vectores de características que representan propiedades perceptualmente relevantes del habla. El proceso comenzó con un preénfasis para realzar los componentes de alta frecuencia, seguido de la división en tramas y el enventanado para separar la señal en tramas cortas y solapadas. Cada muestra de audio se remuestreó primero a 16 kHz y se segmentó en tramas de 25 ms con un solapamiento de 10 ms. Luego, se aplicó la transformada rápida de Fourier a cada trama para convertir la señal del dominio del tiempo al dominio de la frecuencia.

Al espectro de frecuencia resultante se le aplicó una serie de bancos de filtros Mel que aproximaron la respuesta de frecuencia no lineal de la percepción auditiva humana. Estos bancos de filtros enfatizaron las frecuencias más relevantes desde el punto de vista perceptual, mientras reducían la contribución de las menos informativas. Posteriormente, se calculó el logaritmo de la salida de cada banco de filtros para aproximar la sensibilidad logarítmica del oído humano a la intensidad sonora. Luego, se aplicó una Transformada Coseno Discreta (DCT) a las energías logarítmicas de los bancos de filtros para descorrelacionar los coeficientes y generar una representación compacta de la señal de audio. Los coeficientes resultantes, conocidos como MFCC, capturaron características espectrales importantes del habla. Se utilizaron MFCC para la clasificación por género y edad porque capturan características acústicas que diferencian las voces según estos atributos.

extracción de incrustaciones wav2vec 2.0

El modelo Base wav2vec 2.0 fue preentrenado en grandes corpus de habla sin etiquetar. El modelo consistía en un codificador Transformer de múltiples capas que procesaba entradas de forma de onda en bruto y generaba incorporaciones de habla contextualizadas36.

Dada una forma de onda de entrada x ∈ RT, el modelo wav2vec 2.0 produjo una secuencia de representaciones latentes:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

donde cada vector de incrustación tenía una dimensionalidad de 768. Para obtener una representación de longitud fija adecuada para la clasificación, se aplicó una operación de agrupamiento temporal promedio a lo largo de todos los pasos temporales.

figure-protocol-1   (2)

Mecanismo de fusión de características

Las características MFCC y wav2vec 2.0 se fusionaron mediante la concatenación a nivel de características. Específicamente, las características MFCC se agruparon primero utilizando promedio temporal para producir un vector de longitud fija.

m ∈ R40  (3)

El vector final de características híbridas se obtuvo como:

h = [m || zpooled] ∈ R808  (4)

donde || denota concatenación. Esta fusión combinó incrustaciones contextuales profundas con características espectrales diseñadas manualmente, permitiendo al modelo capturar tanto información semántica de alto nivel como patrones acústicos finamente detallados.

Todas las muestras de audio se remuestrearon primero a 16 kHz. Las características MFCC se calcularon por tramas y se promediaron temporalmente para producir un vector fijo de 40 dimensiones, mientras que los embeddings de wav2vec 2.0 se promediaron a lo largo del tiempo para generar una representación de 768 dimensiones. Dado que ambos conjuntos de características se convirtieron en vectores de longitud fija antes de la fusión, no fue necesario alinearlas a nivel de trama en el tiempo. Las representaciones resultantes de MFCC y wav2vec se concatenaron entonces en un vector de características híbrido de 808 dimensiones antes de ser introducidas en el modelo de clasificación.

Integración con EfficientNet-Lite

El vector de características fusionado, h, se reconfiguró en un formato adecuado para el aprendizaje de características y se proporcionó como entrada al modelo EfficientNet-Lite para su entrenamiento. Una capa de proyección completamente conectada primero mapeó el vector de 808 dimensiones a un espacio latente de mayor dimensionalidad, tras lo cual los bloques EfficientNet-Lite refinaron las características jerárquicas. Se emplearon capas de normalización por lotes y capas de desactivación (dropout) para reducir el sobreajuste y mejorar la generalización del modelo. Se utilizó la función de activación SoftMax para generar las probabilidades finales predichas para las clases de género y edad. La representación fusionada, h ∈ R808, se trató inicialmente como un vector de características unidimensional y se pasó a través de una capa de proyección completamente conectada que la mapeó a 4.096 dimensiones. Luego, la representación proyectada se reconfiguró en un tensor de 1 × 64 × 64 antes de ser suministrada a la arquitectura EfficientNet-Lite.

Para adaptarse a la representación de características de voz de un solo canal, en lugar de la entrada convencional de imagen de tres canales, se modificó la capa convolucional de entrada de EfficientNet-Lite, pasando de tres a un canal de entrada. Los bloques restantes de extracción de características de EfficientNet-Lite se mantuvieron sin modificaciones arquitectónicas importantes. Se aplicó una capa de agrupamiento promedio global adaptable a los mapas de características finales para producir una representación de longitud fija. La cabeza de clasificación original fue reemplazada por una capa completamente conectada específica para la tarea, que contenía dos unidades de salida para la clasificación de género y el número correspondiente de unidades de salida para los grupos de edad predefinidos. Finalmente, se aplicó la función de activación SoftMax para generar las probabilidades de clase. La representación híbrida propuesta combinó incrustaciones de voz modernas auto-supervisadas con características tradicionales de procesamiento de señales. Las incrustaciones wav2vec 2.0 capturaron información contextual y dependencias de largo alcance, mientras que las características MFCC proporcionaron información acústica complementaria de bajo nivel. La integración de estas representaciones mejoró el rendimiento de clasificación, particularmente en condiciones de voz ruidosa y multilingüe.

Clasificador ML

En esta investigación, se analizó el rendimiento de múltiples algoritmos de ML para la clasificación por género y grupo de edad basada en la voz.

Bosque aleatorio

Se utilizó el Bosque Aleatorio (RF) como un clasificador robusto de Aprendizaje Automático (ML), combinando múltiples Árboles de Decisión (DTs) para mejorar la precisión de las predicciones y reducir el sobreajuste. RF funcionó mediante un procedimiento de aprendizaje conjunto en el que se agruparon las predicciones de múltiples árboles para generar la predicción final37,38. Este enfoque permitió a RF captar diversos patrones en los datos al tiempo que reducía el sobreajuste comúnmente asociado con árboles DT individuales. La aleatoriedad introducida durante la construcción de los árboles mejoró la generalización del modelo, haciendo que RF fuera adecuado para tareas de clasificación como la clasificación por género y edad a partir de datos de voz.

Regresión Logística

Se utilizó la regresión logística (RL) como modelo estadístico de aprendizaje automático para clasificación39. Para clasificación binaria, la RL estima la probabilidad de un resultado en función de las características de entrada mediante la función logística (sigmoide), y las probabilidades resultantes se utilizan para generar predicciones de clase. La RL también era aplicable a problemas de clasificación multiclase que involucraban más de dos clases. Para clasificación multiclase, la RL empleó enfoques como uno contra el resto o regresión SoftMax, dependiendo del contexto de clasificación.

Clasificador de árboles extremos

El clasificador Extra Trees (ETC) se utilizó como un algoritmo de aprendizaje conjunto que combina múltiples árboles de decisión (DT) para generar predicciones40,41. A diferencia del bosque aleatorio (RF), el ETC introduce aleatoriedad adicional al seleccionar al azar las características candidatas y los umbrales de división durante la construcción del árbol. Este procedimiento genera árboles menos correlacionados y reduce la sensibilidad del modelo a características individuales, mejorando así la robustez frente al ruido. Se utilizó el índice de Gini como criterio de división para evaluar la importancia de las características y particionar los datos.

Máquina de Vectores de Soporte

Se utilizó una Máquina de Vectores de Soporte (SVM) como clasificador de aprendizaje automático (ML) para identificar un límite de decisión óptimo en un espacio de características de alta dimensión42. El objetivo era determinar un hiperplano que maximizara el margen entre las clases. Un margen más amplio entre el límite de decisión y los puntos de datos más cercanos generalmente favorece una mejor separación de clases y una mayor capacidad de generalización. La SVM es aplicable a varias tareas de aprendizaje automático, incluyendo clasificación, regresión y análisis de datos basado en características.

Redes Neuronales Convolucionales

Se utilizaron redes neuronales convolucionales (CNN) como modelos de aprendizaje profundo (DL) para tareas de clasificación que implican representaciones estructuradas de datos de imagen y audio. Las CNN unidimensionales (1D-CNN) también se han aplicado ampliamente a datos secuenciales y textuales. Las arquitecturas de CNN emplearon filtros convolucionales y operaciones de agrupación para extraer características discriminativas de los datos de entrada43,44. Para la clasificación de género y edad a partir de datos de voz, se aplicaron CNN a representaciones derivadas del habla para aprender patrones asociados con el tono, la frecuencia, el timbre y otras características vocales relevantes para distinguir entre grupos de género y edad.

VGG19

Se utilizó VGG19 como una arquitectura de aprendizaje profundo caracterizada por una estructura jerárquica profunda y relativamente uniforme para la extracción de características45. Su arquitectura empleó filtros convolucionales pequeños de 3 × 3 a lo largo de 19 capas, lo que permitió la extracción progresiva de características discriminativas. Cuando se aplicó a representaciones derivadas del habla, VGG19 capturó tanto patrones acústicos de bajo nivel, como variaciones de tono y frecuencia, como características discriminativas de nivel superior. Su arquitectura profunda permitió una abstracción progresiva de características para modelar las características vocales asociadas con el género y la edad.

EfficientNet-Lite

EfficientNet-Lite se utilizó como una arquitectura de DL eficiente computacionalmente46,47. El modelo empleó una estrategia de escalado equilibrada para lograr un buen rendimiento de clasificación, requiriendo menos recursos computacionales que arquitecturas de DL más pesadas. Su enfoque de escalado compuesto consideró conjuntamente la profundidad, la anchura del modelo y la resolución de entrada para lograr una extracción eficiente de características.

Se seleccionó EfficientNet-Lite para el marco propuesto VoiceNet-RAI debido a su arquitectura ligera y su favorable equilibrio entre el rendimiento de clasificación y la complejidad del modelo. En comparación con arquitecturas más pesadas, utilizó bloques convolucionales eficientes y escalado compuesto para lograr un aprendizaje efectivo de características con menos parámetros y menores requisitos computacionales. Estas características hicieron que EfficientNet-Lite fuera adecuado para el marco de clasificación de voz propuesto y ofrecieron la posibilidad de implementarlo en entornos con recursos limitados.

MobileNet

Se utilizó MobileNet como una arquitectura ligera de aprendizaje profundo (DL) para aplicaciones con recursos computacionales limitados, incluidos entornos de computación móvil y en el borde48. Su eficiencia computacional se logró principalmente mediante convoluciones separables por profundidad, que redujeron el número de parámetros y operaciones computacionales en comparación con arquitecturas convolucionales convencionales. Estas características hicieron que MobileNet fuera adecuado para evaluar la clasificación por género y edad a partir de datos de voz, manteniendo requisitos computacionales relativamente bajos.

InceptionV3

Se utilizó InceptionV3 como una arquitectura profunda para extraer características jerárquicas de representaciones derivadas del habla49. La arquitectura incorporó operaciones convolucionales, de agrupación y mixtas para extraer características a diferentes niveles de abstracción. Para la clasificación de género y edad a partir de datos de voz, InceptionV3 se utilizó para aprender patrones acústicos complejos y representaciones jerárquicas asociadas con variaciones en las características vocales.

Parámetros de evaluación

La precisión fue una de las métricas de evaluación más utilizadas para tareas de clasificación50. Aunque la precisión proporcionaba una medida útil del rendimiento general de la clasificación, no siempre ofrecía una evaluación completa, especialmente para conjuntos de datos desequilibrados. Por lo tanto, se utilizaron métricas adicionales, incluyendo la exactitud (precisión), la recuperación (recall) y la puntuación F1, para evaluar el rendimiento del modelo. Estas métricas proporcionaron una evaluación más completa al considerar las predicciones correctas e incorrectas para cada clase.

La exactitud se definió como la proporción de observaciones clasificadas correctamente respecto al número total de observaciones. Aunque la exactitud era particularmente informativa para conjuntos de datos equilibrados, el conjunto de datos utilizado en este estudio estaba desequilibrado. Por lo tanto, se consideraron los verdaderos positivos (TP), falsos positivos (FP), verdaderos negativos (TN) y falsos negativos (FN) al calcular e interpretar las métricas de clasificación. La ecuación siguiente representa la definición estándar de exactitud:

Precisión =  (VP+VN)/(VP+VN+FP+FN)×100  (5)

La precisión evalúa la capacidad del clasificador para devolver únicamente instancias relevantes:

Precisión=  TP/(TP+FP)  ×100   (6)

La recuperación, también conocida como sensibilidad, mide la capacidad del clasificador para identificar todas las instancias relevantes:

Sensibilidad=  TP/(FN+TP) × 100   (7)

El puntaje F1 combina la precisión y la recuperación en una sola medida y es particularmente útil para evaluar el rendimiento de clasificación en conjuntos de datos desequilibrados:

Puntuación F1 = 2 × (PPV × TPR)/(TPR + PPV) × 100   (8)

Resultados

Experimental results for age and gender classification were evaluated using MFCC-based and hybrid feature representations with ML and DL models. The dataset was partitioned into training and testing sets at an 80:20 ratio, with 80% used for training and 20% for testing. Speaker-level partitioning was applied to prevent recordings from the same speaker from appearing in both sets.

The hyperparameters and implementation details of the proposed framework are summarized in Table 3. The experiments were conducted on a system equipped with an Intel i7-8265U CPU, 16 GB of RAM, and an NVIDIA Tesla K80 GPU running Windows 11. Python and the Scikit-learn library were used to develop the ML models, whereas the proposed DL framework was implemented using PyTorch. These models were evaluated for gender and age classification from voice data.

The Adam optimizer was used with an initial learning rate of 1 × 10⁻4, β₂ = 0.999, and ε = 1 × 10⁻8. A batch size of 64 and a maximum of 50 epochs were used, with early stopping set to a patience of four epochs to reduce overfitting. A dropout rate of 0.3 was applied to the fully connected layers for regularization. Categorical cross-entropy was used as the loss function for the classification tasks. The ReduceLROnPlateau learning-rate scheduler was used to monitor the validation loss.

To prevent data leakage and ensure a fair evaluation, speaker-level splitting was enforced so that no speaker appeared in both the training and testing sets. In addition, five-fold cross-validation was performed to assess the generalizability and robustness of the proposed model.

Results of models using the original dataset

Table 4 presents the performance of several ML and DL models for gender classification on a dataset comprising 28 languages, without MFCC features. Precision, recall, F1-score, and accuracy were used as the evaluation metrics.

Among the evaluated models, EfficientNet-Lite achieved the highest accuracy of 83.48%, with a precision 82.87%, a recall 84.28%, and an F1-score 83.54%. MobileNet and InceptionV3 also performed well, with MobileNet achieving 81.33% accuracy and 83.11% F1-score, and InceptionV3 achieving 80.77% accuracy and 82.52% F1-score. The CNN model achieved an accuracy of 75.71% and an F1-score of 77.43%, while ResNet achieved an accuracy of 74.37% and an F1-score of 75.54%. SVM, RF, LR, and ETC achieved accuracies ranging from 71.42% to 73.59% and F1-scores ranging from 72.48% to 74.34%. VGG19 achieved a comparatively lower accuracy of 70.56%, with a recall of 75.07% and an F1-score of 74.17%. Overall, EfficientNet-Lite and MobileNet achieved the strongest performance among the evaluated models when using the original features.

Results of models using MFCC features

MFCC features were subsequently evaluated for gender classification. Table 5 compares the performance of the ML and DL models using MFCC features on the dataset comprising 28 languages.

EfficientNet-Lite achieved the highest performance, with an accuracy of 92.64%, precision of 93.79%, recall of 94.92%, and F1-score of 94.84%. MobileNet achieved an accuracy of 91.39% and an F1-score of 91.07%, whereas InceptionV3 achieved an accuracy of 90.24% and an F1-score of 89.83%. ResNet achieved an accuracy of 89.43% and an F1-score of 83.67%, while CNN achieved an accuracy of 88.60% and an F1-score of 87.35%. VGG19 achieved an accuracy of 87.48% and an F1-score of 85.58%.

Among the traditional ML models, SVM achieved an accuracy of 85.47% and an F1-score of 84.29%; RF achieved an accuracy of 84.57% and an F1-score of 87.42%; LR achieved an accuracy of 83.25% and an F1-score of 84.98%; and ETC achieved an accuracy of 83.59% and an F1-score of 85.43%. Overall, the inclusion of MFCC features improved the performance of most models compared with the results obtained using the original features. EfficientNet-Lite achieved the highest overall performance in this experiment.

Results of models using hybrid MFCC–wav2vec 2.0 features with the English-language dataset

The next set of experiments evaluated gender classification using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset. The performance of the evaluated models is presented in Table 6. EfficientNet-Lite achieved the highest performance, with an accuracy of 97.87%, precision of 98.61%, recall of 98.70%, and F1-score of 98.65%.

Among the traditional ML models, SVM achieved an accuracy of 92.58% and an F1-score of 91.52%; ETC achieved an accuracy of 91.49% and an F1-score of 92.79%; LR achieved an accuracy of 90.64% and an F1-score of 91.34%; and RF achieved an accuracy of 88.36% and an F1-score of 90.86%. Overall, the models demonstrated strong performance on the English-language subset, with EfficientNet-Lite achieving the highest values across the reported evaluation metrics.

Results of five-fold cross-validation

Five-fold cross-validation was performed to evaluate the stability and generalizability of the proposed framework. The cross-validation results obtained using the English-language voice dataset are presented in Table 7. EfficientNet-Lite achieved a standard deviation of ±0.0033 across the five folds. The low variability across folds indicated stable performance under the evaluated cross-validation setting.

Age classification using voice data

In addition to gender classification, age classification was evaluated using multiple models and MFCC features. Table 8 presents the performance of the evaluated models for age classification.

The results showed that the transfer-learning models achieved accuracies above 85%, with MobileNet achieving 85.23% and InceptionV3 achieving 86.67%. EfficientNet-Lite achieved the highest reported performance, with an accuracy of 88.42%, precision of 86.56%, and recall of 87.21%.

Validation of the proposed framework

To evaluate the proposed framework on an external dataset, additional experiments were conducted using the Mozilla Common Voice dataset51. The dataset contained approximately 500 hours of crowdsourced speech recordings with associated demographic metadata, including age, gender, and accent information. The corpus was organized into predefined training, development, and test subsets. Audio recordings were processed using the same preprocessing pipeline as that used in the primary experiments, including resampling to 16 kHz, extraction of 40-dimensional MFCC features, and generation of 768-dimensional wav2vec 2.0 embeddings. The two representations were concatenated to produce the 808-dimensional hybrid feature vector used by VoiceNet-RAI. The validation results are presented in Table 9.

EfficientNet-Lite with the hybrid low- and high-level feature representation achieved a gender classification accuracy of 98.27%, higher than that of the other evaluated models. Among the ML models, RF achieved 90.47% accuracy, SVM 90.69%, and LR 89.75%. Among the other DL models, ResNet achieved 92.19% accuracy, whereas VGG19 achieved 92.12%. The corresponding precision, recall, and F1-score values are reported in Table 9.

Ablation study on feature representation and fusion

An ablation study was conducted to evaluate the contribution of the feature representations used in the proposed framework. Four configurations were considered: raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the proposed hybrid MFCC–wav2vec 2.0 representation. EfficientNet-Lite was used as the representative model because it achieved the highest performance across the evaluated experimental settings. The ablation results are presented in Table 10.

The baseline model using raw features achieved 83.48% accuracy, whereas the MFCC-based representation achieved 92.64% accuracy and 94.84% F1-score. The hybrid MFCC–wav2vec 2.0 representation achieved an accuracy of 97.87% and an F1-score of 98.65%. Under identical English-language data partitions and training conditions, the hybrid MFCC–wav2vec 2.0 representation achieved 97.87% accuracy, compared with 92.64% for the MFCC-only representation.

Controlled experiments were conducted using identical data partitions, training settings, and the EfficientNet-Lite architecture to evaluate the contribution of each feature representation. Raw/original features, MFCC-only features, wav2vec 2.0-only embeddings, and the hybrid MFCC–wav2vec 2.0 representation were compared under these conditions. This experimental design was used to assess the individual and combined contributions of the feature representations.

Statistical significance analysis

All feature configurations in this comparison were evaluated using the same English-language subset, identical speaker-level data partitions, and the same five cross-validation folds. The proposed model achieved significantly higher accuracy than the raw-feature (97.86 ± 0.23% vs. 83.48 ± 0.24%; t (4) = 384.32, p < 0.001), MFCC-only (97.86 ± 0.23% vs. 92.60 ± 0.32%; t (4) = 131.50, p < 0.001), and wav2vec 2.0-only configurations (97.86 ± 0.23% vs. 95.34 ± 0.24%; t (4) = 126.00, p < 0.001), confirming that the improvements from MFCC–wav2vec 2.0 fusion were statistically significant.

Responsible AI considerations and deployment guidelines

Responsible AI in voice-based demographic classification required consideration of fairness, transparency, privacy, potential misuse, and deployment-related risks in addition to predictive performance. Although subgroup analysis provided an empirical assessment of performance differences across the evaluated gender and language groups, fairness could not be established solely from similar classification accuracy. Therefore, the VoiceNet-RAI framework was evaluated from multiple Responsible AI perspectives.

Fairness and bias analysis

A fairness analysis was conducted across gender and language subgroups to evaluate the Responsible AI characteristics of the proposed VoiceNet-RAI framework. The results are presented in Table 11. For gender-wise evaluation, model performance was analyzed separately for male and female speakers. The results showed less than 1.5% variation in accuracy and F1-score between the evaluated gender groups.

For language-wise evaluation, performance was assessed across the evaluated language groups within the dataset of 28 languages. The results showed an average variation of less than 2% in accuracy across the evaluated groups, with greater variation observed for some lower-resource languages with fewer available samples.

Fairness was further assessed using the demographic parity difference, the equal opportunity difference, the False Positive Rate (FPR), and the False Negative Rate (FNR). Demographic parity difference quantified differences in positive prediction rates between groups, whereas equal opportunity difference quantified differences in True Positive Rates (TPRs). FPR and FNR were used to characterize subgroup-specific error patterns. These metrics complemented subgroup-level accuracy and F1-score, providing additional information on differences in model performance across the evaluated demographic and linguistic groups. Under the evaluated dataset and subgroup definitions, the results indicated relatively small performance differences across the assessed gender and language groups. However, these findings were limited to the demographic and linguistic groups represented in the evaluated datasets and did not establish fairness across unrepresented populations or deployment settings.

Explainability and transparency

VoiceNet-RAI combined interpretable MFCC-based acoustic features with contextual wav2vec 2.0 embeddings. The ablation study evaluated the contributions of the individual and combined feature representations. However, wav2vec 2.0 embeddings remained comparatively difficult to interpret. Post-hoc explanation methods could therefore be investigated in future studies to identify the features that contributed most strongly to individual predictions.

Privacy preservation

Because voice recordings contained sensitive biometric information, privacy-preserving deployment required data-minimization practices, including processing only the information required for the classification task and avoiding unnecessary storage of raw audio. Secure storage, controlled access, and local inference could further reduce privacy risks. Formal privacy-preserving approaches, including differential privacy, were not evaluated in the present study and remained an area for future investigation.

Responsible deployment

Deployment of VoiceNet-RAI would require human oversight, confidence-aware decision-making, and continuous performance monitoring. Low-confidence predictions should not be used independently for critical decisions, and model performance should be re-evaluated when deployment conditions differ substantially from those represented in the training and validation datasets.

Comparison with state-of-the-art techniques

A comparative evaluation of the proposed framework and previously published approaches is presented in Table 12. Studies published between 2019 and 2024 were considered, including approaches based on ML, DL, and transfer learning. The comparison included previously reported studies in the same application domain. As shown in Table 12, the proposed framework achieved higher reported accuracy for gender and age classification than the compared approaches. However, because the studies may have differed in datasets, preprocessing procedures, data partitions, and evaluation protocols, the comparison reflected reported performance rather than a controlled head-to-head experimental comparison.

DATA AVAILABILITY:

The raw speech data used in this study are publicly available from the BVC Challenging Voice Set hosted on GitHub and the Mozilla Common Voice dataset. The BVC dataset can be accessed at https://github.com/OgeNI/BVC_Challenging_Voice_Set, while the Common Voice dataset is available at https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

VoiceNet-RAI framework diagram for speech analysis using MFCC, wav2vec, classification model, AI output.
Figure 1: Architecture Diagram. The complete workflow methodology of the proposed framework. Please click here to view a larger version of this figure.

ReferencesModelsDatasetsResults
19GBC, DT, RF, SVM, NNVoxForge datasetGBC 90%
20Robustscalar, PCA, and Logistic
regression, Sequential model
voice.mozilla.orgSequential Model 91%.
21CNN, CRNN, TCNMozilla Voice dataset80% CNN
22, 23Backpropagation, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice dataset,
Speech Accent Archive
Kaggle: Bagging, KNN and RF
98.10%. Voice common: Bagging 55.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF kernel, ADA, QDA, GNB, ResNET34 and ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech corpus, Private
corpus, Specific Dataset,
For Gender detection SVM 98%,
For age detection RF 95%
26SVM, DA, NB, DT, KNN, Ensem-
ble, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Stacked
model
Various gender sourcesStacked model 99.64%
28DNN, SVMVarious gender sourcesSVM 97%
29SVM, RF, CART, KNNDataset contain 3169 instancesRF 93%
30CNNNigerian subjects datasetCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
3 dataset from kaggleGender Prediction: ANN 85.51%,
Age Prediction: ANN 89.20%.

Table 1: Summary of existing studies on voice-based gender and age classification, including models, datasets, and reported performance.

Dataset CharacteristicDescription / Value
Total number of speakers526
Male speakers336
Female speakers190
Total recordingsApproximately 3,964
Number of languages28
Language-wise distributionEnglish and 28 native languages (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv and Ukwani. The dominant tribe amongst these native languages in the dataset is Igbo.)
Age groupsthree age groups: young people (teens and twenties), adults (thirties, forties and fifties), and seniors (sexagenarians, heptagenarians and octogenarians)
Age-group distributionTeens13–19 yearsLow (< 10%)Twenties20–29 yearsVery High (~35–45%)Thirties30–39 yearsHigh (~20–30%)Forties40–49 yearsModerate (~10–15%)Fifties50–59 yearsLow (~5–10%)Sixties+60–80+ yearsSparse (< 5%)  
Recording duration3-10 seconds
Recording conditions16 bit PCM
Original sampling rate44.1 kHz
Processing sampling rate16 kHz
MFCC frame length25 ms
MFCC frame overlap / step10 ms
MFCC representation39-dimensional temporally averaged vector
wav2vec 2.0 representation768-dimensional temporally mean-pooled vector
Final fused representation807 dimensions
Train–test split80:20
Data partitioningSpeaker-independent splitting
Cross-validation5-fold cross-validation
External validation datasetMozilla Common Voice

Table 2: Demographic characteristics, language coverage, data partitioning, and preprocessing settings of the speech dataset used in VoiceNet-RAI.

ParameterValue / Description
FrameworkPyTorch
HardwareNVIDIA GPU (CUDA-enabled)
Random seed42
OptimizerAdam
Initial Learning Rate1 × 10−4
β₁ / β₂0.9 / 0.999
Adam epsilon1 × 10⁻⁸
Batch Size64
Epochs50 (Early stopping patience = 8)
Loss FunctionCategorical Cross-Entropy
NormalizationZ-score normalization
Learning Rate SchedulerReduceLROnPlateau
Dropout Rate0.3
Training time20min
Inference time/sample13 seconds
Feature ExtractionFeature Extraction
MFCC Coefficients40
Window Size25 ms
Stride10 ms
wav2vec VariantBase (pretrained) Embedding Dimension
Pooling StrategyMean pooling
Feature FusionConcatenation (MFCC + wav2vec)
MFCC Coefficients40
Evaluation ProtocolEvaluation Protocol
Train-Test SplitSpeaker-level separation
Cross-Validation5-Fold
DatasetsMozilla Common Voice (28 languages + English subset) and BVC Gender & Age from Voice Challenging Dataset
TasksGender and Age Classification

Table 3: Training configuration, feature-extraction settings, hyperparameters, and evaluation protocol used for VoiceNet-RAI.

ModelsAccuracyPrecisionRecallF1-score
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Table 4: Gender-classification performance of ML and DL models using the 28-language dataset without MFCC features.

ModelsAccuracyPrecisionRecallF1-score
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Table 5: Gender-classification performance of ML and DL models using MFCC features on the 28-language dataset.

ModelsAccuracyPrecisionRecallF1-score
RF88.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Table 6: Gender-classification performance of ML and DL models using the hybrid MFCC–wav2vec 2.0 feature representation on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
First-fold97939694
Second-fold96949695
Third-fold97949595
Fourth-fold96939594
Fifth-fold97949695
Average96.693.695.694.6

Table 7: Five-fold cross-validation performance of VoiceNet-RAI on the English-language subset.

ModelsAccuracyPrecisionRecallF1-score
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Table 8: Age-classification performance of ML and DL models in terms of accuracy, precision, recall, and F1-score.

ModelsAccuracyPrecisionRecallF1-score
RF90.4792.8290.8591.32
LR89.7590.4489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Table 9: External validation results for gender classification on the Mozilla Common Voice dataset using the hybrid MFCC–wav2vec 2.0 feature representation.

Feature ConfigurationAccuracy (%)Precision (%)F1-Score ( %)
Raw features (No MFCC)83.4882.8783.54
MFCC only92.6493.7994.84
wav2vec 2.0-only95.3496.3295.18
MFCC + wav2vec (Proposed)97.8798.6198.65

Table 10: Ablation analysis of feature representations using EfficientNet-Lite.

Evaluation GroupSubGroupAccuracy (%)F1-score (%)FPRFNRDemographic Parity DifferenceEqual Opportunity Difference
GenderMale97.9597.950.0210.024__
GenderFemale97.6298.500.0240.027__
Gender disparityMale vs. Female____0.0120.003
High-resource languages98.1098.800.0180.021__
Low-resource languages96.8597.900.0310.034__
Language DisparityHigh vs. Low____0.0280.014

Table 11: Fairness evaluation across gender and language-resource subgroups. Abbreviations: FPR = false positive rate; FNR = false negative rate. Demographic parity difference and equal opportunity difference represent between-group disparities, so they are reported for subgroup comparisons rather than individual groups. Lower disparity values indicate more consistent model behavior across groups.

ReferenceApproachAccuracy
16GBC90%.
17Sequential Model91%
18CNN80%
19Bagging, KNN and RF98.10%.
20ResNET5098.57%.
21SVM98%
22LGBM91%
23Stacked model99.64%
24SVM97%
25RF93%
26CNN85.48%
27ANN89.20%
This studyEfficientNet-Lite97.87%

Table 12: Accuracy comparison of VoiceNet-RAI with previously reported state-of-the-art approaches for voice-based gender and age classification.

Discusión

Este estudio desarrolló y evaluó un marco automatizado para la clasificación por género y edad a partir de datos de voz, integrando características MFCC y embeddings de wav2vec 2.0 con EfficientNet-Lite. En los experimentos iniciales, EfficientNet-Lite alcanzó una exactitud del 83,48 %, una precisión del 82,87 %, una recuperación del 84,28 % y una puntuación F1 del 83,54 % utilizando las características originales. Tras la integración de las características MFCC, el rendimiento mejoró considerablemente, alcanzando una exactitud del 92,64 %, una precisión del 93,79 %, una recuperación del 94,92 % y una puntuación F1 del 94,84 % en el conjunto de datos compuesto por 28 idiomas. Utilizando la representación híbrida MFCC–wav2vec 2.0 en el subconjunto de idioma inglés, EfficientNet-Lite logró una exactitud del 97,87 %, una precisión del 98,61 %, una recuperación del 98,70 % y una puntuación F1 del 98,65 %, una recuperación del 98,70 %, una precisión del 98,61 % y una puntuación F1 del 98,65 %. La generalización se evaluó además utilizando el conjunto de datos Mozilla Common Voice, en el cual el marco propuesto también mostró un rendimiento sólido. Además, la estabilidad del modelo se evaluó mediante validación cruzada de cinco pliegues.

La mejora observada tras integrar las características MFCC indicó que las características espectrales de bajo nivel, incluyendo el tono, el timbre y la información del tracto vocal, seguían siendo altamente discriminativas para la clasificación por género y edad. La ganancia adicional en el rendimiento lograda con la representación híbrida MFCC–wav2vec 2.0 sugirió que los embeddings contextuales basados en Transformer proporcionaron información complementaria que no fue completamente capturada por las características acústicas diseñadas manualmente por sí solas. Esta complementariedad podría explicar el mejor rendimiento de la representación híbrida propuesta en comparación con las configuraciones original y exclusivamente MFCC. El rendimiento superior observado en el subconjunto de idioma inglés también sugirió que la variabilidad lingüística podría haber contribuido a la dificultad de clasificación. Cuando se combinaron varios idiomas, las diferencias en pronunciación, acento, estructura fonética y distribución de muestras podrían haber introducido variabilidad adicional, mientras que el entorno de un solo idioma proporcionó un espacio de características más homogéneo. La validación utilizando el conjunto de datos Mozilla Common Voice sugirió además que la representación propuesta se generaliza más allá del conjunto de datos principal, aunque las diferencias en las condiciones de grabación y en las distribuciones demográficas aún podrían haber afectado el rendimiento.

En general, los resultados indicaron que el rendimiento de VoiceNet-RAI se debió a las contribuciones complementarias de las representaciones espectrales y contextuales del habla, más que a un solo tipo de característica. Sin embargo, las variaciones restantes en el rendimiento entre idiomas y grupos de edad resaltaron la necesidad de una evaluación más amplia por subgrupos, pruebas de robustez frente al ruido y comparaciones adicionales con modelos recientes de habla auto-supervisados.

Los enfoques alternativos para la clasificación del género y la edad basada en el habla incluyen características acústicas diseñadas manualmente con clasificadores convencionales de aprendizaje automático, aprendizaje basado en CNN a partir de representaciones de voz, métodos de ensamble y modelos auto-supervisados como HuBERT, WavLM y data2vec. En contraste, VoiceNet-RAI combina información espectral basada en MFCC con incrustaciones contextuales de wav2vec 2.0 para aprovechar las fortalezas complementarias de las representaciones de voz diseñadas manualmente y las aprendidas.

Este estudio tuvo varias limitaciones. En primer lugar, el conjunto de datos principal presentaba distribuciones desequilibradas entre géneros, idiomas y grupos de edad, lo cual podría haber influido en el rendimiento de los subgrupos y limitado la generalización a poblaciones subrepresentadas. En segundo lugar, las variaciones en los dispositivos de grabación, acentos, pronunciación y condiciones acústicas podrían haber afectado la fiabilidad de la clasificación. En tercer lugar, aunque la validación mediante el conjunto de datos Mozilla Common Voice respaldó la generalización más allá del conjunto de datos principal, seguía siendo necesario realizar una evaluación más amplia utilizando otros conjuntos de datos del mundo real. Por último, la implementación de la clasificación demográfica basada en la voz planteó preocupaciones sobre privacidad, equidad y ética, especialmente en aplicaciones sin control o de alto impacto. Por lo tanto, sería necesario un monitoreo continuo del rendimiento, supervisión humana y prácticas de implementación conscientes de la privacidad para una aplicación responsable. El marco mostró potencial para aplicaciones en la interacción humano-computadora, autenticación basada en voz, análisis de habla y peritaje digital. Los trabajos futuros compararán VoiceNet-RAI con modelos recientes de habla auto-supervisados, incluyendo HuBERT, WavLM y data2vec, y explorarán la atención específica a la tarea sobre la representación fusionada MFCC–wav2vec 2.0. A diferencia del mecanismo interno de autoatención de wav2vec 2.0, el mecanismo futuro propuesto ponderaría explícitamente la información temporal y a nivel de características relevante para la tarea en la clasificación de género y edad.

Divulgaciones

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Los autores desean agradecer al Proyecto de Apoyo a Investigadores de la Universidad Princess Nourah bint Abdulrahman número (PNURSP2026R748), Universidad Princess Nourah bint Abdulrahman, Riad, Arabia Saudita, por financiar esta investigación.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de voces desafiantes BVCBiometrics Vision and Computing Group / OgeNIConjunto de voces desafiantes BVChttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, variante exacta utilizadahttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Unidad de procesamiento gráficoNVIDIATesla K80https://www.nvidia.com/
Conjunto de datos Mozilla Common VoiceFundación MozillaCommon Voice, versión utilizada en los experimentoshttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyDesarrolladores de NumPyVersión exacta utilizada en los experimentoshttps://numpy.org/
ProcesadorIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonFundación Python SoftwareVersión exacta utilizada en los experimentoshttps://www.python.org/
PyTorchFundación PyTorchVersión exacta utilizada en los experimentoshttps://pytorch.org/
Scikit-learnDesarrolladores de Scikit-learnVersión exacta utilizada en los experimentoshttps://scikit-learn.org/
SciPyDesarrolladores de SciPyVersión exacta utilizada en los experimentoshttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 11MicrosoftWindows 11, edición/construcción exacta si está disponiblehttps://www.microsoft.com/windows/windows-11

Referencias

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Reimpresiones y permisos

Etiquetas

Clasificaci n de voz multiling eclasificaci n de g neroIA responsablemarco de trabajo VoiceNetWav2vec 2 0caracter sticas MFCCaprendizaje profundo de vozEfficientNet Litedemograf a del habla