Araştırma makalesi

VoiceNet: Cinsiyet ve Yaş Sınıflandırması için Sorumlu Bir Yapay Zeka Çok Dilli Konuşma Çerçevesi

48 görüntülenme

11 Eylül 2026

Bu makalede

Özet

VoiceNet-RAI; ses verilerinden cinsiyet ve yaş sınıflandırması yapmak için MFCC özelliklerini, çok dilli wav2vec 2.0 gömmelerini ve EfficientNet-Lite'ı entegre eder. Çerçeve, İngilizce dil alt kümesinde %97,87'ye varan bir doğruluk oranına ulaşır; konuşma tanıma, kimlik doğrulama ve dijital adli tıp alanlarındaki sorumlu uygulamaları destekler.

Özet

Ses verilerinden doğru cinsiyet ve yaş sınıflandırması yapmak; kişiselleştirilmiş, güvenli ve etik insan-bilgisayar etkileşimi (HCI) için önemlidir. wav2vec 2.0 gibi önceden eğitilmiş geniş konuşma modellerinin kullanımının artmasıyla birlikte, bu temsillerden çok dilli ve gizlilik odaklı demografik çıkarımlar için sorumlu bir şekilde yararlanma ihtiyacı doğmuştur. Bu çalışma; çeşitli dilsel bağlamlarda doğru, adil ve şeffaf bir sınıflandırmayı desteklemek amacıyla Mel-Frekans Cepstral Katsayılarını (MFCC'ler), transformer tabanlı çok dilli wav2vec 2.0 gömmeleriyle (embeddings) bir EfficientNet-Lite mimarisi içinde entegre eden bir derin öğrenme (DL) çerçevesi olan VoiceNet-RAI'yi önermektedir. Bu çerçeve, değişken kayıt koşulları altında dayanıklılığı artırmak için bağlamsal ve spektral bilgileri birleştirir. 28 dili kapsayan çok dilli konuşma verileri üzerinde yapılan deneyler; İngilizce alt kümesinin %97,87 doğruluk, %98,61 kesinlik, %98,70 geri çağırma ve %98,65 F1-skoru elde etmesiyle güçlü bir sınıflandırma performansı sergilemiştir. Mozilla Common Voice veri seti kullanılarak yapılan dış doğrulama, cinsiyet sınıflandırması için %98,27 doğruluk oranı sağlayarak bağımsız bir veri setine genellenebilir olduğunu kanıtlamıştır. Ablasyon analizi, MFCC ve wav2vec 2.0 özelliklerinin birleştirilmesinin, ham verilere ve yalnızca MFCC temsillerine kıyasla performansı artırdığını göstermiştir. Bu bulgular, sağlam ve sorumlu cinsiyet ve yaş sınıflandırması için hibrit spektral-bağlamsal konuşma temsillerinin potansiyelini ortaya koymaktadır.

Giriş

Ses tanıma, bireylerin duygu, düşünce ve hedeflerini ifade ettikleri insan iletişiminin temel bir bileşenidir. İnsan sesleri, akciğerlerden dışarı verilen havanın dudaklar, dil ve dişler gibi eklemleme organları tarafından şekillendirilerek sese dönüştürüldüğü biyolojik bir süreçle üretilir1. Kulak, ses tanımlamada temel bir rol oynar ve ses seviyesi ile perde gibi özelliklere dayanarak erkek ve kadın seslerini ayırt edebilir. Erkekler ve kadınlar arasındaki vokal perdedeki önemli farklara katkıda bulunan özelliklerden biri cinsel dimorfizmdir2. Sesten yaş ve cinsiyet sınıflandırması; insan-makine etkileşimi, otomatik cinsiyet tanıma, kişiselleştirilmiş selamlamalar, konuşma duygusu ön sınıflandırması ve cinsiyete dayalı çağrı sınıflandırması dahil olmak üzere çok sayıda uygulama için önem taşımaktadır3.

Konuşma, insan etkileşiminin ayrılmaz bir parçasıdır. İnsan sesi, bireyler arasında farklılık gösteren ve duygusal ve zihinsel durumların yanı sıra yaş ve cinsiyet hakkında bilgi sağlayabilen birçok özellik içerir. Bu çok boyutlu özellikler, ses tabanlı güvenlik sistemleri ve konuşma odaklı Yapay Zeka (AI) asistanları gibi uygulamalarda kullanılabilir. Ses analizinin önemli olduğu diğer alanlar arasında Otomatik Konuşmacı Doğrulama (ASV) sistemleri ve duygu tabanlı AI sistemleri yer alır. Ses tabanlı giriş sistemleri ayrıca veri tabanlarındaki arama alanını da daraltabilir4,5. Ek olarak, AI tabanlı güvenlik sistemleri, kriminal soruşturmalar ve mağdur koruması gibi uygulamalar için ses verilerini kullanabilir. Erkek ve kadın sesleri, vokal kanalın rezonans özelliklerindeki farklılıklar nedeniyle farklı karakteristikler sergiler. Bu özellikler, konuşma sinyallerinden hesaplamalı işlemeye uygun bir formda çıkarılabilir ve böylece ses verilerinden cinsiyet sınıflandırması yapılabilir6,7. Bu nedenle, ses tabanlı cinsiyet sınıflandırması için etkili öğrenme algoritmalarına ihtiyaç duyulmaktadır. Derin Öğrenme (DL) algoritmaları, ses verilerinden karmaşık kalıpları öğrenebilme yetenekleri sayesinde özellikle konuşmayla ilgili sınıflandırmalar için oldukça uygundur. Bu modeller, mimariye bağlı olarak evrişimli, yinelemeli, zamansal-evrişimli veya tam bağlantılı katmanlar içerebilir. Bu katmanlar, ton ve perde dahil olmak üzere ilgili akustik özellikleri öğrenebilir. Eğitildikten sonra bir model, daha önce görülmemiş ses kayıtlarından cinsiyet sınıflandırması yapabilir8. Makine Öğrenmesi (ML) araştırmalarının bir diğer önemli alanı ise ses kayıtlarından yaş sınıflandırmasıdır. ML algoritmaları, yaşla ilgili kalıpları tanımlamak için perde, tını ve genlik gibi akustik özellikleri kullanabilir. Konuşma verilerinden bilgilendirici kalıplar çıkarmak ve potansiyel olarak sınıflandırma performansını artırmak için Temel Bileşen Analizi (PCA) gibi teknikler de uygulanabilir9.

DL; görüntü, duygu ve konuşma tanıma gibi uygulamalarda güçlü bir performans sergilemiştir. Özellikle Derin Sinir Ağları (DNN'ler), konuşma ile ilgili görevlerde yaygın olarak kullanılmaktadır. Bu çalışmada, DL tabanlı yaklaşımlar, yerleşik özellik çıkarma teknikleriyle kombinasyon halinde ses sınıflandırmasına uygulanmıştır. Mel-Frekans Cepstral Katsayıları (MFCC'ler), konuşma sinyallerinin ilgili spektral özelliklerini yakalar ve sonraki işlemler için verimli bir temsil sağlar. Çıkarılan özellikler daha sonra ses tabanlı cinsiyet ve yaş sınıflandırması için bir transfer öğrenme çerçevesine entegre edilmiştir10,1.

Son çalışmalar, konuşmacı öznitelik sınıflandırması için giderek daha fazla öz-denetimli ve Transformer tabanlı konuşma temsillerini benimsemiştir. Araştırmacılar, HuBERT ve wav2vec 2.0 gibi öz-denetimli konuşma modellerindeki cinsiyet ve yaş önyargıları da dâhil olmak üzere demografik önyargıları incelemiş ve hakkaniyet odaklı değerlendirmenin önemini vurgulamışlardır12. Daha yakın zamanda, Transformer tabanlı dil bağımsız yaklaşımlar, çok dilli ve gürültülü koşullar altında cinsiyet tanıma için öğrenilmiş bağlamsal konuşma temsillerinin etkinliğini kanıtlamıştır13. Sinha ve arkadaşları, yaş ve cinsiyet sınıflandırması için katman bazlı wav2vec 2.0 temsillerini daha ayrıntılı incelemiş ve farklı Transformer katmanlarının konuşmacı ile ilgili bilgilerin farklı seviyelerini yakaladığını göstermiştir14. Bu gelişmeler; geleneksel MFCC tabanlı spektral bilgileri, çok dilli ve Sorumlu Yapay Zekâ mülahazalarını bünyesine katarak bağlamsal wav2vec 2.0 temsilleriyle birleştiren önerilen VoiceNet-RAI çerçevesine temel oluşturmaktadır.

Güncel çalışmalar, konuşmacı yaşının ve cinsiyetinin hem geleneksel akustik özellikler hem de derin öğrenme tabanlı temsiller kullanılarak karakterize edilebileceğini göstermiştir. Akustik ve zamansal bilgileri birleştiren yaklaşımlar, tamamlayıcı konuşma özelliklerinin yaş ve cinsiyet sınıflandırma performansını artırabileceğini ortaya koymuştur15,16. İlgili araştırmalar ayrıca, derin darboğaz (bottleneck) temsilleri kullanılarak oluşturulan dönüştürülmüş konuşma özelliklerinin, konuşmacı yaşı ve cinsiyet sınıflandırma performansını iyileştirebileceğini göstermiştir17. Bu bulgular, konuşma ve konuşma kaynaklı sinyalleri içeren sınıflandırma görevleri için spektral, zamansal ve öğrenilmiş temsillerin daha geniş çaplı kullanımını desteklemektedir.

Makine öğrenimi ve derin öğrenme yaklaşımları kullanılarak konuşmadan yaş ve cinsiyet tanınması üzerine çeşitli çalışmalar yapılmıştır18,19,20,21,2,23,24,25,26,27,28,29,30. Daha güncel yaklaşımlar, konuşmacı yaş ve cinsiyet sınıflandırması için dönüştürülmüş MFCC temsillerini ve derin sinir ağlarını araştırmışken31, dayanıklı ses tabanlı demografik sınıflandırma sistemleri geliştirirken çok dilli ve dile bağlı değişkenlik önemli hususlar olmaya devam etmektedir. Telaffuz, fonetik yapı, konuşmacı özellikleri ve kayıt koşullarındaki farklılıklar, modellerin farklı diller ve popülasyonlar arasındaki genellenebilirliğini azaltabilir. Buna bağlı olarak, tamamlayıcı spektral ve bağlamsal konuşma temsillerinin kullanımı, çok dilli ortamlarda dayanıklılığı artırabilir.

Hibrit yaklaşımlar daha önce ses tabanlı demografik tanıma için birden fazla akustik özelliği veya topluluk sınıflandırıcılarını birleştirmiş olsa da, VoiceNet-RAI, tek bir çerçeve içinde iki tamamlayıcı konuşma temsili seviyesini entegre ederek farklılık göstermektedir. Spesifik olarak, geleneksel MFCC özellikleri yerelleştirilmiş spektral ve vokal özellikleri korurken, wav2vec 2.0 bir Transformer kodlayıcı kullanarak ham konuşmadan öğrenilen bağlamsal temsiller sağlar. VoiceNet-RAI, yalnızca el yapımı akustik tanımlayıcılara veya tek bir derin temsile güvenmek yerine, zamansal olarak toplulaştırılmış MFCC ve wav2vec 2.0 temsillerinin özellik düzeyinde füzyonunu gerçekleştirir ve ardından ortaya çıkan hibrit temsili EfficientNet-Lite kullanarak rafine eder. Dolayısıyla bilimsel yenilik; cinsiyet ve yaş sınıflandırması için spektral, öz-denetimli bağlamsal ve hafif derin temsillerin koordineli entegrasyonunun yanı sıra çok dilli değerlendirme, bağımsız veri seti doğrulaması ve alt grup hakkaniyet analizinde yatmaktadır. Bu kombinasyon, geleneksel hibrit konuşma sınıflandırma süreçlerini, yalnızca doğruluk odaklı özellik füzyonunun ötesine taşıyarak; temsil tamamlayıcılığını, hafif model tasarımını, genelleştirilebilirliği ve Sorumlu Yapay Zeka'yı (Responsible AI) eş zamanlı olarak değerlendiren bir çerçeveye dönüştürmektedir.

Bu araştırmanın temel katkıları arasında, MFCC ve wav2vec 2.0 özniteliklerinin EfficientNet-Lite ile entegrasyonu yoluyla ses verilerinden cinsiyet ve yaş tespiti yapmak için bir yaklaşımın geliştirilmesi yer almaktadır. 28 farklı dildeki ses kayıtlarından oluşan bir veri seti üzerinde kapsamlı deneyler yürütülmüş; orijinal öznitelikler, MFCC öznitelikleri, wav2vec 2.0 öznitelikleri ve bunların kombinasyonları ML ve DL modelleriyle değerlendirilmiştir. Model performansı, hem tam çok dilli veri seti hem de İngilizce alt küme kullanılarak analiz edilmiştir. Çerçeve ayrıca, cinsiyet ve dile özel alt grup analizleri, konuşmacıdan bağımsız değerlendirme ve Mozilla Common Voice veri seti kullanılarak yapılan doğrulama yoluyla çok dilli ve Sorumlu Yapay Zeka perspektiflerinden değerlendirilmiştir. Ek olarak, önerilen çerçevenin performansı mevcut literatürde bildirilen güncel yaklaşımlarla karşılaştırılmış ve çapraz doğrulama sonuçları sunulmuştur. İlgili konuda çok sayıda araştırma yürütülmüştür ve Tablo 1 , modelleri, veri setlerini ve bildirilen sonuçları içerecek şekilde bu çalışmaları özetlemektedir19,20,21,2,23,24,25,26,27,28,29,30,31.

Protokol

Bu çalışmada, doğrudan katılımcı katılımı olmaksızın halka açık BVC Challenging Voice Set ve Mozilla Common Voice veri kümeleri kullanılmıştır. Bu nedenle, kurumsal etik onay ve ek bilgilendirilmiş onam gerekmemiştir. Yalnızca cinsiyet ve yaş sınıflandırması için gerekli olan veriler işlenmiş ve bireysel konuşmacıların kimliklerini belirleme girişimi yapılmamıştır. Önerilen çerçevenin eksiksiz iş akışı metodolojisi Şekil 1'de paylaşılmıştır.

Veri toplama

Önerilen yaklaşımda kullanılan veri seti, Biometrics Vision and Computing (BVC) grubu tarafından geliştirilen ve GitHub'da barındırılan, kamuya açık bir ses veri seti olan BVC Challenging Voice Set'ten elde edilen .wav ses dosyalarından oluşmaktadır32. Veri seti, 36 erkek ve 190 kadın konuşmacı dahil olmak üzere 526 bireyden alınan ses kayıtlarını içermektedir. Her konuşmacıdan alınan tek ve çok cümleli kayıtlar dahil olmak üzere toplamda yaklaşık 3.964 kayıttan meydana gelmiştir. Tablo 2, önerilen VoiceNet-RAI çerçevesindeki konuşma veri setleri için kullanılan demografik özellikleri, dil kapsamını, kayıt özelliklerini, veri bölme stratejisini ve ön işleme ayarlarını özetlemektedir.

Öznitelik çıkarımı

Temel özelliklerin çıkarılması için ses dosyaları işlenmiş ve bu özellikler daha sonra bir CSV dosyasında saklanmıştır. Yaş, cinsiyet ve konuşmacı telaffuzu dahil olmak üzere üst veriler, ilgili README dosyalarından çıkarılmıştır. WAV dosyalarını işlemek ve ilgili özellikleri çıkarmak için Python ve SciPy paketi kullanılmıştır. Ses sinyallerini zaman domeninden frekans domenine dönüştürmek için NumPy’nin Hızlı Fourier Dönüşümü (FFT) ve frekans fonksiyonları kullanılmıştır. WAV dosyaları genliği zamanın bir fonksiyonu olarak temsil etmekteydi; ancak sınıflandırma görevi için erkek ve kadın seslerini ayırt edebilecek frekansla ilgili özellikler daha büyük önem taşımaktaydı3.

Ses sinyallerini frekans alanı temsillerine dönüştürmek için, FFT algoritması kullanılarak Ayrık Fourier Dönüşümü (DFT) uygulandı. Fourier dönüşümü, bir zaman alanı sinyalini frekans spektrumuna dönüştürür. Bu spektrum zamansal bilgiyi korumadığı için, ses sinyali örtüşen segmentlere ayrıldı ve her bir segmente Kısa Süreli Fourier Dönüşümü (STFT) yaklaşımı kullanılarak Fourier dönüşümü uygulandı. np.fft.fft fonksiyonu karmaşık frekans spektrumunu oluştururken, np.fft.fftfreq karşılık gelen örnekleme frekanslarını sağladı. Örnek dizinde, tek bir konuşmacı için 10 ses dosyası mevcuttu. Baskın frekansları çıkarmak için her bir WAV dosyası 20 ms'lik kayan pencereler kullanılarak işlendi. Örneğin, 4 saniyelik bir ses kaydı 20 frekans değerinden oluşan bir liste üretti. 10 kayıt içeren bir dizin için, her biri 20 frekans değeri içeren 10 karşılık gelen liste, listelerin bir listesi şeklinde birleştirildi. Frekanslar, 20 Hz ile 280 Hz arasındaki değerleri korumak için filtrelenirken, 50 Hz civarındaki potansiyel gürültüler hariç tutuldu.

Hibrit MFCC ve wav2vec 2.0 öznitelik temsili

Hem üst düzey bağlamsal konuşma temsillerini hem de alt düzey akustik özellikleri yakalamak için bu çalışmada, MFCC özelliklerini Transformer tabanlı wav2vec 2.0 gömmeleriyle entegre eden hibrit bir özellik çıkarma stratejisi uygulanmıştır.

MFCC öznitelik çıkarımı

Mel-Frekans Cepstral Katsayıları (MFCC'ler), özellikle konuşma tanıma ve konuşmacı kimliklendirme gibi uygulamalar için konuşma ve ses sinyali işlemede yaygın olarak kullanılan özelliklerdir34,35. Bu çalışmada MFCC çıkarımı, ses sinyallerini konuşmanın algısal olarak ilgili özelliklerini temsil eden özellik vektörlerine dönüştürmüştür. İşlem, yüksek frekanslı bileşenleri geliştirmek için ön-vurgulama ile başlamış, ardından sinyali kısa ve örtüşen çerçevelere bölmek için çerçeveleme ve pencereleme işlemleri uygulanmıştır. Her bir ses örneği önce 16 kHz değerine yeniden örneklendirilmiş ve 10-ms örtüşmeli 25-ms'lik çerçevelere bölünmüştür. Daha sonra, sinyali zaman düzleminden frekans düzlemine dönüştürmek için her bir çerçeveye Hızlı Fourier Dönüşümü uygulanmıştır.

Elde edilen frekans spektrumu, insan işitsel algısının doğrusal olmayan frekans yanıtını taklit eden bir dizi Mel filtre bankasından geçirilmiştir. Bu filtre bankaları, daha az bilgi içeren frekansların katkısını azaltırken algısal olarak daha ilgili frekansları vurgulamıştır. Ardından, insan işitmesinin ses şiddetine karşı logaritmik duyarlılığını taklit etmek amacıyla her bir filtre bankası çıktısının logaritması hesaplanmıştır. Katsayıları dekorele etmek ve ses sinyalinin kompakt bir temsilini oluşturmak için logaritmik filtre bankası enerjilerine Ayrık Kosinüs Dönüşümü (DCT) uygulanmıştır. MFCC'ler olarak bilinen sonuç katsayılar, konuşmanın önemli spektral özelliklerini yakalamıştır. MFCC'ler, sesleri bu özelliklere göre ayıran akustik karakteristikleri yakaladıkları için cinsiyet ve yaş sınıflandırması için kullanılmıştır.

wav2vec 2.0 gömme çıkarma

wav2vec 2.0 Base modeli, büyük ölçekli etiketlenmemiş konuşma korpusları üzerinde önceden eğitilmiştir. Model, ham dalga formu girdilerini işleyen ve bağlamsallaştırılmış konuşma gömmeleri (embeddings) üreten çok katmanlı bir Transformer kodlayıcısından oluşmaktadır36.

Girdi dalga formu x ∈ RT verildiğinde, wav2vec 2.0 modeli bir dizi gizli temsil üretmiştir:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

burada her bir gömme vektörü 768 boyutluluğa sahipti. Sınıflandırma için uygun, sabit uzunlukta bir temsil elde etmek amacıyla, tüm zaman adımları boyunca zamansal ortalama havuzlama işlemi uygulandı.

figure-protocol-1   (2)

Öznitelik füzyon mekanizması

MFCC ve wav2vec 2.0 özellikleri, özellik düzeyinde birleştirme (concatenation) yoluyla harmanlanmıştır. Özellikle MFCC özellikleri, sabit uzunlukta bir vektör oluşturmak için öncelikle zamansal ortalama kullanılarak toplanmıştır.

m ∈ R40  (3)

Nihai hibrit özellik vektörü şu şekilde elde edilmiştir:

h = [m || zpooled] ∈ R808  (4)

burada || birleştirmeyi ifade eder. Bu füzyon, derin bağlamsal gömmeleri el yapımı spektral özelliklerle birleştirerek modelin hem üst düzey semantik bilgileri hem de ince taneli akustik örüntüleri yakalamasına olanak tanımıştır.

Tüm ses örnekleri önce 16 kHz değerine yeniden örneklendi. MFCC özellikleri çerçeve bazlı olarak hesaplandı ve sabit 40 boyutlu bir vektör üretmek için zamansal olarak ortalamaları alındı; wav2vec 2.0 gömmeleri ise 768 boyutlu bir temsil oluşturmak için zaman boyunca ortalama havuzlama (mean-pooling) işlemine tabi tutuldu. Her iki özellik seti de füzyondan önce sabit uzunluktaki vektörlere dönüştürüldüğü için çerçeve düzeyinde zamansal hizalamaya gerek duyulmadı. Elde edilen MFCC ve wav2vec temsilleri, sınıflandırma modeline aktarılmadan önce 808 boyutlu hibrit bir özellik vektörü şeklinde birleştirildi.

EfficientNet-Lite ile Entegrasyon

Birleştirilmiş öznitelik vektörü, h, öznitelik öğrenimine uygun bir formata yeniden şekillendirilmiş ve eğitim için EfficientNet-Lite modeline girdi olarak sağlanmıştır. Tam bağlı bir projeksiyon katmanı, önce 808 boyutlu vektörü daha yüksek boyutlu bir gizli uzaya eşlemiş, ardından EfficientNet-Lite blokları hiyerarşik öznitelikleri rafine etmiştir. Aşırı öğrenmeyi azaltmak ve model genellemesini iyileştirmek için toplu normalizasyon (batch normalization) ve dropout katmanları kullanılmıştır. Cinsiyet ve yaş sınıfları için nihai tahmin olasılıklarını üretmek amacıyla SoftMax aktivasyon fonksiyonu kullanılmıştır. Birleştirilmiş temsil, h ∈ R808, başlangıçta tek boyutlu bir öznitelik vektörü olarak ele alınmış ve onu 4.096 boyuta eşleyen tam bağlı bir projeksiyon katmanından geçirilmiştir. Projekte edilen temsil, EfficientNet-Lite mimarisine sunulmadan önce 1 × 64 × 64 boyutunda bir tensöre yeniden şekillendirilmiştir.

Geleneksel üç kanallı görüntü girişi yerine tek kanallı konuşma özelliği temsilcisine uyum sağlamak amacıyla, orijinal EfficientNet-Lite giriş evrişimli katmanı üç giriş kanalından bir giriş kanalına değiştirilmiştir. Geri kalan EfficientNet-Lite özellik çıkarma blokları, büyük mimari değişiklikler yapılmadan korunmuştur. Sabit uzunlukta bir temsil üretmek için son özellik haritalarına adaptif bir küresel ortalama havuzlama katmanı uygulanmıştır. Orijinal sınıflandırma başlığı, cinsiyet sınıflandırması için iki çıkış birimi ve önceden tanımlanmış yaş grupları için ilgili sayıda çıkış birimi içeren göreve özgü tam bağlantılı bir katmanla değiştirilmiştir. Son olarak, sınıf olasılıklarını oluşturmak için SoftMax aktivasyon fonksiyonu uygulanmıştır. Önerilen hibrit temsil, modern öz-denetimli konuşma gömmelerini geleneksel sinyal işleme özellikleriyle birleştirmiştir. wav2vec 2.0 gömmeleri bağlamsal bilgileri ve uzun menzilli bağımlılıkları yakalarken, MFCC özellikleri tamamlayıcı düşük seviyeli akustik bilgiler sağlamıştır. Bu temsillerin entegrasyonu, özellikle gürültülü ve çok dilli konuşma koşulları altında sınıflandırma performansını artırmıştır.

ML Sınıflandırıcı

Bu araştırmada, ses tabanlı cinsiyet ve yaş grubu sınıflandırması için birden fazla ML algoritmasının performansı analiz edilmiştir.

Rastgele Orman (Random Forest)

Tahmin doğruluğunu artırmak ve aşırı öğrenmeyi (overfitting) azaltmak için birden fazla Karar Ağacını (DT) birleştiren Random Forest (RF), güçlü bir Makine Öğrenmesi (ML) sınıflandırıcısı olarak kullanılmıştır. RF, nihai tahmini oluşturmak için birden fazla ağaçtan gelen tahminlerin toplandığı bir topluluk öğrenme (ensemble-learning) prosedürü aracılığıyla çalışmıştır37,38. Bu yaklaşım, RF'nin verilerdeki çeşitli örüntüleri yakalamasını sağlarken, tekil DT'lerle yaygın olarak ilişkilendirilen aşırı öğrenmeyi azaltmıştır. Ağaç kurulumu sırasında getirilen rastgelelik modelin genellenebilirliğini artırarak RF'yi ses verilerinden cinsiyet ve yaş sınıflandırması gibi sınıflandırma görevleri için uygun hale getirmiştir.

Lojistik Regresyon

Sınıflandırma için istatistiksel bir ML modeli olarak Lojistik Regresyon (LR) kullanılmıştır39. İkili sınıflandırmada LR, lojistik (sigmoid) fonksiyonunu kullanarak girdi özelliklerine dayalı bir sonucun olasılığını tahmin eder ve elde edilen olasılıklar sınıf tahminleri oluşturmak için kullanılır. LR ayrıca ikiden fazla sınıf içeren çok sınıflı sınıflandırma problemleri için de uygulanabilir durumdadır. Çok sınıflı sınıflandırma için LR, sınıflandırma ortamına bağlı olarak one-vs-rest veya SoftMax regresyonu gibi yaklaşımlar kullanmıştır.

Ekstra Ağaç Sınıflandırıcı

Tahminler oluşturmak için birden fazla DT'yi birleştiren bir topluluk öğrenme algoritması olarak Extra Trees Classifier (ETC) kullanılmıştır40,41. RF'den farklı olarak ETC, ağaç oluşturma sırasında aday özellikleri ve bölme eşiklerini rastgele seçerek ek bir rastgelelik getirir. Bu prosedür, birbiriyle daha az ilişkili ağaçlar oluşturmuş ve modelin bireysel özelliklere olan hassasiyetini azaltarak gürültüye karşı dayanıklılığı artırmıştır. Özellik önemini değerlendirmek ve verileri bölümlere ayırmak için bölme kriteri olarak Gini indeksi kullanılmıştır.

Destek Vektör Makinesi

Yüksek boyutlu bir özellik uzayında optimal bir karar sınırı belirlemek için bir ML sınıflandırıcısı olarak Destek Vektör Makinesi (SVM) kullanılmıştır42. Amaç, sınıflar arasındaki marjı maksimize eden bir hiper düzlem belirlemekti. Karar sınırı ile en yakın veri noktaları arasındaki daha geniş bir marj, genellikle daha iyi sınıf ayrımı ve genelleme sağlar. SVM; sınıflandırma, regresyon ve özellik tabanlı veri analizi dahil olmak üzere çeşitli ML görevlerinde uygulanabilir durumdadır.

Evrişimli Sinir Ağları

Görüntü ve ses verilerinin yapılandırılmış temsillerini içeren sınıflandırma görevleri için Derin Öğrenme (DL) modelleri olarak Evrişimli Sinir Ağları (CNN'ler) kullanılmıştır. Tek boyutlu CNN'ler (1D-CNN'ler) ayrıca sıralı ve metinsel verilere de yaygın olarak uygulanmıştır. CNN mimarileri, girdi verilerinden ayırt edici özellikler çıkarmak için evrişimli filtreler ve havuzlama işlemleri kullanmıştır43,4. Ses verilerinden cinsiyet ve yaş sınıflandırması yapmak için CNN'ler, perde, frekans, ton ve cinsiyet ile yaş gruplarını ayırt etmede ilgili diğer vokal özelliklerle ilişkili kalıpları öğrenmek amacıyla konuşmadan türetilen temsilere uygulanmıştır.

VGG19

Derin, nispeten tekdüze bir hiyerarşik özellik çıkarma yapısıyla karakterize edilen bir DL mimarisi olarak VGG19 kullanılmıştır45. Mimarisi, 19 katman boyunca küçük 3 × 3 konvolüsyonel filtreler kullanarak ayırt edici özelliklerin aşamalı olarak çıkarılmasını sağlamıştır. Konuşma kaynaklı temsillere uygulandığında VGG19, hem perde ve frekans varyasyonları gibi düşük seviyeli akustik örüntüleri hem de daha yüksek seviyeli ayırt edici özellikleri yakalamıştır. Derin mimarisi, cinsiyet ve yaşla ilişkili vokal özelliklerin modellenmesi için aşamalı özellik soyutlamasına olanak tanımıştır.

EfficientNet-Lite

Hesapsal olarak verimli bir DL mimarisi olarak EfficientNet-Lite kullanılmıştır46,47. Model, daha ağır DL mimarilerine kıyasla daha az hesaplama kaynağı gerektirirken güçlü bir sınıflandırma performansı elde etmek için dengeli bir ölçeklendirme stratejisi uygulamıştır. Bileşik ölçeklendirme yaklaşımı, verimli özellik çıkarımı sağlamak amacıyla model derinliğini, genişliğini ve giriş çözünürlüğünü birlikte değerlendirmiştir.

Hafif mimarisi, sınıflandırma performansı ve model karmaşıklığı arasındaki uygun dengesi nedeniyle, önerilen VoiceNet-RAI çerçevesi için EfficientNet-Lite seçilmiştir. Daha ağır mimarilerle karşılaştırıldığında, daha az parametre ve daha düşük hesaplama gereksinimleriyle etkili özellik öğrenimi gerçekleştirmek için verimli konvolüsyonel bloklar ve bileşik ölçeklendirme kullanmıştır. Bu özellikler, EfficientNet-Lite'ı önerilen konuşma sınıflandırma çerçevesi için uygun hale getirmiş ve kaynak kısıtlı ortamlarda dağıtım potansiyeli sağlamıştır.

MobileNet

MobileNet, mobil ve uç hesaplama ortamları dahil olmak üzere sınırlı hesaplama kaynaklarına sahip uygulamalar için hafif bir DL mimarisi olarak kullanılmıştır48. Hesaplama verimliliği, temel olarak, geleneksel evrişimli mimarilere kıyasla parametre sayısını ve hesaplama işlemlerini azaltan derinlemesine ayrıştırılabilir evrişimler (depthwise separable convolutions) aracılığıyla sağlanmıştır. Bu özellikler, MobileNet'i nispeten düşük hesaplama gereksinimlerini korurken ses verilerinden cinsiyet ve yaş sınıflandırmasını değerlendirmek için uygun hale getirmiştir.

InceptionV3

Konuşma kaynaklı temsillerden hiyerarşik özellikler çıkarmak için derin bir mimari olarak InceptionV3 kullanılmıştır49. Mimari, farklı soyutlama seviyelerinde özellikler çıkarmak için evrişimli, havuzlama ve karma işlemleri içermiştir. Ses verilerinden cinsiyet ve yaş sınıflandırması için InceptionV3, vokal özelliklerdeki varyasyonlarla ilişkili karmaşık akustik örüntüleri ve hiyerarşik temsilleri öğrenmek amacıyla kullanılmıştır.

Değerlendirme parametreleri

Doğruluk, sınıflandırma görevleri için en sık kullanılan değerlendirme metriklerinden biriydi50. Doğruluk, genel sınıflandırma performansı için yararlı bir ölçüm sağlasa da, özellikle dengesiz veri kümeleri için her zaman kapsamlı bir değerlendirme sunmuyordu. Bu nedenle, model performansını değerlendirmek için kesinlik, duyarlılık ve F1-skoru dahil olmak üzere ek metrikler kullanıldı. Bu metrikler, her sınıf için doğru ve yanlış tahminleri dikkate alarak daha kapsamlı bir değerlendirme sağladı.

Doğruluk, doğru sınıflandırılan gözlemlerin toplam gözlem sayısına oranı olarak tanımlanmıştır. Doğruluk, özellikle dengeli veri setleri için bilgilendirici olsa da, bu çalışmada kullanılan veri seti dengesizdir. Bu nedenle, sınıflandırma metrikleri hesaplanırken ve yorumlanırken Doğru Pozitifler (TP), Yanlış Pozitifler (FP), Doğru Negatifler (TN) ve Yanlış Negatifler (FN) dikkate alınmıştır. Aşağıdaki denklem, doğruluğun standart tanımını temsil etmektedir:

Doğruluk =  (TP+TN)/(TP+TN+FP+FN)×10  (5)

Hassasiyet (precision), sınıflandırıcıların yalnızca ilgili örnekleri döndürme yeteneğini değerlendir:

Hassasiyet=  TP/(TP+FP)  ×10   (6)

Hassasiyet olarak da bilinen geri çağırma (recall), sınıflandırıcının ilgili tüm örnekleri tanımlama yeteneğini ölçer:

Duyarlılık (Recall)=  TP/(FN+TP) × 10   (7)

F1-skoru, kesinlik (precision) ve duyarlılığı (recall) tek bir ölçüde birleştirir ve özellikle dengesiz veri setlerinde sınıflandırma performansını değerlendirmek için kullanışlıdır:

F1-Skoru =2 ×(PPV ×TPR)/(TPR+PPV) × 10   (8)

Sonuçlar

Yaş ve cinsiyet sınıflandırmasına ilişkin deneysel sonuçlar, ML ve DL modelleri ile MFCC tabanlı ve hibrit öznitelik temsilleri kullanılarak değerlendirilmiştir. Veri seti, %80'i eğitim ve %20'si test için kullanılacak şekilde 80:20 oranında eğitim ve test setlerine ayrılmıştır. Aynı konuşmacıya ait kayıtların her iki sette de yer almasını önlemek amacıyla konuşmacı düzeyinde bölümlendirme uygulanmıştır.

Önerilen çerçevenin hiperparametreleri ve uygulama detayları Tablo 3'te özetlenmiştir. Deneyler; Intel i7-8265U CPU, 16 GB RAM ve Windows 1 çalıştıran bir NVIDIA Tesla K80 GPU ile donatılmış bir sistemde gerçekleştirilmiştir. ML modellerini geliştirmek için Python ve Scikit-learn kütüphanesi kullanılırken, önerilen DL çerçevesi PyTorch kullanılarak uygulanmıştır. Bu modeller, ses verilerinden cinsiyet ve yaş sınıflandırması için değerlendirilmiştir.

Adam optimize edici; 1 × 10⁻4 başlangıç öğrenme hızı, β₂ = 0.9 ve ε = 1 × 10⁻8 değerleri ile kullanılmıştır. 64'lük bir yığın boyutu ve maksimum 50 epoch kullanılmış; aşırı öğrenmeyi azaltmak için erken durdurma parametresi dört epoch sabır süresine ayarlanmıştır. Düzenleme amacıyla, tam bağlantılı katmanlara 0.3 oranında dropout uygulanmıştır. Sınıflandırma görevleri için kayıp fonksiyonu olarak kategorik çapraz entropi kullanılmıştır. Doğrulama kaybını izlemek için ReduceLROnPlateau öğrenme hızı zamanlayıcısı kullanılmıştır.

Veri sızıntısını önlemek ve adil bir değerlendirme sağlamak amacıyla, hiçbir konuşmacının hem eğitim hem de test kümelerinde yer almaması için konuşmacı düzeyinde ayırma işlemi uygulanmıştır. Ayrıca, önerilen modelin genellenebilirliğini ve sağlamlığını değerlendirmek için beş katlı çapraz doğrulama gerçekleştirilmiştir.

Orijinal veri setini kullanan modellerin sonuçları

Tablo 4, MFCC özellikleri olmadan, 28 dilden oluşan bir veri kümesi üzerinde cinsiyet sınıflandırması için birkaç ML ve DL modelinin performansını sunmaktadır. Değerlendirme metrikleri olarak kesinlik, duyarlılık, F1-skoru ve doğruluk kullanılmıştır.

Değerlendirilen modeller arasında EfficientNet-Lite %83,48 ile en yüksek doğruluğu, %82,87 kesinliği, %84,28 duyarlılığı ve %83,54 F1-skorunu elde etmiştir. MobileNet ve InceptionV3 de iyi performans göstermiş; MobileNet %81,3 doğruluk ve %83,1 F1-skoru, InceptionV3 ise %80,7 doğruluk ve %82,52 F1-skoru elde etmiştir. CNN modeli %75,71 doğruluk ve %7,43 F1-skoru elde ederken, ResNet %74,37 doğruluk ve %75,54 F1-skoru elde etmiştir. SVM, RF, LR ve ETC, %71,42 ile %73,59 arasında değişen doğruluk oranları ve %72,48 ile %74,34 arasında değişen F1-skorları elde etmiştir. VGG19, %75,07 duyarlılık ve %74,17 F1-skoru ile nispeten daha düşük olan %70,56 doğruluğu elde etmiştir. Genel olarak, orijinal öznitelikler kullanıldığında değerlendirilen modeller arasında EfficientNet-Lite ve MobileNet en güçlü performansı sergilemiştir.

MFCC özelliklerini kullanan modellerin sonuçları

MFCC özellikleri daha sonra cinsiyet sınıflandırması için değerlendirildi. Tablo 5, 28 dilden oluşan veri seti üzerinde MFCC özellikleri kullanan ML ve DL modellerinin performansını karşılaştırmaktadır.

EfficientNet-Lite; %92,64 doğruluk, %93,79 kesinlik, %94,92 duyarlılık ve %94,84 F1-skoru ile en yüksek performansı göstermiştir. MobileNet %91,39 doğruluk ve %91,07 F1-skoruna ulaşırken, InceptionV3 %90,24 doğruluk ve %89,83 F1-skoru elde etmiştir. ResNet %89,43 doğruluk ve %83,67 F1-skoru, CNN ise %8,60 doğruluk ve %87,35 F1-skoru elde etmiştir. VGG19 %87,48 doğruluk ve %85,58 F1-skoruna ulaşmıştır.

Geleneksel ML modelleri arasında SVM %85,47 doğruluk ve %84,29 F1-skoru; RF %84,57 doğruluk ve %87,42 F1-skoru; LR %83,25 doğruluk ve %84,98 F1-skoru; ve ETC %83,59 doğruluk ve %85,43 F1-skoru elde etmiştir. Genel olarak, MFCC özelliklerinin dahil edilmesi, orijinal özellikler kullanılarak elde edilen sonuçlarla karşılaştırıldığında çoğu modelin performansını artırmıştır. Bu deneyde en yüksek genel performansı EfficientNet-Lite göstermiştir.

İngilizce dil veri seti ile hibrit MFCC–wav2vec 2.0 özellikleri kullanan modellerin sonuçları

Bir sonraki deney seti, İngilizce dil alt kümesi üzerinde hibrit MFCC–wav2vec 2.0 öznitelik gösterimini kullanarak cinsiyet sınıflandırmasını değerlendirmiştir. Değerlendirilen modellerin performansı Tablo 6'da sunulmuştur. EfficientNet-Lite; %97,87 doğruluk, %98,61 kesinlik, %98,70 duyarlılık ve %98,65 F1-skoru ile en yüksek performansı göstermiştir.

Geleneksel ML modelleri arasında SVM %92,58 doğruluk ve %91,52 F1-skoru elde etmiştir; ETC %91,49 doğruluk ve %92,79 F1-skoru elde etmiştir; LR %90,64 doğruluk ve %91,34 F1-skoru elde etmiştir; RF ise %8,36 doğruluk ve %90,86 F1-skoru elde etmiştir. Genel olarak modeller, İngilizce dilindeki alt kümede güçlü bir performans sergilemiş ve raporlanan değerlendirme metrikleri genelinde en yüksek değerlere EfficientNet-Lite ulaşmıştır.

Beş katlı çapraz doğrulama sonuçları

Önerilen çerçevenin kararlılığını ve genellenebilirliğini değerlendirmek için beş katlı çapraz doğrulama gerçekleştirilmiştir. İngilizce ses veri kümesi kullanılarak elde edilen çapraz doğrulama sonuçları Tablo 7'de sunulmuştur. EfficientNet-Lite, beş kat boyunca ±0.003'lük bir standart sapma elde etmiştir. Katlar arasındaki düşük değişkenlik, değerlendirilen çapraz doğrulama ayarı altında kararlı bir performans sergilendiğini göstermiştir.

Ses verileri kullanılarak yaş sınıflandırması

Cinsiyet sınıflandırmasına ek olarak, yaş sınıflandırması birden fazla model ve MFCC özellikleri kullanılarak değerlendirilmiştir. Tablo 8, yaş sınıflandırması için değerlendirilen modellerin performansını sunmaktadır.

Sonuçlar, transfer öğrenme modellerinin %85'in üzerinde doğruluk oranlarına ulaştığını göstermiştir; MobileNet %85,23, InceptionV3 ise %86,67 doğruluk elde etmiştir. EfficientNet-Lite, %8,42 doğruluk, %86,56 kesinlik ve %87,21 duyarlılık ile bildirilen en yüksek performansı sergilemiştir.

Önerilen çerçevenin doğrulanması

Önerilen çerçevenin harici bir veri seti üzerinde değerlendirilmesi için Mozilla Common Voice veri seti51 kullanılarak ek deneyler gerçekleştirilmiştir. Veri seti, yaş, cinsiyet ve aksan bilgileri dahil olmak üzere ilgili demografik meta verileri içeren, yaklaşık 50 saatlik kitle kaynaklı konuşma kayıtlarından oluşmaktaydı. Korpus; önceden tanımlanmış eğitim, geliştirme ve test alt kümelerine ayrılmıştır. Ses kayıtları; 16 kHz'e yeniden örnekleme, 40 boyutlu MFCC özelliklerinin çıkarılması ve 768 boyutlu wav2vec 2.0 gömmelerinin oluşturulmasını içeren, birincil deneylerde kullanılan ön işleme hattının aynısı kullanılarak işlenmiştir. VoiceNet-RAI tarafından kullanılan 808 boyutlu hibrit özellik vektörünü üretmek için bu iki temsil birleştirilmiştir. Doğrulama sonuçları Tablo 9'da sunulmuştur.

Hibrit düşük ve yüksek düzey özellik temsiliyle kullanılan EfficientNet-Lite, değerlendirilen diğer modellerden daha yüksek olan %98,27'lik bir cinsiyet sınıflandırma doğruluğu elde etmiştir. ML modelleri arasında RF %90,47, SVM %90,69 ve LR %89,75 doğruluk oranına ulaşmıştır. Diğer DL modelleri arasında ResNet %92,19 doğruluk elde ederken, VGG19 %92,12 doğruluk elde etmiştir. İlgili kesinlik, duyarlılık ve F1-skoru değerleri Tablo 9'da bildirilmiştir.

Öznitelik temsili ve füzyonu üzerine ablasyon çalışması

Önerilen çerçevede kullanılan öznitelik temsillerinin katkısını değerlendirmek için bir ablasyon çalışması yürütülmüştür. Dört konfigürasyon dikkate alınmıştır: ham/orijinal öznitelikler, yalnızca MFCC öznitelikleri, yalnızca wav2vec 2.0 gömmeleri ve önerilen hibrit MFCC–wav2vec 2.0 temsili. Değerlendirilen deneysel kurulumlar arasında en yüksek performansı sergilediği için temsilci model olarak EfficientNet-Lite kullanılmıştır. Ablasyon sonuçları Tablo 10'da sunulmuştur.

Ham özellikler kullanan temel model %83,48 doğruluk oranına ulaşırken, MFCC tabanlı temsil %92,64 doğruluk oranı ve %94,84 F1-skoru elde etmiştir. Hibrit MFCC–wav2vec 2.0 temsili %97,87 doğruluk ve %98,65 F1-skoruna ulaşmıştır. Özdeş İngilizce dil veri bölümleri ve eğitim koşulları altında, hibrit MFCC–wav2vec 2.0 temsili %97,87 doğruluk oranına ulaşmışken, yalnızca MFCC kullanılan temsil için bu oran %92,64 olmuştur.

Her bir öznitelik temsilinin katkısını değerlendirmek amacıyla; özdeş veri bölümleri, eğitim ayarları ve EfficientNet-Lite mimarisi kullanılarak kontrollü deneyler yürütülmüştür. Ham/orijinal öznitelikler, yalnızca MFCC öznitelikleri, yalnızca wav2vec 2.0 gömmeleri ve hibrit MFCC–wav2vec 2.0 temsili bu koşullar altında karşılaştırılmıştır. Bu deneysel tasarım, öznitelik temsillerinin bireysel ve birleşik katkılarını değerlendirmek için kullanılmıştır.

İstatistiksel anlamlılık analizi

Bu karşılaştırmadaki tüm öznitelik konfigürasyonları; aynı İngilizce dil alt kümesi, özdeş konuşmacı düzeyindeki veri bölümleri ve aynı beş çapraz doğrulama katlaması kullanılarak değerlendirilmiştir. Önerilen model; ham öznitelik (97.86 ± 0.23%'ye karşı 83.48 ± 0.24%; t (4) = 384.32, p < 0.01), yalnızca MFCC (97.86 ± 0.23%'ye karşı 92.60 ± 0.32%; t (4) = 131.50, p < 0.01) ve yalnızca wav2vec 2.0 konfigürasyonlarından (97.86 ± 0.23%'ye karşı 95.34 ± 0.24%; t (4) = 126.0, p < 0.001) anlamlı derecede daha yüksek doğruluk elde ederek, MFCC–wav2vec 2.0 füzyonundan kaynaklanan iyileştirmelerin istatistiksel olarak anlamlı olduğunu doğrulamıştır.

Sorumlu yapay zeka hususları ve dağıtım kılavuzları

Ses tabanlı demografik sınıflandırmada Sorumlu Yapay Zeka, öngörücü performansın yanı sıra hakkaniyet, şeffaflık, gizlilik, potansiyel kötüye kullanım ve dağıtımla ilgili risklerin değerlendirilmesini gerektirmiştir. Alt grup analizleri, değerlendirilen cinsiyet ve dil grupları arasındaki performans farklarının ampirik bir değerlendirmesini sağlamış olsa da, hakkaniyet yalnızca benzer sınıflandırma doğruluğu ile kanıtlanamazdı. Bu nedenle, VoiceNet-RAI çerçevesi birden fazla Sorumlu Yapay Zeka perspektifinden değerlendirilmiştir.

Adalet ve yanlılık analizi

Önerilen VoiceNet-RAI çerçevesinin Sorumlu Yapay Zeka özelliklerini değerlendirmek için cinsiyet ve dil alt grupları arasında bir adalet analizi yapılmıştır. Sonuçlar Tablo 11'de sunulmuştur. Cinsiyete dayalı değerlendirme için model performansı, erkek ve kadın konuşmacılar için ayrı analiz edilmiştir. Sonuçlar, değerlendirilen cinsiyet grupları arasında doğruluk ve F1-skorunda %1,5'ten daha az varyasyon olduğunu göstermiştir.

Dil bazlı değerlendirme için, performans 28 dilden oluşan veri seti içindeki değerlendirilen dil grupları arasında analiz edilmiştir. Sonuçlar, değerlendirilen gruplar arasında doğruluk oranında %2'den daha az bir ortalama varyasyon olduğunu göstermiş; daha az örneğe sahip bazı düşük kaynaklı dillerde ise daha yüksek varyasyonlar gözlemlenmiştir.

Adalet; demografik eşitlik farkı, fırsat eşitliği farkı, Yanlış Pozitif Oranı (FPR) ve Yanlış Negatif Oranı (FNR) kullanılarak daha ayrıntılı şekilde değerlendirilmiştir. Demografik eşitlik farkı, gruplar arasındaki pozitif tahmin oranlarındaki farklılıkları nicelendirirken, fırsat eşitliği farkı Doğru Pozitif Oranlarındaki (TPRs) farklılıkları nicelendirmiştir. FPR ve FNR, alt gruba özgü hata modellerini tanımlamak için kullanılmıştır. Bu metrikler, alt grup düzeyindeki doğruluk ve F1 skorunu tamamlayarak, değerlendirilen demografik ve dilsel gruplar arasındaki model performansı farklılıkları hakkında ek bilgiler sağlamıştır. Değerlendirilen veri seti ve alt grup tanımlamaları altında elde edilen sonuçlar, incelenen cinsiyet ve dil grupları arasında nispeten küçük performans farkları olduğunu göstermiştir. Ancak, bu bulgular değerlendirilen veri setlerinde temsil edilen demografik ve dilsel gruplarla sınırlı kalmış olup, temsil edilmeyen popülasyonlar veya uygulama ortamları genelinde adaleti kanıtlamamıştır.

Açıklanabilirlik ve şeffaflık

VoiceNet-RAI, yorumlanabilir MFCC tabanlı akustik özellikleri bağlamsal wav2vec 2.0 gömmeleriyle birleştirmiştir. Ablasyon çalışması, bireysel ve birleştirilmiş öznitelik temsillerinin katkılarını değerlendirmiştir. Ancak, wav2vec 2.0 gömmelerinin yorumlanması nispeten zor kalmaya devam etmiştir. Bu nedenle, bireysel tahminlere en güçlü katkıyı sağlayan öznitelikleri belirlemek amacıyla gelecekteki çalışmalarda post-hoc açıklama yöntemleri araştırılabilir.

Gizliliğin korunması

Ses kayıtları hassas biyometrik bilgiler içerdiğinden, gizliliği koruyan bir uygulama; yalnızca sınıflandırma görevi için gerekli olan bilgilerin işlenmesini ve ham ses dosyalarının gereksiz yere depolanmasından kaçınılmasını içeren veri minimizasyonu uygulamalarını gerektirmiştir. Güvenli depolama, kontrollü erişim ve yerel çıkarım, gizlilik risklerini daha da azaltabilirdi. Diferansiyel gizlilik de dahil olmak üzere resmi gizlilik koruma yaklaşımları mevcut çalışmada değerlendirilmemiş olup gelecekteki araştırmalar için bir alan olarak kalmıştır.

Sorumlu dağıtım

VoiceNet-RAI'nin konuşlandırılması; insan gözetimi, güven duyarlılıklı karar verme ve sürekli performans izleme gerektirecektir. Düşük güven düzeyindeki tahminler, kritik kararlar için bağımsız olarak kullanılmamalıdır ve konuşlandırma koşulları, eğitim ve doğrulama veri setlerinde temsil edilenlerden önemli ölçüde farklılaştığında model performansı yeniden değerlendirilmelidir.

En güncel tekniklerle karşılaştırma

Önerilen çerçevenin ve daha önce yayınlanmış yaklaşımların karşılaştırmalı bir değerlendirmesi Tablo 12'de sunulmuştur. ML, DL ve transfer öğrenmeye dayalı yaklaşımlar da dahil olmak üzere 2019 ile 2024 yılları arasında yayınlanan çalışmalar dikkate alınmıştır. Karşılaştırma, aynı uygulama alanında daha önce raporlanmış çalışmaları içermiştir. Tablo 12'de gösterildiği üzere, önerilen çerçeve, cinsiyet ve yaş sınıflandırması için karşılaştırılan yaklaşımlardan daha yüksek raporlanmış doğruluk değerleri elde etmiştir. Bununla birlikte, çalışmaların veri setleri, ön işleme prosedürleri, veri bölümleri ve değerlendirme protokolleri açısından farklılık göstermiş olabileceği nedeniyle, karşılaştırma kontrollü bir kafa kafaya deneysel karşılaştırmadan ziyade raporlanan performansı yansıtmaktadır.

VERİ ERİŞİLEBİLİRLİĞİ:

Bu çalışmada kullanılan ham konuşma verileri, GitHub'da barındırılan BVC Challenging Voice Set ve Mozilla Common Voice veri setinden kamuya açık olarak temin edilmiştir. BVC veri setine https://github.com/OgeNI/BVC_Challenging_Voice_Set adresinden, Common Voice veri setine ise https://www.kaggle.com/datasets/mozillaorg/common-voice/data adresinden erişilebilir.

figure-results-1
Şekil 1: Mimari Diyagram. Önerilen çerçevenin eksiksiz iş akışı metodolojisi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.

ReferanslarModellerVeri SetleriSonuçlar
19GBC, DT, RF, SVM, NNVoxForge veri setiGBC 90%
20Robustscalar, PCA ve Lojistik
regresyon, Ardışık model
voice.mozilla.orgArdışık Model 91%.
21CNN, CRNN, TCNMozilla Voice veri seti80% CNN
2, 23Geri yayılım, DT, Bagging,
RF, KNN, DNN, DL
Kaggle, Mozilla Voice veri seti,
Speech Accent Archive
Kaggle: Bagging, KNN ve RF
98.10%. Voice common: Bagging 5.39%. Speech accent: Bagging 78.94%.
24DNN, MLP, KNN, SVC, DT, RF,
SVC RBF çekirdeği, ADA, QDA, GNB, ResNET34 ve ResNET50.
Mozilla Common VoiceResNET50 98.57%.
25ANN, SVM, RF, DT, NB, KNNOGI Kids Speech korpusu, Özel
korpus, Spesifik Veri Seti,
Cinsiyet tespiti için SVM 98%,
Yaş tespiti için RF 95%
26SVM, DA, NB, DT, KNN, Topluluk-
yöntemleri, LightGBM
Mozilla Common Voice, VoxCelebLGBM 91%
27KNN, SVM, LR, SGD, Yığınlanmış
model
Çeşitli cinsiyet kaynaklarıYığınlanmış model 9.64%
28DNN, SVMÇeşitli cinsiyet kaynaklarıSVM 97%
29SVM, RF, CART, KNN3169 örneklik veri setiRF 93%
30CNNNijeryalı denekler veri setiCNN 85.48%.
31DT, RF, KNN, LR, SVM, ANN,
CNN2D
Kaggle'dan 3 veri setiCinsiyet Tahmini: ANN 85.51%,
Yaş Tahmini: ANN 89.20%.

Tablo 1: Modeller, veri setleri ve bildirilen performanslar dahil olmak üzere ses tabanlı cinsiyet ve yaş sınıflandırması üzerine mevcut çalışmaların özeti.

Veri Seti ÖzellikleriAçıklama / Değer
Toplam konuşmacı sayısı526
Erkek konuşmacılar336
Kadın konuşmacılar190
Toplam kayıtlarYaklaşık 3.964
Dil sayısı28
Dil bazlı dağılımİngilizce ve 28 yerel dil (Afemai, Akoko-Edo, Annang,  Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv ve Ukwani. Veri setindeki bu yerel diller arasında baskın olan kabile Igbo'dur.
Yaş gruplarıüç yaş grubu: gençler (gençler ve yirmili yaşlar), yetişkinler (otuzlu, kırklı ve ellili yaşlar) ve yaşlılar (altmışlı, yetmişli ve seksenli yaşlar)
Yaş grubu dağılımıGençler 13–19 yaş Düşük (< %10)Yirmili yaşlar20–29 yaş Çok Yüksek (~%35–45)Otuzlu yaşlar30–39 yaş Yüksek (~%20–30)Kırklı yaşlar40–49 yaş Orta (~%10–15)Ellili yaşlar50–59 yaş Düşük (~%5–10)Altmışlı yaşlar+60–80+ yaş Seyrek (< 5%)  
Kayıt süresi3-10 saniye
Kayıt koşulları16 bit PCM
Orijinal örnekleme hızı4,1 kHz
Örnekleme hızının işlenmesi16 kHz
MFCC çerçeve uzunluğu25 ms
MFCC çerçeve örtüşmesi / adımı10 ms
MFCC temsili39 boyutlu zamansal olarak ortalanmış vektör
wav2vec 2.0 temsilizamansal olarak ortalama havuzlanmış 768 boyutlu vektör
Nihai füzyon temsili807 boyut
Eğitim-test ayrımı80:20
Veri bölümlendirmeKonuşmacıdan bağımsız ayırma
Çapraz doğrulama5 katlı çapraz doğrulama
Harici doğrulama veri setiMozilla Common Voice

Tablo 2: VoiceNet-RAI'de kullanılan konuşma veri setinin demografik özellikleri, dil kapsamı, veri bölümlendirmesi ve ön işleme ayarları.

ParametreDeğer / Açıklama
ÇerçevePyTorch
DonanımNVIDIA GPU (CUDA destekli)
Rastgele tohum42
Optimizasyon AlgoritmasıAdam
Başlangıç Öğrenme Oranı1 × 10−4
β₁ / β₂0.9 / 0.99
Adam epsilon1 × 10⁻⁸
Yığın Boyutu64
Epoklar50 (Erken durdurma sabrı = 8)
Kayıp FonksiyonuKategorik Çapraz Entropi
NormalizasyonZ-skoru normalizasyonu
Öğrenme Oranı ZamanlayıcısıReduceLROnPlateau
Dropout Oranı0.3
Eğitim süresi20min
Çıkarım süresi/örnek13 saniye
Öznitelik ÇıkarımıÖznitelik Çıkarımı
MFCC Katsayıları40
Pencere Boyutu25 ms
Kaydırma (Stride)10 ms
wav2vec VaryantıBase (önceden eğitilmiş) Gömme Boyutu
Havuzlama StratejisiOrtalama havuzlama
Öznitelik FüzyonuBirleştirme (MFCC + wav2vec)
MFCC Katsayıları40
Değerlendirme ProtokolüDeğerlendirme Protokolü
Eğitim-Test AyrımıKonuşmacı düzeyinde ayrım
Çapraz Doğrulama5-Katlı
Veri SetleriMozilla Common Voice (28 dil + İngilizce alt kümesi) ve Voice Challenging Veri Setinden BVC Cinsiyet & Yaş
GörevlerCinsiyet ve Yaş Sınıflandırması

Tablo 3: VoiceNet-RAI için kullanılan eğitim yapılandırması, özellik çıkarma ayarları, hiperparametreler ve değerlendirme protokolü.

ModellerDoğrulukHassasiyetGeri çağırmaF1 skoru
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
Elektron Taşıma Zinciri72.4472.3374.5273.41
SVM (Destek Vektör Makineleri)73.5272.6072.3972.48
Evrişimli Sinir Ağları75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

Tablo 4: MFCC özellikleri olmadan 28 dilli veri kümesini kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.

ModellerDoğrulukHassasiyetGeri çağırmaF1-skoru
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
Elektron Taşıma Zinciri83.5984.2586.3685.43
Destek Vektör Makineleri85.4783.3785.2684.29
Evrişimli Sinir Ağları88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

Tablo 5: 28 dilli veri seti üzerinde MFCC özelliklerini kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.

ModellerDoğrulukKesinlikDuyarlılıkF1-skoru
RF8.3690.9189.9490.86
LR90.6492.2491.3091.34
ETC91.4992.8092.7992.79
SVM92.5892.7590.6491.52
CNN93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
MobileNet96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

Tablo 6: İngilizce dil alt kümesi üzerinde hibrit MFCC–wav2vec 2.0 öznitelik temsili kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.

ModellerDoğrulukHassasiyetGeri çağırmaF1-skoru
İlk katlama97939694
İkinci kat96949695
Üç katlı97949595
Dört katlı96939594
Beş katı97949695
Ortalama96.693.695.694.6

Tablo 7: VoiceNet-RAI'nin İngilizce dil alt kümesi üzerindeki beş katlı çapraz doğrulama performansı.

ModellerDoğrulukKesinlikDuyarlılıkF1-skoru
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite8.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

Tablo 8: ML ve DL modellerinin doğruluk, kesinlik, duyarlılık ve F1-skoru açısından yaş sınıflandırma performansı.

ModellerDoğrulukKesinlikDuyarlılıkF1-skoru
RF90.4792.8290.8591.32
LR89.7590.489.6190.03
ETC92.6391.2991.5591.42
SVM90.6991.8491.8191.82
CNN94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
ResNet92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

Tablo 9: Hibrit MFCC–wav2vec 2.0 özellik temsili kullanılarak Mozilla Common Voice veri kümesi üzerinde cinsiyet sınıflandırması için harici doğrulama sonuçları.

Özellik YapılandırmasıDoğruluk (%)Hassasiyet (%)F1-Skoru (%)
Ham özellikler (MFCC yok)83.4882.8783.54
Sadece MFCC92.6493.7994.84
yalnızca wav2vec 2.095.3496.3295.18
MFCC + wav2vec (Önerilen)97.8798.6198.65

Tablo 10: EfficientNet-Lite kullanılarak öznitelik temsillerinin ablasyon analizi.

Değerlendirme GrubuAlt GrupDoğruluk (%)F1-skoru (%)FPRFNRDemografik Eşitlik FarkıFırsat Eşitliği Farkı
CinsiyetErkek97.9597.950.0210.024__
CinsiyetDişi97.6298.500.0240.027__
Cinsiyet eşitsizliğiErkek ve Dişi Karşılaştırması____0.0120.003
Yüksek kaynaklı diller98.1098.800.0180.021__
Düşük kaynaklı diller96.8597.900.0310.034__
Dil FarklılığıYüksek ve Düşük____0.0280.014

Tablo 11: Cinsiyet ve dil kaynağı alt grupları genelindeki adalet değerlendirmesi. Kısaltmalar: FPR = yanlış pozitif oranı; FNR = yanlış negatif oranı. Demografik eşitlik farkı ve fırsat eşitliği farkı gruplar arası farklılıkları temsil eder, bu nedenle bireysel gruplardan ziyade alt grup karşılaştırmaları için raporlanmışlardır. Daha düşük farklılık değerleri, gruplar genelinde daha tutarlı model davranışına işaret eder.

ReferansYaklaşımDoğruluk
16GBC90%.
17Sıralı Model91%
18CNN (Evrişimli Sinir Ağları)80%
19Bagging, KNN ve RF98.10%.
20ResNET5098.57%.
21Destek Vektör Makineleri98%
22LGBM91%
23Yığınlanmış model99.64%
24Destek Vektör Makineleri97%
25RF93%
26Evrişimli Sinir Ağları85.48%
27Yapay Sinir Ağları89.20%
Bu çalışmaEfficientNet-Lite97.87%

Tablo 12: VoiceNet-RAI'nin ses tabanlı cinsiyet ve yaş sınıflandırması için daha önce raporlanmış son teknoloji yaklaşımlarla doğruluk karşılaştırması.

Tartışma

Bu çalışma, MFCC özelliklerini ve wav2vec 2.0 gömmelerini EfficientNet-Lite ile entegre ederek ses verilerinden cinsiyet ve yaş sınıflandırması yapan otomatik bir çerçeve geliştirmiş ve değerlendirmiştir. İlk deneylerde EfficientNet-Lite, orijinal özellikleri kullanarak %83,48 doğruluk, %82,87 kesinlik, %84,28 duyarlılık ve %83,54 F1-skoru elde etmiştir. MFCC özelliklerinin entegrasyonunun ardından, 28 dilden oluşan veri setinde performans önemli ölçüde artarak %92,64 doğruluk, %93,79 kesinlik, %94,92 duyarlılık ve %94,84 F1-skoruna ulaşmıştır. İngilizce dil alt kümesinde hibrit MFCC–wav2vec 2.0 temsilinin kullanılmasıyla EfficientNet-Lite; %97,87 doğruluk, %98,61 kesinlik, %98,70 duyarlılık ve %98,65 F1-skoru elde etmiştir. Genellenebilirlik, önerilen çerçevenin yine güçlü performans sergilediği Mozilla Common Voice veri seti kullanılarak daha ayrıntılı şekilde değerlendirilmiştir. Ayrıca, model stabilitesi beş katlı çapraz doğrulama kullanılarak analiz edilmiştir.

MFCC özelliklerinin entegrasyonu sonrası gözlemlenen iyileşme; perde, tını ve vokal yol bilgisi dahil olmak üzere düşük seviyeli spektral özelliklerin, cinsiyet ve yaş sınıflandırması için yüksek derecede ayırt edici olmaya devam ettiğini göstermiştir. Hibrit MFCC–wav2vec 2.0 temsili ile elde edilen ek performans artışı, bağlamsal Transformer tabanlı gömmelerin, yalnızca el yapımı akustik özelliklerle tam olarak yakalanamayan tamamlayıcı bilgiler sağladığını ortaya koymuştur. Bu tamamlayıcılık, önerilen hibrit temsilin orijinal ve yalnızca MFCC içeren konfigürasyonlara kıyasla sergilediği geliştirilmiş performansı açıklayabilir. İngilizce dil alt kümesinde gözlemlenen daha güçlü performans, dilsel değişkenliğin sınıflandırma zorluğuna katkıda bulunmuş olabileceğini göstermiştir. Birden fazla dil birleştirildiğinde telaffuz, aksan, fonetik yapı ve örneklem dağılımındaki farklılıklar ek değişkenlikler getirmiş olabilirken, tek dilli kurulum daha homojen bir özellik uzayı sağlamıştır. Mozilla Common Voice veri seti kullanılarak yapılan doğrulama, kayıt koşulları ve demografik dağılımlardaki farklılıklar performansı etkilemiş olsa da, önerilen temsilin birincil veri setinin ötesine genelleyebildiğini göstermiştir.

Genel olarak sonuçlar, VoiceNet-RAI'nin performansının tek bir özellik tipinden ziyade, spektral ve bağlamsal konuşma temsillerinin tamamlayıcı katkılarıyla yönlendirildiğini göstermiştir. Bununla birlikte, farklı diller ve yaş grupları arasındaki kalan performans varyasyonları; daha geniş alt grup değerlendirmesine, gürültü dayanıklılık testlerine ve güncel kendi kendine denetimli konuşma modelleriyle ek karşılaştırmalara olan ihtiyacı vurgulamıştır.

Konuşma tabanlı cinsiyet ve yaş sınıflandırması için alternatif yaklaşımlar arasında, geleneksel ML sınıflandırıcılarıyla birlikte kullanılan el yapımı akustik özellikler, konuşma temsillerinden CNN tabanlı öğrenme, topluluk yöntemleri ve HuBERT, WavLM ve data2vec gibi öz-denetimli modeller yer almaktadır. Buna karşılık VoiceNet-RAI, el yapımı ve öğrenilmiş konuşma temsillerinin tamamlayıcı güçlü yönlerinden yararlanmak için MFCC tabanlı spektral bilgileri bağlamsal wav2vec 2.0 gömmeleriyle birleştirir.

Bu çalışmanın birkaç kısıtlılığı bulunmaktadır. İlk olarak, birincil veri seti cinsiyet, diller ve yaş grupları arasında dengesiz dağılımlar göstermiştir; bu durum alt grup performansını etkilemiş ve yeterince temsil edilmeyen popülasyonlara yönelik genellenebilirliği sınırlamış olabilir. İkinci olarak, kayıt cihazlarındaki farklılıklar, aksanlar, telaffuz ve akustik koşullar sınıflandırmanın güvenilirliğini etkilemiş olabilir. Üçüncü olarak, Mozilla Common Voice veri seti kullanılarak yapılan doğrulama, birincil veri setinin ötesindeki genellenebilirliği desteklemiş olsa da, ek gerçek dünya veri setleri kullanılarak daha kapsamlı bir değerlendirme yapılmasına ihtiyaç duyulmaktadır. Son olarak, ses tabanlı demografik sınıflandırmanın uygulanması, özellikle kontrolsüz veya yüksek etkili uygulamalarda gizlilik, adalet ve etik sorunları ortaya çıkarmıştır. Bu nedenle, sorumlu bir uygulama için sürekli performans izleme, insan denetimi ve gizlilik odaklı dağıtım uygulamaları gerekli olacaktır. Geliştirilen çerçeve; insan-bilgisayar etkileşimi, ses tabanlı kimlik doğrulama, konuşma analitiği ve dijital adli bilişim uygulamaları için potansiyel göstermiştir. Gelecekteki çalışmalar, VoiceNet-RAI'yi HuBERT, WavLM ve data2vec dahil olmak üzere güncel kendi kendine denetimli konuşma modelleriyle karşılaştıracak ve birleştirilmiş MFCC–wav2vec 2.0 temsili üzerinde göreve özgü dikkat mekanizmasını inceleyecektir. wav2vec 2.0'ın dahili öz-dikkat mekanizmasının aksine, önerilen gelecek mekanizma, cinsiyet ve yaş sınıflandırması için göreve uygun zamansal ve özellik düzeyindeki bilgileri açıkça ağırlıklandıracaktır.

Açıklamalar

Yazarların açıklanacak herhangi bir çıkar çatışması yoktur.

Teşekkürler

Yazarlar, bu araştırmayı finanse ettikleri için Princess Nourah bint Abdulrahman University Araştırmacı Destek Projesi numara (PNURSP2026R748), Princess Nourah bint Abdulrahman University, Riyad, Suudi Arabistan'a teşekkür ederler.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
BVC Challenging Voice SetBiometrics Vision and Computing Group / OgeNIBVC Challenging Voice Sethttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteGoogleEfficientNet-Lite, kullanılan kesin varyanthttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
Grafik İşleme BirimiNVIDIATesla K80https://www.nvidia.com/
Mozilla Common Voice Veri SetiMozilla FoundationCommon Voice, deneylerde kullanılan versiyonhttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyNumPy DevelopersDeneylerde kullanılan kesin versiyonhttps://numpy.org/
İşlemciIntelIntel Core i7-8265Uhttps://www.intel.com/
PythonPython Software FoundationDeneylerde kullanılan kesin versiyonhttps://www.python.org/
PyTorchPyTorch FoundationDeneylerde kullanılan kesin versiyonhttps://pytorch.org/
Scikit-learnScikit-learn DevelopersDeneylerde kullanılan kesin versiyonhttps://scikit-learn.org/
SciPySciPy DevelopersDeneylerde kullanılan kesin versiyonhttps://scipy.org/
wav2vec 2.0 BaseMeta AIfacebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
Windows 1MicrosoftWindows 11, mevcutsa kesin sürüm/yapıhttps://www.microsoft.com/windows/windows-1

Kaynaklar

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

Yeniden basım ve izinler

Etiketler

ok Dilli Konu ma S n fland rmasCinsiyet S n fland rmasSorumlu Yapay ZekaVoiceNet er evesiWav2vec 2 0MFCC zellikleriDerin renme Konu maEfficientNet LiteKonu ma Demografisi