Yaş ve cinsiyet sınıflandırmasına ilişkin deneysel sonuçlar, ML ve DL modelleri ile MFCC tabanlı ve hibrit öznitelik temsilleri kullanılarak değerlendirilmiştir. Veri seti, %80'i eğitim ve %20'si test için kullanılacak şekilde 80:20 oranında eğitim ve test setlerine ayrılmıştır. Aynı konuşmacıya ait kayıtların her iki sette de yer almasını önlemek amacıyla konuşmacı düzeyinde bölümlendirme uygulanmıştır.
Önerilen çerçevenin hiperparametreleri ve uygulama detayları Tablo 3'te özetlenmiştir. Deneyler; Intel i7-8265U CPU, 16 GB RAM ve Windows 1 çalıştıran bir NVIDIA Tesla K80 GPU ile donatılmış bir sistemde gerçekleştirilmiştir. ML modellerini geliştirmek için Python ve Scikit-learn kütüphanesi kullanılırken, önerilen DL çerçevesi PyTorch kullanılarak uygulanmıştır. Bu modeller, ses verilerinden cinsiyet ve yaş sınıflandırması için değerlendirilmiştir.
Adam optimize edici; 1 × 10⁻4 başlangıç öğrenme hızı, β₂ = 0.9 ve ε = 1 × 10⁻8 değerleri ile kullanılmıştır. 64'lük bir yığın boyutu ve maksimum 50 epoch kullanılmış; aşırı öğrenmeyi azaltmak için erken durdurma parametresi dört epoch sabır süresine ayarlanmıştır. Düzenleme amacıyla, tam bağlantılı katmanlara 0.3 oranında dropout uygulanmıştır. Sınıflandırma görevleri için kayıp fonksiyonu olarak kategorik çapraz entropi kullanılmıştır. Doğrulama kaybını izlemek için ReduceLROnPlateau öğrenme hızı zamanlayıcısı kullanılmıştır.
Veri sızıntısını önlemek ve adil bir değerlendirme sağlamak amacıyla, hiçbir konuşmacının hem eğitim hem de test kümelerinde yer almaması için konuşmacı düzeyinde ayırma işlemi uygulanmıştır. Ayrıca, önerilen modelin genellenebilirliğini ve sağlamlığını değerlendirmek için beş katlı çapraz doğrulama gerçekleştirilmiştir.
Orijinal veri setini kullanan modellerin sonuçları
Tablo 4, MFCC özellikleri olmadan, 28 dilden oluşan bir veri kümesi üzerinde cinsiyet sınıflandırması için birkaç ML ve DL modelinin performansını sunmaktadır. Değerlendirme metrikleri olarak kesinlik, duyarlılık, F1-skoru ve doğruluk kullanılmıştır.
Değerlendirilen modeller arasında EfficientNet-Lite %83,48 ile en yüksek doğruluğu, %82,87 kesinliği, %84,28 duyarlılığı ve %83,54 F1-skorunu elde etmiştir. MobileNet ve InceptionV3 de iyi performans göstermiş; MobileNet %81,3 doğruluk ve %83,1 F1-skoru, InceptionV3 ise %80,7 doğruluk ve %82,52 F1-skoru elde etmiştir. CNN modeli %75,71 doğruluk ve %7,43 F1-skoru elde ederken, ResNet %74,37 doğruluk ve %75,54 F1-skoru elde etmiştir. SVM, RF, LR ve ETC, %71,42 ile %73,59 arasında değişen doğruluk oranları ve %72,48 ile %74,34 arasında değişen F1-skorları elde etmiştir. VGG19, %75,07 duyarlılık ve %74,17 F1-skoru ile nispeten daha düşük olan %70,56 doğruluğu elde etmiştir. Genel olarak, orijinal öznitelikler kullanıldığında değerlendirilen modeller arasında EfficientNet-Lite ve MobileNet en güçlü performansı sergilemiştir.
MFCC özelliklerini kullanan modellerin sonuçları
MFCC özellikleri daha sonra cinsiyet sınıflandırması için değerlendirildi. Tablo 5, 28 dilden oluşan veri seti üzerinde MFCC özellikleri kullanan ML ve DL modellerinin performansını karşılaştırmaktadır.
EfficientNet-Lite; %92,64 doğruluk, %93,79 kesinlik, %94,92 duyarlılık ve %94,84 F1-skoru ile en yüksek performansı göstermiştir. MobileNet %91,39 doğruluk ve %91,07 F1-skoruna ulaşırken, InceptionV3 %90,24 doğruluk ve %89,83 F1-skoru elde etmiştir. ResNet %89,43 doğruluk ve %83,67 F1-skoru, CNN ise %8,60 doğruluk ve %87,35 F1-skoru elde etmiştir. VGG19 %87,48 doğruluk ve %85,58 F1-skoruna ulaşmıştır.
Geleneksel ML modelleri arasında SVM %85,47 doğruluk ve %84,29 F1-skoru; RF %84,57 doğruluk ve %87,42 F1-skoru; LR %83,25 doğruluk ve %84,98 F1-skoru; ve ETC %83,59 doğruluk ve %85,43 F1-skoru elde etmiştir. Genel olarak, MFCC özelliklerinin dahil edilmesi, orijinal özellikler kullanılarak elde edilen sonuçlarla karşılaştırıldığında çoğu modelin performansını artırmıştır. Bu deneyde en yüksek genel performansı EfficientNet-Lite göstermiştir.
İngilizce dil veri seti ile hibrit MFCC–wav2vec 2.0 özellikleri kullanan modellerin sonuçları
Bir sonraki deney seti, İngilizce dil alt kümesi üzerinde hibrit MFCC–wav2vec 2.0 öznitelik gösterimini kullanarak cinsiyet sınıflandırmasını değerlendirmiştir. Değerlendirilen modellerin performansı Tablo 6'da sunulmuştur. EfficientNet-Lite; %97,87 doğruluk, %98,61 kesinlik, %98,70 duyarlılık ve %98,65 F1-skoru ile en yüksek performansı göstermiştir.
Geleneksel ML modelleri arasında SVM %92,58 doğruluk ve %91,52 F1-skoru elde etmiştir; ETC %91,49 doğruluk ve %92,79 F1-skoru elde etmiştir; LR %90,64 doğruluk ve %91,34 F1-skoru elde etmiştir; RF ise %8,36 doğruluk ve %90,86 F1-skoru elde etmiştir. Genel olarak modeller, İngilizce dilindeki alt kümede güçlü bir performans sergilemiş ve raporlanan değerlendirme metrikleri genelinde en yüksek değerlere EfficientNet-Lite ulaşmıştır.
Beş katlı çapraz doğrulama sonuçları
Önerilen çerçevenin kararlılığını ve genellenebilirliğini değerlendirmek için beş katlı çapraz doğrulama gerçekleştirilmiştir. İngilizce ses veri kümesi kullanılarak elde edilen çapraz doğrulama sonuçları Tablo 7'de sunulmuştur. EfficientNet-Lite, beş kat boyunca ±0.003'lük bir standart sapma elde etmiştir. Katlar arasındaki düşük değişkenlik, değerlendirilen çapraz doğrulama ayarı altında kararlı bir performans sergilendiğini göstermiştir.
Ses verileri kullanılarak yaş sınıflandırması
Cinsiyet sınıflandırmasına ek olarak, yaş sınıflandırması birden fazla model ve MFCC özellikleri kullanılarak değerlendirilmiştir. Tablo 8, yaş sınıflandırması için değerlendirilen modellerin performansını sunmaktadır.
Sonuçlar, transfer öğrenme modellerinin %85'in üzerinde doğruluk oranlarına ulaştığını göstermiştir; MobileNet %85,23, InceptionV3 ise %86,67 doğruluk elde etmiştir. EfficientNet-Lite, %8,42 doğruluk, %86,56 kesinlik ve %87,21 duyarlılık ile bildirilen en yüksek performansı sergilemiştir.
Önerilen çerçevenin doğrulanması
Önerilen çerçevenin harici bir veri seti üzerinde değerlendirilmesi için Mozilla Common Voice veri seti51 kullanılarak ek deneyler gerçekleştirilmiştir. Veri seti, yaş, cinsiyet ve aksan bilgileri dahil olmak üzere ilgili demografik meta verileri içeren, yaklaşık 50 saatlik kitle kaynaklı konuşma kayıtlarından oluşmaktaydı. Korpus; önceden tanımlanmış eğitim, geliştirme ve test alt kümelerine ayrılmıştır. Ses kayıtları; 16 kHz'e yeniden örnekleme, 40 boyutlu MFCC özelliklerinin çıkarılması ve 768 boyutlu wav2vec 2.0 gömmelerinin oluşturulmasını içeren, birincil deneylerde kullanılan ön işleme hattının aynısı kullanılarak işlenmiştir. VoiceNet-RAI tarafından kullanılan 808 boyutlu hibrit özellik vektörünü üretmek için bu iki temsil birleştirilmiştir. Doğrulama sonuçları Tablo 9'da sunulmuştur.
Hibrit düşük ve yüksek düzey özellik temsiliyle kullanılan EfficientNet-Lite, değerlendirilen diğer modellerden daha yüksek olan %98,27'lik bir cinsiyet sınıflandırma doğruluğu elde etmiştir. ML modelleri arasında RF %90,47, SVM %90,69 ve LR %89,75 doğruluk oranına ulaşmıştır. Diğer DL modelleri arasında ResNet %92,19 doğruluk elde ederken, VGG19 %92,12 doğruluk elde etmiştir. İlgili kesinlik, duyarlılık ve F1-skoru değerleri Tablo 9'da bildirilmiştir.
Öznitelik temsili ve füzyonu üzerine ablasyon çalışması
Önerilen çerçevede kullanılan öznitelik temsillerinin katkısını değerlendirmek için bir ablasyon çalışması yürütülmüştür. Dört konfigürasyon dikkate alınmıştır: ham/orijinal öznitelikler, yalnızca MFCC öznitelikleri, yalnızca wav2vec 2.0 gömmeleri ve önerilen hibrit MFCC–wav2vec 2.0 temsili. Değerlendirilen deneysel kurulumlar arasında en yüksek performansı sergilediği için temsilci model olarak EfficientNet-Lite kullanılmıştır. Ablasyon sonuçları Tablo 10'da sunulmuştur.
Ham özellikler kullanan temel model %83,48 doğruluk oranına ulaşırken, MFCC tabanlı temsil %92,64 doğruluk oranı ve %94,84 F1-skoru elde etmiştir. Hibrit MFCC–wav2vec 2.0 temsili %97,87 doğruluk ve %98,65 F1-skoruna ulaşmıştır. Özdeş İngilizce dil veri bölümleri ve eğitim koşulları altında, hibrit MFCC–wav2vec 2.0 temsili %97,87 doğruluk oranına ulaşmışken, yalnızca MFCC kullanılan temsil için bu oran %92,64 olmuştur.
Her bir öznitelik temsilinin katkısını değerlendirmek amacıyla; özdeş veri bölümleri, eğitim ayarları ve EfficientNet-Lite mimarisi kullanılarak kontrollü deneyler yürütülmüştür. Ham/orijinal öznitelikler, yalnızca MFCC öznitelikleri, yalnızca wav2vec 2.0 gömmeleri ve hibrit MFCC–wav2vec 2.0 temsili bu koşullar altında karşılaştırılmıştır. Bu deneysel tasarım, öznitelik temsillerinin bireysel ve birleşik katkılarını değerlendirmek için kullanılmıştır.
İstatistiksel anlamlılık analizi
Bu karşılaştırmadaki tüm öznitelik konfigürasyonları; aynı İngilizce dil alt kümesi, özdeş konuşmacı düzeyindeki veri bölümleri ve aynı beş çapraz doğrulama katlaması kullanılarak değerlendirilmiştir. Önerilen model; ham öznitelik (97.86 ± 0.23%'ye karşı 83.48 ± 0.24%; t (4) = 384.32, p < 0.01), yalnızca MFCC (97.86 ± 0.23%'ye karşı 92.60 ± 0.32%; t (4) = 131.50, p < 0.01) ve yalnızca wav2vec 2.0 konfigürasyonlarından (97.86 ± 0.23%'ye karşı 95.34 ± 0.24%; t (4) = 126.0, p < 0.001) anlamlı derecede daha yüksek doğruluk elde ederek, MFCC–wav2vec 2.0 füzyonundan kaynaklanan iyileştirmelerin istatistiksel olarak anlamlı olduğunu doğrulamıştır.
Sorumlu yapay zeka hususları ve dağıtım kılavuzları
Ses tabanlı demografik sınıflandırmada Sorumlu Yapay Zeka, öngörücü performansın yanı sıra hakkaniyet, şeffaflık, gizlilik, potansiyel kötüye kullanım ve dağıtımla ilgili risklerin değerlendirilmesini gerektirmiştir. Alt grup analizleri, değerlendirilen cinsiyet ve dil grupları arasındaki performans farklarının ampirik bir değerlendirmesini sağlamış olsa da, hakkaniyet yalnızca benzer sınıflandırma doğruluğu ile kanıtlanamazdı. Bu nedenle, VoiceNet-RAI çerçevesi birden fazla Sorumlu Yapay Zeka perspektifinden değerlendirilmiştir.
Adalet ve yanlılık analizi
Önerilen VoiceNet-RAI çerçevesinin Sorumlu Yapay Zeka özelliklerini değerlendirmek için cinsiyet ve dil alt grupları arasında bir adalet analizi yapılmıştır. Sonuçlar Tablo 11'de sunulmuştur. Cinsiyete dayalı değerlendirme için model performansı, erkek ve kadın konuşmacılar için ayrı analiz edilmiştir. Sonuçlar, değerlendirilen cinsiyet grupları arasında doğruluk ve F1-skorunda %1,5'ten daha az varyasyon olduğunu göstermiştir.
Dil bazlı değerlendirme için, performans 28 dilden oluşan veri seti içindeki değerlendirilen dil grupları arasında analiz edilmiştir. Sonuçlar, değerlendirilen gruplar arasında doğruluk oranında %2'den daha az bir ortalama varyasyon olduğunu göstermiş; daha az örneğe sahip bazı düşük kaynaklı dillerde ise daha yüksek varyasyonlar gözlemlenmiştir.
Adalet; demografik eşitlik farkı, fırsat eşitliği farkı, Yanlış Pozitif Oranı (FPR) ve Yanlış Negatif Oranı (FNR) kullanılarak daha ayrıntılı şekilde değerlendirilmiştir. Demografik eşitlik farkı, gruplar arasındaki pozitif tahmin oranlarındaki farklılıkları nicelendirirken, fırsat eşitliği farkı Doğru Pozitif Oranlarındaki (TPRs) farklılıkları nicelendirmiştir. FPR ve FNR, alt gruba özgü hata modellerini tanımlamak için kullanılmıştır. Bu metrikler, alt grup düzeyindeki doğruluk ve F1 skorunu tamamlayarak, değerlendirilen demografik ve dilsel gruplar arasındaki model performansı farklılıkları hakkında ek bilgiler sağlamıştır. Değerlendirilen veri seti ve alt grup tanımlamaları altında elde edilen sonuçlar, incelenen cinsiyet ve dil grupları arasında nispeten küçük performans farkları olduğunu göstermiştir. Ancak, bu bulgular değerlendirilen veri setlerinde temsil edilen demografik ve dilsel gruplarla sınırlı kalmış olup, temsil edilmeyen popülasyonlar veya uygulama ortamları genelinde adaleti kanıtlamamıştır.
Açıklanabilirlik ve şeffaflık
VoiceNet-RAI, yorumlanabilir MFCC tabanlı akustik özellikleri bağlamsal wav2vec 2.0 gömmeleriyle birleştirmiştir. Ablasyon çalışması, bireysel ve birleştirilmiş öznitelik temsillerinin katkılarını değerlendirmiştir. Ancak, wav2vec 2.0 gömmelerinin yorumlanması nispeten zor kalmaya devam etmiştir. Bu nedenle, bireysel tahminlere en güçlü katkıyı sağlayan öznitelikleri belirlemek amacıyla gelecekteki çalışmalarda post-hoc açıklama yöntemleri araştırılabilir.
Gizliliğin korunması
Ses kayıtları hassas biyometrik bilgiler içerdiğinden, gizliliği koruyan bir uygulama; yalnızca sınıflandırma görevi için gerekli olan bilgilerin işlenmesini ve ham ses dosyalarının gereksiz yere depolanmasından kaçınılmasını içeren veri minimizasyonu uygulamalarını gerektirmiştir. Güvenli depolama, kontrollü erişim ve yerel çıkarım, gizlilik risklerini daha da azaltabilirdi. Diferansiyel gizlilik de dahil olmak üzere resmi gizlilik koruma yaklaşımları mevcut çalışmada değerlendirilmemiş olup gelecekteki araştırmalar için bir alan olarak kalmıştır.
Sorumlu dağıtım
VoiceNet-RAI'nin konuşlandırılması; insan gözetimi, güven duyarlılıklı karar verme ve sürekli performans izleme gerektirecektir. Düşük güven düzeyindeki tahminler, kritik kararlar için bağımsız olarak kullanılmamalıdır ve konuşlandırma koşulları, eğitim ve doğrulama veri setlerinde temsil edilenlerden önemli ölçüde farklılaştığında model performansı yeniden değerlendirilmelidir.
En güncel tekniklerle karşılaştırma
Önerilen çerçevenin ve daha önce yayınlanmış yaklaşımların karşılaştırmalı bir değerlendirmesi Tablo 12'de sunulmuştur. ML, DL ve transfer öğrenmeye dayalı yaklaşımlar da dahil olmak üzere 2019 ile 2024 yılları arasında yayınlanan çalışmalar dikkate alınmıştır. Karşılaştırma, aynı uygulama alanında daha önce raporlanmış çalışmaları içermiştir. Tablo 12'de gösterildiği üzere, önerilen çerçeve, cinsiyet ve yaş sınıflandırması için karşılaştırılan yaklaşımlardan daha yüksek raporlanmış doğruluk değerleri elde etmiştir. Bununla birlikte, çalışmaların veri setleri, ön işleme prosedürleri, veri bölümleri ve değerlendirme protokolleri açısından farklılık göstermiş olabileceği nedeniyle, karşılaştırma kontrollü bir kafa kafaya deneysel karşılaştırmadan ziyade raporlanan performansı yansıtmaktadır.
VERİ ERİŞİLEBİLİRLİĞİ:
Bu çalışmada kullanılan ham konuşma verileri, GitHub'da barındırılan BVC Challenging Voice Set ve Mozilla Common Voice veri setinden kamuya açık olarak temin edilmiştir. BVC veri setine https://github.com/OgeNI/BVC_Challenging_Voice_Set adresinden, Common Voice veri setine ise https://www.kaggle.com/datasets/mozillaorg/common-voice/data adresinden erişilebilir.

Şekil 1: Mimari Diyagram. Önerilen çerçevenin eksiksiz iş akışı metodolojisi. Bu şeklin daha büyük bir versiyonunu görüntülemek için lütfen buraya tıklayın.
| Referanslar | Modeller | Veri Setleri | Sonuçlar |
| 19 | GBC, DT, RF, SVM, NN | VoxForge veri seti | GBC 90% |
| 20 | Robustscalar, PCA ve Lojistik
regresyon, Ardışık model | voice.mozilla.org | Ardışık Model 91%. |
| 21 | CNN, CRNN, TCN | Mozilla Voice veri seti | 80% CNN |
| 2, 23 | Geri yayılım, DT, Bagging,
RF, KNN, DNN, DL | Kaggle, Mozilla Voice veri seti,
Speech Accent Archive | Kaggle: Bagging, KNN ve RF
98.10%. Voice common: Bagging 5.39%. Speech accent: Bagging 78.94%. |
| 24 | DNN, MLP, KNN, SVC, DT, RF,
SVC RBF çekirdeği, ADA, QDA, GNB, ResNET34 ve ResNET50. | Mozilla Common Voice | ResNET50 98.57%. |
| 25 | ANN, SVM, RF, DT, NB, KNN | OGI Kids Speech korpusu, Özel
korpus, Spesifik Veri Seti, | Cinsiyet tespiti için SVM 98%,
Yaş tespiti için RF 95% |
| 26 | SVM, DA, NB, DT, KNN, Topluluk-
yöntemleri, LightGBM | Mozilla Common Voice, VoxCeleb | LGBM 91% |
| 27 | KNN, SVM, LR, SGD, Yığınlanmış
model | Çeşitli cinsiyet kaynakları | Yığınlanmış model 9.64% |
| 28 | DNN, SVM | Çeşitli cinsiyet kaynakları | SVM 97% |
| 29 | SVM, RF, CART, KNN | 3169 örneklik veri seti | RF 93% |
| 30 | CNN | Nijeryalı denekler veri seti | CNN 85.48%. |
| 31 | DT, RF, KNN, LR, SVM, ANN,
CNN2D | Kaggle'dan 3 veri seti | Cinsiyet Tahmini: ANN 85.51%,
Yaş Tahmini: ANN 89.20%. |
Tablo 1: Modeller, veri setleri ve bildirilen performanslar dahil olmak üzere ses tabanlı cinsiyet ve yaş sınıflandırması üzerine mevcut çalışmaların özeti.
| Veri Seti Özellikleri | Açıklama / Değer |
| Toplam konuşmacı sayısı | 526 |
| Erkek konuşmacılar | 336 |
| Kadın konuşmacılar | 190 |
| Toplam kayıtlar | Yaklaşık 3.964 |
| Dil sayısı | 28 |
| Dil bazlı dağılım | İngilizce ve 28 yerel dil (Afemai, Akoko-Edo, Annang, Efik, Ekoi, Fulani, Hausa, Ibibio, Idoma, Igala, Igbo, Igede, Ijaw, Ika, Ikom, Ikwerre, Ishan, Kaire-Kaire, Kanuri, Lokaa, Urhobo, Yoruba, Obudu, Ogoni, Okobo, Okirika, Tiv ve Ukwani. Veri setindeki bu yerel diller arasında baskın olan kabile Igbo'dur. |
| Yaş grupları | üç yaş grubu: gençler (gençler ve yirmili yaşlar), yetişkinler (otuzlu, kırklı ve ellili yaşlar) ve yaşlılar (altmışlı, yetmişli ve seksenli yaşlar) |
| Yaş grubu dağılımı | Gençler 13–19 yaş Düşük (< %10)Yirmili yaşlar20–29 yaş Çok Yüksek (~%35–45)Otuzlu yaşlar30–39 yaş Yüksek (~%20–30)Kırklı yaşlar40–49 yaş Orta (~%10–15)Ellili yaşlar50–59 yaş Düşük (~%5–10)Altmışlı yaşlar+60–80+ yaş Seyrek (< 5%) |
| Kayıt süresi | 3-10 saniye |
| Kayıt koşulları | 16 bit PCM |
| Orijinal örnekleme hızı | 4,1 kHz |
| Örnekleme hızının işlenmesi | 16 kHz |
| MFCC çerçeve uzunluğu | 25 ms |
| MFCC çerçeve örtüşmesi / adımı | 10 ms |
| MFCC temsili | 39 boyutlu zamansal olarak ortalanmış vektör |
| wav2vec 2.0 temsili | zamansal olarak ortalama havuzlanmış 768 boyutlu vektör |
| Nihai füzyon temsili | 807 boyut |
| Eğitim-test ayrımı | 80:20 |
| Veri bölümlendirme | Konuşmacıdan bağımsız ayırma |
| Çapraz doğrulama | 5 katlı çapraz doğrulama |
| Harici doğrulama veri seti | Mozilla Common Voice |
Tablo 2: VoiceNet-RAI'de kullanılan konuşma veri setinin demografik özellikleri, dil kapsamı, veri bölümlendirmesi ve ön işleme ayarları.
| Parametre | Değer / Açıklama |
| Çerçeve | PyTorch |
| Donanım | NVIDIA GPU (CUDA destekli) |
| Rastgele tohum | 42 |
| Optimizasyon Algoritması | Adam |
| Başlangıç Öğrenme Oranı | 1 × 10−4 |
| β₁ / β₂ | 0.9 / 0.99 |
| Adam epsilon | 1 × 10⁻⁸ |
| Yığın Boyutu | 64 |
| Epoklar | 50 (Erken durdurma sabrı = 8) |
| Kayıp Fonksiyonu | Kategorik Çapraz Entropi |
| Normalizasyon | Z-skoru normalizasyonu |
| Öğrenme Oranı Zamanlayıcısı | ReduceLROnPlateau |
| Dropout Oranı | 0.3 |
| Eğitim süresi | 20min |
| Çıkarım süresi/örnek | 13 saniye |
| Öznitelik Çıkarımı | Öznitelik Çıkarımı |
| MFCC Katsayıları | 40 |
| Pencere Boyutu | 25 ms |
| Kaydırma (Stride) | 10 ms |
| wav2vec Varyantı | Base (önceden eğitilmiş) Gömme Boyutu |
| Havuzlama Stratejisi | Ortalama havuzlama |
| Öznitelik Füzyonu | Birleştirme (MFCC + wav2vec) |
| MFCC Katsayıları | 40 |
| Değerlendirme Protokolü | Değerlendirme Protokolü |
| Eğitim-Test Ayrımı | Konuşmacı düzeyinde ayrım |
| Çapraz Doğrulama | 5-Katlı |
| Veri Setleri | Mozilla Common Voice (28 dil + İngilizce alt kümesi) ve Voice Challenging Veri Setinden BVC Cinsiyet & Yaş |
| Görevler | Cinsiyet ve Yaş Sınıflandırması |
Tablo 3: VoiceNet-RAI için kullanılan eğitim yapılandırması, özellik çıkarma ayarları, hiperparametreler ve değerlendirme protokolü.
| Modeller | Doğruluk | Hassasiyet | Geri çağırma | F1 skoru |
| RF | 71.42 | 72.79 | 74.43 | 73.52 |
| LR | 73.59 | 74.22 | 75.40 | 74.34 |
| Elektron Taşıma Zinciri | 72.44 | 72.33 | 74.52 | 73.41 |
| SVM (Destek Vektör Makineleri) | 73.52 | 72.60 | 72.39 | 72.48 |
| Evrişimli Sinir Ağları | 75.71 | 76.59 | 77.34 | 77.43 |
| VGG19 | 70.56 | 73.28 | 75.07 | 74.17 |
| ResNet | 74.37 | 73.49 | 76.68 | 75.54 |
| EfficientNet-Lite | 83.48 | 82.87 | 84.28 | 83.54 |
| MobileNet | 81.33 | 83.19 | 82.14 | 83.11 |
| InceptionV3 | 80.77 | 81.34 | 82.67 | 82.52 |
Tablo 4: MFCC özellikleri olmadan 28 dilli veri kümesini kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.
| Modeller | Doğruluk | Hassasiyet | Geri çağırma | F1-skoru |
| RF | 84.57 | 86.53 | 87.39 | 87.42 |
| LR | 83.25 | 84.42 | 85.64 | 84.98 |
| Elektron Taşıma Zinciri | 83.59 | 84.25 | 86.36 | 85.43 |
| Destek Vektör Makineleri | 85.47 | 83.37 | 85.26 | 84.29 |
| Evrişimli Sinir Ağları | 88.60 | 86.75 | 88.46 | 87.35 |
| VGG19 | 87.48 | 85.49 | 85.80 | 85.58 |
| ResNet | 89.43 | 84.39 | 82.34 | 83.67 |
| EfficientNet-Lite | 92.64 | 93.79 | 94.92 | 94.84 |
| MobileNet | 91.39 | 90.64 | 91.15 | 91.07 |
| InceptionV3 | 90.24 | 88.81 | 90.70 | 89.83 |
Tablo 5: 28 dilli veri seti üzerinde MFCC özelliklerini kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.
| Modeller | Doğruluk | Kesinlik | Duyarlılık | F1-skoru |
| RF | 8.36 | 90.91 | 89.94 | 90.86 |
| LR | 90.64 | 92.24 | 91.30 | 91.34 |
| ETC | 91.49 | 92.80 | 92.79 | 92.79 |
| SVM | 92.58 | 92.75 | 90.64 | 91.52 |
| CNN | 93.69 | 94.69 | 94.53 | 94.34 |
| VGG19 | 91.37 | 92.64 | 93.48 | 93.21 |
| ResNet | 95.28 | 96.39 | 95.52 | 95.43 |
| EfficientNet-Lite | 97.87 | 98.61 | 98.70 | 98.65 |
| MobileNet | 96.41 | 95.51 | 96.39 | 96.24 |
| InceptionV3 | 96.35 | 95.29 | 96.84 | 96.08 |
Tablo 6: İngilizce dil alt kümesi üzerinde hibrit MFCC–wav2vec 2.0 öznitelik temsili kullanan ML ve DL modellerinin cinsiyet sınıflandırma performansı.
| Modeller | Doğruluk | Hassasiyet | Geri çağırma | F1-skoru |
| İlk katlama | 97 | 93 | 96 | 94 |
| İkinci kat | 96 | 94 | 96 | 95 |
| Üç katlı | 97 | 94 | 95 | 95 |
| Dört katlı | 96 | 93 | 95 | 94 |
| Beş katı | 97 | 94 | 96 | 95 |
| Ortalama | 96.6 | 93.6 | 95.6 | 94.6 |
Tablo 7: VoiceNet-RAI'nin İngilizce dil alt kümesi üzerindeki beş katlı çapraz doğrulama performansı.
| Modeller | Doğruluk | Kesinlik | Duyarlılık | F1-skoru |
| RF | 80.15 | 78.68 | 79.27 | 79.04 |
| LR | 81.28 | 80.69 | 80.43 | 80.54 |
| ETC | 80.58 | 81.21 | 80.82 | 81.04 |
| SVM | 82.54 | 81.31 | 82.14 | 81.78 |
| CNN | 85.27 | 84.39 | 84.47 | 84.43 |
| VGG19 | 83.73 | 82.97 | 83.53 | 83.48 |
| ResNet | 82.68 | 81.42 | 80.78 | 81.95 |
| EfficientNet-Lite | 8.42 | 86.56 | 87.21 | 86.97 |
| MobileNet | 85.23 | 85.64 | 85.95 | 85.81 |
| InceptionV3 | 86.67 | 85.86 | 86.78 | 86.35 |
Tablo 8: ML ve DL modellerinin doğruluk, kesinlik, duyarlılık ve F1-skoru açısından yaş sınıflandırma performansı.
| Modeller | Doğruluk | Kesinlik | Duyarlılık | F1-skoru |
| RF | 90.47 | 92.82 | 90.85 | 91.32 |
| LR | 89.75 | 90.4 | 89.61 | 90.03 |
| ETC | 92.63 | 91.29 | 91.55 | 91.42 |
| SVM | 90.69 | 91.84 | 91.81 | 91.82 |
| CNN | 94.63 | 95.52 | 94.24 | 94.94 |
| VGG19 | 92.12 | 91.34 | 90.52 | 91.10 |
| ResNet | 92.19 | 91.98 | 92.27 | 92.25 |
| EfficientNet-Lite | 98.27 | 98.63 | 98.4 | 98.56 |
| MobileNet | 97.28 | 96.36 | 97.01 | 96.40 |
| InceptionV3 | 95.85 | 96.18 | 97.35 | 97.17 |
Tablo 9: Hibrit MFCC–wav2vec 2.0 özellik temsili kullanılarak Mozilla Common Voice veri kümesi üzerinde cinsiyet sınıflandırması için harici doğrulama sonuçları.
| Özellik Yapılandırması | Doğruluk (%) | Hassasiyet (%) | F1-Skoru (%) |
| Ham özellikler (MFCC yok) | 83.48 | 82.87 | 83.54 |
| Sadece MFCC | 92.64 | 93.79 | 94.84 |
| yalnızca wav2vec 2.0 | 95.34 | 96.32 | 95.18 |
| MFCC + wav2vec (Önerilen) | 97.87 | 98.61 | 98.65 |
Tablo 10: EfficientNet-Lite kullanılarak öznitelik temsillerinin ablasyon analizi.
| Değerlendirme Grubu | Alt Grup | Doğruluk (%) | F1-skoru (%) | FPR | FNR | Demografik Eşitlik Farkı | Fırsat Eşitliği Farkı |
| Cinsiyet | Erkek | 97.95 | 97.95 | 0.021 | 0.024 | _ | _ |
| Cinsiyet | Dişi | 97.62 | 98.50 | 0.024 | 0.027 | _ | _ |
| Cinsiyet eşitsizliği | Erkek ve Dişi Karşılaştırması | _ | _ | _ | _ | 0.012 | 0.003 |
| Yüksek kaynaklı diller | 98.10 | 98.80 | 0.018 | 0.021 | _ | _ |
| Düşük kaynaklı diller | 96.85 | 97.90 | 0.031 | 0.034 | _ | _ |
| Dil Farklılığı | Yüksek ve Düşük | _ | _ | _ | _ | 0.028 | 0.014 |
Tablo 11: Cinsiyet ve dil kaynağı alt grupları genelindeki adalet değerlendirmesi. Kısaltmalar: FPR = yanlış pozitif oranı; FNR = yanlış negatif oranı. Demografik eşitlik farkı ve fırsat eşitliği farkı gruplar arası farklılıkları temsil eder, bu nedenle bireysel gruplardan ziyade alt grup karşılaştırmaları için raporlanmışlardır. Daha düşük farklılık değerleri, gruplar genelinde daha tutarlı model davranışına işaret eder.
| Referans | Yaklaşım | Doğruluk |
| 16 | GBC | 90%. |
| 17 | Sıralı Model | 91% |
| 18 | CNN (Evrişimli Sinir Ağları) | 80% |
| 19 | Bagging, KNN ve RF | 98.10%. |
| 20 | ResNET50 | 98.57%. |
| 21 | Destek Vektör Makineleri | 98% |
| 22 | LGBM | 91% |
| 23 | Yığınlanmış model | 99.64% |
| 24 | Destek Vektör Makineleri | 97% |
| 25 | RF | 93% |
| 26 | Evrişimli Sinir Ağları | 85.48% |
| 27 | Yapay Sinir Ağları | 89.20% |
| Bu çalışma | EfficientNet-Lite | 97.87% |
Tablo 12: VoiceNet-RAI'nin ses tabanlı cinsiyet ve yaş sınıflandırması için daha önce raporlanmış son teknoloji yaklaşımlarla doğruluk karşılaştırması.