تم تقييم النتائج التجريبية لتصنيف العمر والجنس باستخدام تمثيلات ميزات تعتمد على MFCC وتمثيلات هجينة مع نماذج التعلم الآلي (ML) والتعلم العميق (DL). تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار بنسبة 80:20، حيث استُخدمت 80% للتدريب و20% للاختبار. كما تم تطبيق التقسيم على مستوى المتحدث لمنع ظهور تسجيلات المتحدث نفسه في كلتا المجموعتين.
تم تلخيص المعاملات الفائقة وتفاصيل تنفيذ الإطار المقترح في الجدول 3. أُجريت التجارب على نظام مجهز بمعالج Intel i7-8265U CPU، وذاكرة وصول عشوائي (RAM) بسعة 16 GB، ووحدة معالجة رسومات NVIDIA Tesla K80 GPU تعمل بنظام التشغيل Windows 11. استُخدمت لغة Python ومكتبة Scikit-learn لتطوير نماذج تعلم الآلة (ML)، بينما تم تنفيذ إطار التعلم العميق (DL) المقترح باستخدام PyTorch. وقد تم تقييم هذه النماذج لتصنيف الجنس والعمر من بيانات الصوت.
تم استخدام مُحسِّن Adam بمعدل تعلم أولي قدره 1 × 10⁻4، وβ₂ = 0.999، وε = 1 × 10⁻8. كما استُخدم حجم دفعة قدره 64 وبحد أقصى 50 حقبة تدريبية (epoch)، مع ضبط التوقف المبكر على فترة صبر تبلغ أربع حقبات لتقليل الإفراط في الضبط. وطُبق معدل إسقاط (dropout rate) قدره 0.3 على الطبقات كاملة الاتصال لأغراض التنظيم. واستُخدم الإنتروبيا المتقاطعة الفئوية (Categorical cross-entropy) كدالة خسارة لمهام التصنيف. كما استُخدم مجدول معدل التعلم ReduceLROnPlateau لمراقبة خسارة التحقق.
لمنع تسريب البيانات وضمان تقييم عادل، تم تطبيق تقسيم على مستوى المتحدث بحيث لا يظهر أي متحدث في مجموعتي التدريب والاختبار معاً. بالإضافة إلى ذلك، تم إجراء تحقق متبادل خماسي الطيات (five-fold cross-validation) لتقييم قدرة النموذج المقترح على التعميم ومدى متانته.
نتائج النماذج التي استخدمت مجموعة البيانات الأصلية
يوضح الجدول 4 أداء العديد من نماذج تعلم الآلة (ML) والتعلم العميق (DL) لتصنيف الجنس على مجموعة بيانات تضم 28 لغة، دون استخدام ميزات MFCC. وقد استُخدمت الدقة (Precision)، والاستدعاء (Recall)، ومقياس F1-score، والدقة العامة (Accuracy) كمعايير للتقييم.
من بين النماذج التي تم تقييمها، حقق EfficientNet-Lite أعلى دقة بنسبة 83.48%، وبدقة تحديد (precision) بلغت 82.87%، واستدعاء (recall) بنسبة 84.28%، ودرجة F1-score بلغت 83.54%. كما أظهر MobileNet وInceptionV3 أداءً جيداً، حيث حقق MobileNet دقة بنسبة 81.33% ودرجة F1-score بلغت 83.11%، وحقق InceptionV3 دقة بنسبة 80.77% ودرجة F1-score بلغت 82.52%. وحقق نموذج CNN دقة بنسبة 75.71% ودرجة F1-score بلغت 77.43%، بينما حقق ResNet دقة بنسبة 74.37% ودرجة F1-score بلغت 75.54%. أما نماذج SVM وRF وLR وETC فقد حققت دقة تراوحت بين 71.42% و73.59% ودرجات F1-score تراوحت بين 72.48% و74.34%. وسجل VGG19 دقة أقل نسبياً بلغت 70.56%، مع استدعاء بنسبة 75.07% ودرجة F1-score بلغت 74.17%. وبشكل عام، حقق EfficientNet-Lite وMobileNet أقوى أداء بين النماذج التي تم تقييمها عند استخدام الميزات الأصلية.
نتائج النماذج التي تستخدم ميزات MFCC
تم تقييم سمات MFCC لاحقاً لتصنيف النوع الاجتماعي. يقارن الجدول 5 أداء نماذج التعلم الآلي (ML) والتعلم العميق (DL) باستخدام سمات MFCC على مجموعة البيانات التي تضم 28 لغة.
حقق نموذج EfficientNet-Lite أعلى أداء، حيث بلغت الدقة (accuracy) 92.64%، والدقة المحددة (precision) 93.79%، والاستدعاء (recall) 94.92%، ومقياس F1-score 94.84%. وحقق نموذج MobileNet دقة بلغت 91.39% ومقياس F1-score بلغ 91.07%، بينما حقق نموذج InceptionV3 دقة بلغت 90.24% ومقياس F1-score بلغ 89.83%. وحقق نموذج ResNet دقة بلغت 89.43% ومقياس F1-score بلغ 83.67%، في حين حقق نموذج CNN دقة بلغت 88.60% ومقياس F1-score بلغ 87.35%. أما نموذج VGG19 فقد حقق دقة بلغت 87.48% ومقياس F1-score بلغ 85.58%.
من بين نماذج تعلم الآلة (ML) التقليدية، حقق نموذج SVM دقة بلغت 85.47% ودرجة F1-score بلغت 84.29%؛ وحقق RF دقة بلغت 84.57% ودرجة F1-score بلغت 87.42%؛ وحقق LR دقة بلغت 83.25% ودرجة F1-score بلغت 84.98%؛ بينما حقق ETC دقة بلغت 83.59% ودرجة F1-score بلغت 85.43%. وبوجه عام، أدى إدراج سمات MFCC إلى تحسين أداء معظم النماذج مقارنة بالنتائج التي تم الحصول عليها باستخدام السمات الأصلية. وقد حقق EfficientNet-Lite أعلى أداء إجمالي في هذه التجربة.
نتائج النماذج التي تستخدم ميزات hybrid MFCC–wav2vec 2.0 مع مجموعة البيانات باللغة الإنجليزية
قامت المجموعة التالية من التجارب بتقييم تصنيف الجنس باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0 على المجموعة الفرعية للغة الإنجليزية. ويُعرض أداء النماذج التي تم تقييمها في الجدول 6. وقد حقق نموذج EfficientNet-Lite أعلى أداء، بدقة بلغت 97.87%، ودقة تحديد (precision) بلغت 98.61%، واستدعاء (recall) بنسبة 98.70%، ومقياس F1-score بنسبة 98.65%.
من بين نماذج تعلم الآلة (ML) التقليدية، حقق نموذج SVM دقة بلغت 92.58% ومقياس F1-score بلغ 91.52%؛ وحقق نموذج ETC دقة بلغت 91.49% ومقياس F1-score بلغ 92.79%؛ وحقق نموذج LR دقة بلغت 90.64% ومقياس F1-score بلغ 91.34%؛ بينما حقق نموذج RF دقة بلغت 88.36% ومقياس F1-score بلغ 90.86%. وبشكل عام، أظهرت النماذج أداءً قوياً في المجموعة الفرعية للغة الإنجليزية، حيث حقق نموذج EfficientNet-Lite أعلى القيم عبر مقاييس التقييم المذكورة.
نتائج التحقق المتبادل خماسي الطيات
تم إجراء عملية تحقق تبادلي خماسي الطيات (Five-fold cross-validation) لتقييم استقرار وقابلية تعميم الإطار المقترح. وتظهر نتائج التحقق التبادلي التي تم الحصول عليها باستخدام مجموعة بيانات الأصوات باللغة الإنجليزية في الجدول 7. حقق نموذج EfficientNet-Lite انحرافاً معيارياً قدره ±0.0033 عبر الطيات الخمس. ويشير هذا التباين المنخفض عبر الطيات إلى أداء مستقر في ظل إعدادات التحقق التبادلي التي تم تقييمها.
تصنيف العمر باستخدام بيانات الصوت
بالإضافة إلى تصنيف الجنس، تم تقييم تصنيف العمر باستخدام نماذج متعددة وميزات MFCC. يوضح الجدول 8 أداء النماذج التي تم تقييمها لتصنيف العمر.
أظهرت النتائج أن نماذج التعلم بنقل المعرفة حققت دقة تجاوزت 85%، حيث حقق نموذج MobileNet دقة بلغت 85.23% وحقق نموذج InceptionV3 دقة بلغت 86.67%. وسجل نموذج EfficientNet-Lite أعلى أداء تم رصده، بدقة بلغت 88.42%، ودقة تنبؤ (precision) بلغت 86.56%، ومعدل استدعاء (recall) بلغ 87.21%.
التحقق من صحة الإطار المقترح
لتقييم الإطار المقترح على مجموعة بيانات خارجية، أُجريت تجارب إضافية باستخدام مجموعة بيانات Mozilla Common Voice51. احتوت مجموعة البيانات على ما يقرب من 500 ساعة من تسجيلات كلام مجمعة جماعيًا مع البيانات الديموغرافية المرتبطة بها، بما في ذلك العمر والجنس ومعلومات اللهجة. وقد نُظمت هذه المدونة إلى مجموعات فرعية محددة مسبقًا للتدريب والتطوير والاختبار. عُولجت التسجيلات الصوتية باستخدام نفس خط معالجة البيانات المسبقة المستخدم في التجارب الأساسية، بما في ذلك إعادة أخذ العينات بتردد 16 kHz، واستخراج سمات MFCC ذات 40 بُعدًا، وتوليد تضمينات wav2vec 2.0 ذات 768 بُعدًا. دُمج هذان التمثيلان لإنتاج متجه سمات هجين ذي 808 أبعاد استخدمه نموذج VoiceNet-RAI. وتظهر نتائج التحقق في الجدول 9.
حققت نموذج EfficientNet-Lite، مع تمثيل الميزات الهجين من المستويين المنخفض والعالي، دقة في تصنيف الجنس بلغت 98.27%، وهي أعلى من دقة النماذج الأخرى التي تم تقييمها. ومن بين نماذج التعلم الآلي (ML)، حقق RF دقة بلغت 90.47%، وحقق SVM دقة 90.69%، بينما حقق LR دقة 89.75%. ومن بين نماذج التعلم العميق (DL) الأخرى، حقق ResNet دقة بلغت 92.19%، في حين حقق VGG19 دقة 92.12%. القيم المقابلة للدقة (precision) والاسترجاع (recall) ومقياس F1-score موثقة في الجدول 9.
دراسة الاستئصال لتمثيل الميزات ودمجها
أُجريت دراسة استئصال (ablation study) لتقييم مساهمة تمثيلات الميزات المستخدمة في الإطار المقترح. وقد نُظر في أربعة تكوينات: الميزات الخام/الأصلية، وميزات MFCC فقط، وتضمينات wav2vec 2.0 فقط، والتمثيل الهجين المقترح MFCC–wav2vec 2.0. استُخدم نموذج EfficientNet-Lite كنموذج ممثل لأنه حقق أعلى أداء عبر الإعدادات التجريبية التي تم تقييمها. وتظهر نتائج دراسة الاستئصال في الجدول 10.
حقق النموذج المرجعي باستخدام الميزات الخام دقة بلغت 83.48%، بينما حقق التمثيل القائم على MFCC دقة بنسبة 92.64% ودرجة F1-score بلغت 94.84%. وحقق التمثيل الهجين MFCC–wav2vec 2.0 دقة بنسبة 97.87% ودرجة F1-score بلغت 98.65%. وفي ظل ظروف تدريب وتقسيمات بيانات متطابقة للغة الإنجليزية، حقق التمثيل الهجين MFCC–wav2vec 2.0 دقة بنسبة 97.87%، مقارنة بنسبة 92.64% للتمثيل القائم على MFCC فقط.
أُجريت تجارب مضبوطة باستخدام تقسيمات بيانات وإعدادات تدريب متطابقة وبنية EfficientNet-Lite لتقييم مساهمة كل تمثيل للميزات. وتمت مقارنة الميزات الخام/الأصلية، والميزات المعتمدة على MFCC فقط، وتضمينات wav2vec 2.0 فقط، والتمثيل الهجين MFCC–wav2vec 2.0 تحت هذه الظروف. استُخدم هذا التصميم التجريبي لتقييم المساهمات الفردية والمشتركة لتمثيلات الميزات.
تحليل الدلالة الإحصائية
تم تقييم جميع تكوينات الميزات في هذه المقارنة باستخدام نفس المجموعة الفرعية من اللغة الإنجليزية، وتقسيمات متطابقة للبيانات على مستوى المتحدث، ونفس طيات التحقق المتقاطع الخمس. حقق النموذج المقترح دقة أعلى بشكل ملحوظ من تكوينات الميزات الخام (97.86 ± 0.23% مقابل 83.48 ± 0.24%؛ t (4) = 384.32, p < 0.001)، وتكوينات MFCC فقط (97.86 ± 0.23% مقابل 92.60 ± 0.32%؛ t (4) = 131.50, p < 0.001)، وتكوينات wav2vec 2.0 فقط (97.86 ± 0.23% مقابل 95.34 ± 0.24%؛ t (4) = 126.00, p < 0.001)، مما يؤكد أن التحسينات الناتجة عن دمج MFCC–wav2vec 2.0 كانت ذات دلالة إحصائية.
اعتبارات الذكاء الاصطناعي المسؤول وإرشادات النشر
تطلب الذكاء الاصطناعي المسؤول في التصنيف الديموغرافي القائم على الصوت مراعاة العدالة والشفافية والخصوصية وإمكانية إساءة الاستخدام والمخاطر المتعلقة بالنشر، بالإضافة إلى أداء التنبؤ. وعلى الرغم من أن تحليل المجموعات الفرعية قد قدم تقييماً تجريبياً لفروق الأداء عبر مجموعات النوع الاجتماعي واللغة التي تم تقييمها، إلا أنه لا يمكن إثبات العدالة فقط من خلال دقة التصنيف المتشابهة. وبناءً على ذلك، تم تقييم إطار عمل VoiceNet-RAI من منظورات متعددة للذكاء الاصطناعي المسؤول.
تحليل العدالة والتحيز
أُجري تحليل للعدالة عبر المجموعات الفرعية للجنس واللغة لتقييم خصائص الذكاء الاصطناعي المسؤول لإطار عمل VoiceNet-RAI المقترح. والنتائج معروضة في الجدول 11. وبالنسبة للتقييم حسب الجنس، تم تحليل أداء النموذج بشكل منفصل للمتحدثين من الذكور والإناث. وأظهرت النتائج تباينًا بنسبة أقل من 1.5% في الدقة ومقياس F1-score بين مجموعات الجنس التي تم تقييمها.
لإجراء تقييم من حيث اللغة، تم قياس الأداء عبر المجموعات اللغوية التي تم تقييمها ضمن مجموعة بيانات تضم 28 لغة. وأظهرت النتائج متوسط تباين أقل من 2% في الدقة عبر المجموعات التي خضعت للتقييم، مع ملاحظة تباين أكبر في بعض اللغات ذات الموارد المنخفضة التي تتوفر لها عينات أقل.
تم تقييم العدالة بشكل إضافي باستخدام فرق التكافؤ الديموغرافي، وفرق تكافؤ الفرص، ومعدل الإيجابيات الكاذبة (FPR)، ومعدل السلبيات الكاذبة (FNR). حيث قام فرق التكافؤ الديموغرافي بقياس الاختلافات في معدلات التنبؤ الإيجابي بين المجموعات، بينما قام فرق تكافؤ الفرص بقياس الاختلافات في معدلات الإيجابيات الحقيقية (TPRs). واستُخدم معدلا FPR وFNR لتوصيف أنماط الخطأ الخاصة بكل مجموعة فرعية. وقد استكملت هذه المقاييس دقة المستوى للمجموعة الفرعية ودرجة F1، مما وفر معلومات إضافية حول الاختلافات في أداء النموذج عبر المجموعات الديموغرافية واللغوية التي تم تقييمها. وبناءً على مجموعة البيانات وتعاريف المجموعات الفرعية التي خضعت للتقييم، أشارت النتائج إلى وجود اختلافات طفيفة نسبياً في الأداء عبر مجموعات الجنس واللغة التي تم تقييمها. ومع ذلك، اقتصرت هذه النتائج على المجموعات الديموغرافية واللغوية الممثلة في مجموعات البيانات التي تم تقييمها، ولم تثبت العدالة عبر السكان غير الممثلين أو بيئات النشر.
القابلية للتفسير والشفافية
جمع نموذج VoiceNet-RAI بين السمات الصوتية القابلة للتفسير القائمة على MFCC وتضمينات wav2vec 2.0 السياقية. وقد قيمت دراسة الاستئصال مساهمات تمثيلات السمات الفردية والمشتركة. ومع ذلك، ظلت تضمينات wav2vec 2.0 صعبة التفسير نسبيًا. وبناءً عليه، يمكن استقصاء طرق التفسير البعدية في الدراسات المستقبلية لتحديد السمات التي ساهمت بشكل أقوى في التنبؤات الفردية.
الحفاظ على الخصوصية
نظراً لأن التسجيلات الصوتية تحتوي على معلومات بيومترية حساسة، تطلب النشر الذي يحافظ على الخصوصية ممارسات تقليل البيانات، بما في ذلك معالجة المعلومات المطلوبة لمهمة التصنيف فقط وتجنب التخزين غير الضروري للصوت الخام. ومن شأن التخزين الآمن، والوصول المقيد، والاستدلال المحلي أن تقلل من مخاطر الخصوصية بشكل أكبر. لم يتم تقييم النهج الرسمية للحفاظ على الخصوصية، بما في ذلك الخصوصية التفاضلية، في الدراسة الحالية، وظلت مجالاً للبحث المستقبلي.
النشر المسؤول
يتطلب نشر VoiceNet-RAI إشرافاً بشرياً، واتخاذ قرارات قائمة على الوعي بمستوى الثقة، ومراقبة مستمرة للأداء. لا ينبغي استخدام التنبؤات ذات الثقة المنخفضة بشكل مستقل في القرارات الحرجة، كما يجب إعادة تقييم أداء النموذج عندما تختلف ظروف النشر بشكل جوهري عن الظروف الممثلة في مجموعات بيانات التدريب والتحقق.
المقارنة مع التقنيات الحديثة
يُعرض تقييم مقارن للإطار المقترح والنهج المنشورة سابقاً في الجدول 12. وقد أُخذت في الاعتبار الدراسات المنشورة بين عامي 2019 و2024، بما في ذلك النهج القائمة على تعلم الآلة (ML)، والتعلم العميق (DL)، والتعلم بنقل المعرفة (transfer learning). وشملت المقارنة الدراسات المبلغ عنها سابقاً في ذات مجال التطبيق. وكما هو موضح في الجدول 12، حقق الإطار المقترح دقة مُبلغاً عنها أعلى لتصنيف النوع والعمر مقارنة بالنهج المقارنة. ومع ذلك، ونظراً لاحتمالية اختلاف الدراسات في مجموعات البيانات، وإجراءات المعالجة المسبقة، وتقسيمات البيانات، وبروتوكولات التقييم، فإن المقارنة تعكس الأداء المُبلغ عنه وليس مقارنة تجريبية مباشرة ومضبوطة.
توفر البيانات:
إن بيانات الكلام الخام المستخدمة في هذه الدراسة متاحة للعموم من خلال مجموعة BVC Challenging Voice Set المستضافة على GitHub ومجموعة بيانات Mozilla Common Voice. يمكن الوصول إلى مجموعة بيانات BVC عبر الرابط https://github.com/OgeNI/BVC_Challenging_Voice_Set، بينما تتوفر مجموعة بيانات Common Voice على الرابط https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

الشكل 1: مخطط البنية. منهجية سير العمل الكاملة للإطار المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| المراجع | نماذج | مجموعات البيانات | النتائج |
| 19 | GBC، DT، RF، SVM، NN | مجموعة بيانات VoxForge | GBC 90% |
| 20 | مقياس رصين (Robustscaler)، وتحليل المكونات الرئيسية (PCA)، والانحدار اللوجستي (Logistic)
الانحدار، النموذج التسلسلي | voice.mozilla.org | النموذج التسلسلي 91%. |
| 21 | الشبكات العصبونية التلافيفية (CNN)، الشبكات العصبونية التلافيفية المتكررة (CRNN)، الشبكات العصبونية التلافيفية الزمنية (TCN) | مجموعة بيانات Mozilla Voice | 80% شبكة عصبونية تلافيفية (CNN) |
| 22, 23 | الانتشار العكسي، أشجار القرار، التجميع،
الغابات العشوائية، الجيران الأقرب، الشبكات العصبية العميقة، التعلم العميق | Kaggle، ومجموعة بيانات Mozilla Voice،
أرشيف لكنات الكلام | Kaggle: التجميع (Bagging)، والخوارزمية الجارة الأقرب (KNN)، والغابات العشوائية (RF)
98.10%. الصوت الشائع: Bagging 55.39%. لكنة الكلام: Bagging 78.94%. |
| 24 | الشبكات العصبية العميقة، البيرسيبترون متعدد الطبقات، الجيران الأقرب، آلات ناقلات الدعم، أشجار القرار، الغابات العشوائية،
نواة SVC RBF، وADA، وQDA، وGNB، وResNET34 وResNET50. | موزيلا كومون فويس (Mozilla Common Voice) | ResNET50 98.57%. |
| 25 | الشبكة العصبية الاصطناعية، آلات المتجهات الداعمة، الغابة العشوائية، شجرة القرار، ناييف بايز، الجيران الأقرب كـ | مدونة OGI Kids Speech الكلامية، خاصة
متن لغوي، مجموعة بيانات محددة، | للكشف عن النوع الاجتماعي باستخدام SVM بنسبة 98%،
للكشف عن العمر RF 95% |
| 26 | آلات المتجهات الداعمة، التحليل التمييزي، ناييف بايز، أشجار القرار، الجيران الأقرب، التعلم التجميعي-
ble, LightGBM | Mozilla Common Voice، VoxCeleb | LGBM 91% |
| 27 | الجار الأقرب (KNN)، آلات المتجهات الداعمة (SVM)، الانحدار الخطي (LR)، النزول الاشتقاقي العشوائي (SGD)، التكديس (Stacked)
نموذج | مصادر جندرية متنوعة | النموذج المكدس 99.64% |
| 28 | الشبكات العصبية العميقة، آلات المتجهات الداعمة | مصادر جندرية متنوعة | آلة المتجهات الداعمة 97% |
| 29 | آلات المتجهات الداعمة (SVM)، الغابات العشوائية (RF)، أشجار التصنيف والتحليل الانحداري (CART)، الجيران الأقرب (KNN) | تحتوي مجموعة البيانات على ٣١٦٩ حالة | عامل الاستخلاص 93% |
| 30 | الشبكة العصبية التلافيفية | مجموعة بيانات الخاضعين للدراسة النيجيريين | شبكة عصبونية تلافيفية (CNN) بنسبة 85.48%. |
| 31 | أشجار القرار، الغابات العشوائية، الجار الأقرب، الانحدار الخطي، آلات المتجهات الداعمة، الشبكات العصبية الاصطناعية،
الشبكة العصبية التلافيفية ثنائية الأبعاد (CNN2D) | ٣ مجموعات بيانات من kaggle | التنبؤ بالجنس: الشبكة العصبية الاصطناعية 85.51%،
توقع العمر: الشبكة العصبية الاصطناعية 89.20%. |
الجدول 1: ملخص للدراسات الحالية حول تصنيف الجنس والعمر بناءً على الصوت، بما في ذلك النماذج ومجموعات البيانات والأداء المسجل.
| خصائص مجموعة البيانات | الوصف / القيمة |
| إجمالي عدد المتحدثين | 526 |
| المتحدثون الذكور | 336 |
| المتحدثات الإناث | 190 |
| إجمالي التسجيلات | حوالي 3,964 |
| عدد اللغات | 28 |
| التوزيع اللغوي | اللغة الإنجليزية و28 لغة أصلية (الأفيمامي، والأكوكو-إيدو، والأنانغ، إيفيك، وإيكوي، والفولاني، والهوسا، وإيبيبـيو، وإيدوما، وإيغالا، والإيغبو، وإيغيدي، وإيجاو، وإيكا، وإيكوم، وإيكويري، وإيشان، وكايري-كايري، والكانوري، ولوكا، وأورهوبو، واليوروبا، وأوبودو، وأوغوني، وأوكوبو، وأوكيريكا، والتيي، وأوكواني. وتعد قبيلة الإيغبو هي القبيلة المهيمنة من بين هذه اللغات الأصلية في مجموعة البيانات. |
| الفئات العمرية | ثلاث مجموعات عمرية: الشباب (المراهقون ومن هم في العشرينيات)، والبالغون (من هم في الثلاثينيات والأربعينيات والخمسينيات)، وكبار السن (من هم في الستينيات والسبعينيات والثمانينيات من العمر) |
| توزيع الفئات العمرية | المراهقون (13–19 سنة) منخفض (< 10%) العشرينات 20-29 سنة مرتفع جداً (~35-45%) الثلاثينات 30-39 سنة مرتفع (~20-30%) الأربعينات 40-49 سنة متوسط (~10-15%) الخمسينات 50-59 سنة منخفض (~5-10%) الستينات +60-80+ سنة نادر (< 5%) |
| مدة التسجيل | 3-10 ثوانٍ |
| ظروف التسجيل | تعديل نبضي كودي (PCM) بدقة 16 بت |
| معدل أخذ العينات الأصلي | 44.1 kHz |
| معدل أخذ عينات المعالجة | 16 كيلوهرتز |
| طول إطار معاملات التردد الميلّي-سبري (MFCC) | 25 ملي ثانية |
| تداخل/خطوة إطارات معاملات التردد الميللي ثانية (MFCC) | ١٠ مللي ثانية |
| تمثيل معاملات التردد الميللي-سيبسيري (MFCC) | متجه متوسط زمنياً ذو 39 بُعداً |
| تمثيل wav2vec 2.0 | متجه بـ 768 بُعداً مجمّع زمنياً بمتوسط حسابي |
| التمثيل المدمج النهائي | ٨٠٧ أبعاد |
| تقسيم بيانات التدريب والاختبار | 80:20 |
| تقسيم البيانات | تقسيم مستقل عن المتحدث |
| التحقق المتقاطع | التحقق المتقاطع خماسي الطيات |
| مجموعة بيانات التحقق الخارجية | موزيلا كومون فويس (Mozilla Common Voice) |
الجدول 2: الخصائص الديموغرافية، وتغطية اللغة، وتقسيم البيانات، وإعدادات المعالجة المسبقة لمجموعة بيانات الكلام المستخدمة في VoiceNet-RAI.
| مَعلَمَة | القيمة / الوصف |
| إطار عمل | PyTorch |
| الأجهزة والمعدات | وحدة معالجة الرسوميات NVIDIA (المعمقة بتقنية CUDA) |
| البذرة العشوائية | 42 |
| المُحسِّن | آدم |
| معدل التعلم الأولي | 1 × 10−4 |
| β₁ / β₂ | 0.9 / 0.999 |
| آدم إبسلون | 1 × 10⁻⁸ |
| حجم الدفعة | 64 |
| العصور التدريبية | 50 (صبر التوقف المبكر = 8) |
| دالة الخسارة | الإنتروبيا المتقاطعة الفئوية |
| المعايرة | تسوية درجة Z (Z-score normalization) |
| مجدول معدل التعلم | تقليل معدل التعلم عند الثبات (ReduceLROnPlateau) |
| معدل التسرب | 0.3 |
| وقت التدريب | ٢٠ دقيقة |
| وقت الاستنتاج/للعينة | ١٣ ثانية |
| استخلاص الميزات | استخراج الميزات |
| معاملات الترددات الملوّنة الميليمترية (MFCC) | 40 |
| حجم النافذة | ٢٥ ميلي ثانية |
| خطوة | ١٠ ملي ثانية |
| نسخة wav2vec | بعد التضمين الأساسي (المُدرَّب مسبقاً) |
| استراتيجية التجميع | التجميع المتوسط (Mean pooling) |
| دمج السمات | الدمج (MFCC + wav2vec) |
| معاملات الترددات الميلكونية لـ سيفيسورنتس (MFCC) | 40 |
| بروتوكول التقييم | بروتوكول التقييم |
| تقسيم بيانات التدريب والاختبار | فصل على مستوى المتحدث |
| التحقق المتبادل | خماسي الطيات |
| مجموعات البيانات | مجموعة بيانات Mozilla Common Voice (28 لغة + مجموعة فرعية باللغة الإنجليزية) ومجموعة BVC Gender &؛ مجموعة بيانات تحدي تقدير العمر من الصوت |
| المهام | تصنيف النوع والعمر |
الجدول 3: تكوين التدريب، وإعدادات استخراج الميزات، والمعلمات الفائقة، وبروتوكول التقييم المستخدم لـ VoiceNet-RAI.
| النماذج | الدقة (Accuracy) | ضبط الدقة (Precision) | الاستدعاء (Recall) | مقياس F1 (F1-score) |
| RF | 71.42 | 72.79 | 74.43 | 73.52 |
| LR | 73.59 | 74.22 | 75.40 | 74.34 |
| ETC | 72.44 | 72.33 | 74.52 | 73.41 |
| SVM | 73.52 | 72.60 | 72.39 | 72.48 |
| CNN | 75.71 | 76.59 | 77.34 | 77.43 |
| VGG19 | 70.56 | 73.28 | 75.07 | 74.17 |
| ResNet | 74.37 | 73.49 | 76.68 | 75.54 |
| EfficientNet-Lite | 83.48 | 82.87 | 84.28 | 83.54 |
| MobileNet | 81.33 | 83.19 | 82.14 | 83.11 |
| InceptionV3 | 80.77 | 81.34 | 82.67 | 82.52 |
الجدول 4: أداء نماذج تعلم الآلة (ML) والتعلم العميق (DL) في تصنيف الجنس باستخدام مجموعة بيانات مكونة من 28 لغة بدون ميزات MFCC.
| النماذج | الدقة | الإحكام | الاستدعاء | مقياس F1 |
| RF | 84.57 | 86.53 | 87.39 | 87.42 |
| LR | 83.25 | 84.42 | 85.64 | 84.98 |
| ETC | 83.59 | 84.25 | 86.36 | 85.43 |
| SVM | 85.47 | 83.37 | 85.26 | 84.29 |
| CNN | 88.60 | 86.75 | 88.46 | 87.35 |
| VGG19 | 87.48 | 85.49 | 85.80 | 85.58 |
| ResNet | 89.43 | 84.39 | 82.34 | 83.67 |
| EfficientNet-Lite | 92.64 | 93.79 | 94.92 | 94.84 |
| MobileNet | 91.39 | 90.64 | 91.15 | 91.07 |
| InceptionV3 | 90.24 | 88.81 | 90.70 | 89.83 |
الجدول 5: أداء تصنيف النوع الاجتماعي لنماذج تعلم الآلة (ML) والتعلم العميق (DL) باستخدام ميزات معامل التردد الميلى-سيبسترالي (MFCC) على مجموعة بيانات مكونة من 28 لغة.
| النماذج | الدقة | الدقة | الاستدعاء | مقياس F1 |
| تردد راديوي | 88.36 | 90.91 | 89.94 | 90.86 |
| الاستجابة المناعية (LR) | 90.64 | 92.24 | 91.30 | 91.34 |
| سلسلة نقل الإلكترونات | 91.49 | 92.80 | 92.79 | 92.79 |
| آلة المتجهات الداعمة (SVM) | 92.58 | 92.75 | 90.64 | 91.52 |
| الشبكات العصبية الالتفافية | 93.69 | 94.69 | 94.53 | 94.34 |
| VGG19 | 91.37 | 92.64 | 93.48 | 93.21 |
| شبكة ResNet | 95.28 | 96.39 | 95.52 | 95.43 |
| EfficientNet-Lite | 97.87 | 98.61 | 98.70 | 98.65 |
| شبكة موبايل نت (MobileNet) | 96.41 | 95.51 | 96.39 | 96.24 |
| InceptionV3 | 96.35 | 95.29 | 96.84 | 96.08 |
الجدول 6: أداء تصنيف الجنس لنماذج تعلم الآلة (ML) والتعلم العميق (DL) باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0 على المجموعة الفرعية للغة الإنجليزية.
| النماذج | الدقة | الإحكام | الاستدعاء | مقياس F1 |
| الطي الأول | 97 | 93 | 96 | 94 |
| الطي الثاني | 96 | 94 | 96 | 95 |
| الطي الثالث | 97 | 94 | 95 | 95 |
| الطي الرابع | 96 | 93 | 95 | 94 |
| الطي الخامس | 97 | 94 | 96 | 95 |
| المتوسط | 96.6 | 93.6 | 95.6 | 94.6 |
الجدول 7: أداء التحقق المتقاطع خماسي الطيات لنموذج VoiceNet-RAI على المجموعة الفرعية للغة الإنجليزية.
| النماذج | الدقة | الإحكام | الاستدعاء | مقياس F1 |
| RF | 80.15 | 78.68 | 79.27 | 79.04 |
| LR | 81.28 | 80.69 | 80.43 | 80.54 |
| ETC | 80.58 | 81.21 | 80.82 | 81.04 |
| SVM | 82.54 | 81.31 | 82.14 | 81.78 |
| CNN | 85.27 | 84.39 | 84.47 | 84.43 |
| VGG19 | 83.73 | 82.97 | 83.53 | 83.48 |
| ResNet | 82.68 | 81.42 | 80.78 | 81.95 |
| EfficientNet-Lite | 88.42 | 86.56 | 87.21 | 86.97 |
| MobileNet | 85.23 | 85.64 | 85.95 | 85.81 |
| InceptionV3 | 86.67 | 85.86 | 86.78 | 86.35 |
الجدول 8: أداء نماذج تعلم الآلة (ML) والتعلم العميق (DL) في تصنيف العمر من حيث الدقة (accuracy)، والضبط (precision)، والاستذكار (recall)، ومقياس F1-score.
| النماذج | الدقة | الدقة | الاسترجاع | مقياس F1 |
| التردد الراديوي (RF) | 90.47 | 92.82 | 90.85 | 91.32 |
| التحلل السكري (LR) | 89.75 | 90.44 | 89.61 | 90.03 |
| سلسلة نقل الإلكترونات | 92.63 | 91.29 | 91.55 | 91.42 |
| آلة المتجهات الداعمة (SVM) | 90.69 | 91.84 | 91.81 | 91.82 |
| الشبكة العصبية التلافيفية (CNN) | 94.63 | 95.52 | 94.24 | 94.94 |
| VGG19 | 92.12 | 91.34 | 90.52 | 91.10 |
| الشبكة العصبية المتبقية (ResNet) | 92.19 | 91.98 | 92.27 | 92.25 |
| EfficientNet-Lite | 98.27 | 98.63 | 98.44 | 98.56 |
| MobileNet | 97.28 | 96.36 | 97.01 | 96.40 |
| InceptionV3 | 95.85 | 96.18 | 97.35 | 97.17 |
الجدول 9: نتائج التحقق الخارجي لتصنيف الجنس على مجموعة بيانات Mozilla Common Voice باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0.
| تكوين الميزات | الدقة (%) | الإحكام (%) | مقياس F1 (%) |
| الميزات الخام (بدون MFCC) | 83.48 | 82.87 | 83.54 |
| MFCC فقط | 92.64 | 93.79 | 94.84 |
| wav2vec 2.0 فقط | 95.34 | 96.32 | 95.18 |
| MFCC + wav2vec (المقترح) | 97.87 | 98.61 | 98.65 |
الجدول 10: تحليل الاستئصال لتمثيلات الميزات باستخدام EfficientNet-Lite.
| مجموعة التقييم | مجموعة فرعية | الدقة (%) | مقياس F1 (%) | معدل الإيجابيات الكاذبة | اختزال النترات (FNR) | فرق التكافؤ الديموغرافي | فرق تكافؤ الفرص |
| الجنس | ذكر | 97.95 | 97.95 | 0.021 | 0.024 | _ | _ |
| الجنس | أنثى | 97.62 | 98.50 | 0.024 | 0.027 | _ | _ |
| التفاوت بين الجنسين | الذكر مقابل الأنثى | _ | _ | _ | _ | 0.012 | 0.003 |
| اللغات غنية الموارد | 98.10 | 98.80 | 0.018 | 0.021 | _ | _ |
| اللغات شحيحة الموارد | 96.85 | 97.90 | 0.031 | 0.034 | _ | _ |
| التفاوت اللغوي | مرتفع مقابل منخفض | _ | _ | _ | _ | 0.028 | 0.014 |
الجدول 11: تقييم العدالة عبر المجموعات الفرعية للجنس وموارد اللغة.الاختصارات: FPR = معدل الإيجابيات الكاذبة؛ FNR = معدل السلبيات الكاذبة. يمثل الفرق في التكافؤ الديموغرافي والفرق في تكافؤ الفرص التفاوتات بين المجموعات، لذا يتم الإبلاغ عنها لمقارنات المجموعات الفرعية بدلاً من المجموعات الفردية. وتشير قيم التفاوت المنخفضة إلى سلوك أكثر اتساقاً للنموذج عبر المجموعات.
| المرجع | المنهجية | الدقة |
| 16 | سرطان المرارة | 90%. |
| 17 | النموذج التسلسلي | 91% |
| 18 | الشبكات العصبونية الالتفافية | 80% |
| 19 | التجميع (Bagging)، والخوارزمية الأقرب للجيران (KNN)، والغابات العشوائية (RF) | 98.10%. |
| 20 | ResNET50 | 98.57%. |
| 21 | آلة ناقلات الدعم (SVM) | 98% |
| 22 | LGBM | 91% |
| 23 | النموذج المتراكم | 99.64% |
| 24 | آلة المتجهات الداعمة (SVM) | 97% |
| 25 | التردد الراديوي | 93% |
| 26 | الشبكات العصبونية التلافيفية | 85.48% |
| 27 | الشبكات العصبية الاصطناعية | 89.20% |
| تتناول هذه الدراسة | EfficientNet-Lite | 97.87% |
الجدول 12: مقارنة دقة VoiceNet-RAI مع النهج الرائدة التي تم الإبلاغ عنها سابقاً لتصنيف النوع والعمر بناءً على الصوت.