مقالة بحثية

VoiceNet: إطار عمل للذكاء الاصطناعي المسؤول متعدد اللغات في التعرف على الكلام لتصنيف النوع الاجتماعي والعمر

48 مشاهدة

سبتمبر 11, 2026

في هذه المقالة

ملخص

يدمج VoiceNet-RAI سمات MFCC، وتضمينات wav2vec 2.0 متعددة اللغات، ونموذج EfficientNet-Lite لتصنيف النوع والعمر من البيانات الصوتية. ويحقق هذا الإطار دقة تصل إلى 97.87% في المجموعة الفرعية للغة الإنجليزية، كما يدعم التطبيقات المسؤولة في مجالات التعرف على الكلام، والمصادقة، والأدلة الجنائية الرقمية.

الملخص

يعد التصنيف الدقيق للجنس والعمر من خلال بيانات الصوت أمرًا بالغ الأهمية لتحقيق تفاعل بشري-حاسوبي (HCI) مخصص وآمن وأخلاقي. ومع الاستخدام المتزايد لنماذج الكلام الضخمة مسبقة التدريب مثل wav2vec 2.0، برزت الحاجة إلى الاستفادة من هذه التمثيلات بشكل مسؤول للاستدلال الديموغرافي متعدد اللغات والمراعي للخصوصية. تقترح هذه الدراسة VoiceNet-RAI، وهو إطار عمل للتعلم العميق (DL) يدمج معاملات كبسترال التردد الميلي (MFCCs) مع تضمينات wav2vec 2.0 متعددة اللغات القائمة على المحولات (transformer) ضمن بنية EfficientNet-Lite لدعم تصنيف دقيق وعادل وشفاف عبر سياقات لغوية متنوعة. يجمع إطار العمل بين المعلومات السياقية والطيفية لتحسين المتانة في ظل ظروف تسجيل متغيرة. وقد أظهرت التجارب على بيانات كلام متعددة اللغات تغطي 28 لغة أداءً قويًا في التصنيف، حيث حققت المجموعة الفرعية للغة الإنجليزية دقة بلغت 97.87%، ودقة تحديد (precision) بنسبة 98.61%، واستدعاء (recall) بنسبة 98.70%، ودرجة F1 بلغت 98.65%. وأسفر التحقق الخارجي باستخدام مجموعة بيانات Mozilla Common Voice عن دقة بلغت 98.27% لتصنيف الجنس، مما يثبت إمكانية التعميم على مجموعة بيانات مستقلة. كما أظهر تحليل الاستئصال (Ablation analysis) أن دمج ميزات MFCC و wav2vec 2.0 قد حسن الأداء مقارنة بالتمثيلات الخام أو تلك المعتمدة على MFCC وحدها. وتبرهن هذه النتائج على إمكانات تمثيلات الكلام الهجينة الطيفية-السياقية في تحقيق تصنيف قوي ومسؤول للجنس والعمر.

المقدمة

يُعد التعرف على الصوت مكونًا أساسيًا في التواصل البشري، حيث يعبر الأفراد من خلاله عن مشاعرهم وأفكارهم وأهدافهم. وتنتج الأصوات البشرية عبر عملية بيولوجية يتم فيها زفير الهواء من الرئتين وتشكيله إلى صوت بواسطة أعضاء النطق مثل الشفتين واللسان والأسنان1. وتلعب الأذن دورًا جوهريًا في تحديد الصوت، حيث يمكنها التمييز بين أصوات الذكور والإناث بناءً على خصائص مثل مستوى الصوت وطبقة الصوت. ومن الخصائص التي تساهم في وجود فروق جوهرية في طبقة الصوت بين الذكور والإناث هي ثنائية الشكل الجنسي2. ويعد تصنيف العمر والجنس من خلال الصوت أمرًا ذا صلة بالعديد من التطبيقات، بما في ذلك التفاعل بين الإنسان والآلة، والتعرف الآلي على الجنس، والتحيات المخصصة، والتصنيف المسبق لعواطف الكلام، وتصنيف المكالمات بناءً على الجنس3.

يُعد الكلام جزءاً جوهرياً من التفاعل البشري. إذ يحتوي الصوت البشري على خصائص متعددة تختلف من فرد لآخر، ويمكن أن توفر معلومات عن الحالات العاطفية والنفسية، فضلاً عن العمر والجنس. ويمكن الاستفادة من هذه الخصائص متعددة الأبعاد في تطبيقات مثل أنظمة الأمان المعتمدة على الصوت والمساعدات الذكية القائمة على الذكاء الاصطناعي (AI) الموجهة للكلام. وتشمل المجالات الأخرى التي يبرز فيها تحليل الصوت أنظمة التحقق التلقائي من المتحدث (ASV) وأنظمة الذكاء الاصطناعي القائمة على العواطف. كما يمكن لأنظمة الإدخال المعتمدة على الصوت أن تقلل من نطاق البحث ضمن قواعد البيانات4,5. بالإضافة إلى ذلك، يمكن لأنظمة الأمان القائمة على الذكاء الاصطناعي استخدام بيانات الصوت في تطبيقات مثل التحقيقات الجنائية وحماية الضحايا. وتظهر أصوات الذكور والإناث خصائص مختلفة بسبب التباينات في الخصائص الرنينية للمسلك الصوتي. ويمكن استخلاص هذه الخصائص من إشارات الكلام في شكل مناسب للمعالجة الحسابية، مما يتيح تصنيف الجنس من بيانات الصوت6,7. وبناءً على ذلك، تبرز الحاجة إلى خوارزميات تعلم فعالة لتصنيف الجنس المعتمد على الصوت. وتعتبر خوارزميات التعلم العميق (DL) مناسبة بشكل خاص للتصنيفات المتعلقة بالكلام نظراً لقدرتها على تعلم أنماط معقدة من البيانات الصوتية. وقد تحتوي هذه النماذج على طبقات تلافيفية، أو متكررة، أو تلافيفية زمنية، أو طبقات متصلة بالكامل، وذلك حسب البنية المعمارية. ويمكن لهذه الطبقات تعلم الخصائص الصوتية ذات الصلة، بما في ذلك النبرة وطبقة الصوت. وبمجرد تدريب النموذج، يمكنه تصنيف الجنس من تسجيلات صوتية لم يسبق له رؤيتها8. ومن المجالات الهامة الأخرى في أبحاث تعلم الآلة (ML) تصنيف العمر من التسجيلات الصوتية؛ حيث يمكن لخوارزميات تعلم الآلة استخدام الخصائص الصوتية مثل طبقة الصوت، وجرس الصوت، والسعة لتحديد الأنماط المرتبطة بالعمر. كما يمكن تطبيق تقنيات مثل تحليل المكونات الرئيسية (PCA) لاستخلاص أنماط معلوماتية من بيانات الكلام، مما قد يؤدي إلى تحسين أداء التصنيف9.

لقد أظهر التعلم العميق (DL) أداءً قوياً في تطبيقات مثل التعرف على الصور والعواطف والكلام. وتُستخدم الشبكات العصبية العميقة (DNNs)، على وجه الخصوص، على نطاق واسع في المهام المتعلقة بالكلام. وفي هذه الدراسة، يتم تطبيق مناهج قائمة على التعلم العميق لتصنيف الصوت بالاقتران مع تقنيات استخلاص الميزات الراسخة. حيث تلتقط معاملات السبيكترال الترددية لـ ميل (MFCCs) الخصائص الطيفية ذات الصلة لإشارات الكلام وتوفر تمثيلاً فعالاً للمعالجة اللاحقة. ثم يتم دمج الميزات المستخلصة لاحقاً في إطار عمل للتعلم النقلي لتصنيف النوع والعمر بناءً على الصوت10,11.

اعتمدت الدراسات الحديثة بشكل متزايد على تمثيلات الكلام ذاتية الإشراف والقائمة على محولات Transformer لتصنيف سمات المتحدث. وقد بحث الباحثون في التحيزات الديموغرافية، بما في ذلك التحيزات المتعلقة بالنوع الاجتماعي والعمر، في نماذج الكلام ذاتية الإشراف مثل HuBERT و wav2vec 2.0، مما يسلط الضوء على أهمية التقييم الواعي بالعدالة12. وفي الآونة الأخيرة، أظهرت النهج المستقلة عن اللغة والقائمة على محولات Transformer فعالية تمثيلات الكلام السياقية المتعلمة للتعرف على النوع الاجتماعي في ظل ظروف متعددة اللغات وظروف صاخبة13. كما بحث Sinha وزملاؤه بشكل أعمق في تمثيلات wav2vec 2.0 على مستوى الطبقات لتصنيف العمر والنوع الاجتماعي، وأظهروا أن طبقات Transformer المختلفة تلتقط مستويات متفاوتة من المعلومات المتعلقة بالمتحدث14. وتحفز هذه التطورات إطار عمل VoiceNet-RAI المقترح، الذي يجمع بين المعلومات الطيفية التقليدية القائمة على MFCC وتمثيلات wav2vec 2.0 السياقية، مع دمج اعتبارات تعدد اللغات والذكاء الاصطناعي المسؤول.

أظهرت الدراسات الحديثة أنه يمكن توصيف عمر المتحدث وجنسه باستخدام كل من السمات الصوتية التقليدية والتمثيلات القائمة على التعلم العميق. وقد بينت المنهجيات التي تجمع بين المعلومات الصوتية والزمنية أن خصائص الكلام التكاملية يمكن أن تحسن من أداء تصنيف العمر والجنس15,16. كما أثبتت الأبحاث ذات الصلة أن سمات الكلام المحولة التي يتم إنتاجها باستخدام تمثيلات عنق الزجاجة العميقة (deep bottleneck representations) يمكن أن تحسن أداء تصنيف عمر المتحدث وجنسه17. وتدعم هذه النتائج التوسع في استخدام التمثيلات الطيفية والزمنية والمتعلمة لمهام التصنيف التي تتضمن الكلام والإشارات المشتقة منه.

بحثت دراسات عدة في التعرف على العمر والجنس من خلال الكلام باستخدام مناهج التعلم الآلي والتعلم العميق18,19,20,21,22,23,24,25,26,27,28,29,30. وقد استكشفت مناهج أكثر حداثة تمثيلات MFCC المحولة والشبكات العصبية العميقة لتصنيف عمر وجنس المتحدث31، بينما تظل التباينات متعددة اللغات والمعتمدة على اللغة اعتبارات مهمة عند تطوير أنظمة تصنيف ديموغرافية قوية تعتمد على الصوت. إذ يمكن أن تؤدي الاختلافات في النطق والبنية الصوتية وخصائص المتحدث وظروف التسجيل إلى تقليل قدرة النموذج على التعميم عبر اللغات والمجموعات السكانية المختلفة. وبناءً على ذلك، فإن استخدام تمثيلات كلام طيفية وسياقية تكميلية قد يعزز من قوة النظام في البيئات متعددة اللغات.

على الرغم من أن النهج الهجينة قد جمعت سابقاً بين سمات صوتية متعددة أو مصنفات تجميعية للتعرف على البيانات الديموغرافية بناءً على الصوت، إلا أن VoiceNet-RAI يختلف من خلال دمج مستويين متكاملين من تمثيل الكلام ضمن إطار عمل موحد. وتحديداً، تحافظ سمات MFCC التقليدية على الخصائص الطيفية والصوتية الموضعية، بينما يوفر wav2vec 2.0 تمثيلات سياقية يتم تعلمها من الكلام الخام باستخدام مشفر Transformer. وبدلاً من الاعتماد حصرياً على الواصفات الصوتية المصممة يدوياً أو تمثيل عميق واحد، يقوم VoiceNet-RAI بعملية دمج على مستوى السمات لتمثيلات MFCC وwav2vec 2.0 المجمعة زمنياً، ثم يقوم بتنقية التمثيل الهجين الناتج باستخدام EfficientNet-Lite. ومن ثم، تكمن الجدة العلمية في التكامل المنسق بين التمثيلات الطيفية، والسياقية ذاتية الإشراف، والتمثيلات العميقة خفيفة الوزن لتصنيف الجنس والعمر، جنباً إلى جنب مع التقييم متعدد اللغات، والتحقق من صحة البيانات باستخدام مجموعة بيانات مستقلة، وتحليل العدالة بين المجموعات الفرعية. ويعمل هذا المزيج على توسيع خطوط أنابيب تصنيف الكلام الهجينة التقليدية لتتجاوز دمج السمات الموجه نحو الدقة، وصولاً إلى إطار عمل يأخذ في الاعتبار في آن واحد تكامل التمثيلات، وتصميم النماذج خفيفة الوزن، وقابلية التعميم، والذكاء الاصطناعي المسؤول (Responsible AI).

تشمل المساهمات الرئيسية لهذا البحث تطوير نهج لتحديد الجنس والعمر من بيانات الصوت من خلال دمج سمات MFCC وwav2vec 2.0 مع EfficientNet-Lite. وقد أُجريت تجارب مكثفة على مجموعة بيانات من التسجيلات الصوتية بـ 28 لغة، حيث تم تقييم السمات الأصلية، وسمات MFCC، وسمات wav2vec 2.0، ومجموعاتها باستخدام نماذج التعلم الآلي (ML) والتعلم العميق (DL). كما تم تقييم أداء النموذج باستخدام كل من مجموعة البيانات متعددة اللغات الكاملة والمجموعة الفرعية للغة الإنجليزية. علاوة على ذلك، تم تقييم الإطار من منظور تعدد اللغات والذكاء الاصطناعي المسؤول من خلال تحليلات المجموعات الفرعية الخاصة بالجنس واللغة، والتقييم المستقل عن المتحدث، والتحقق باستخدام مجموعة بيانات Mozilla Common Voice. بالإضافة إلى ذلك، تمت مقارنة أداء الإطار المقترح مع أحدث النهج الواردة في الأدبيات الحالية، وتم تقديم نتائج التحقق المتقاطع. وقد أُجريت مجموعة كبيرة من الأبحاث ذات الصلة، ويلخص الجدول 1 هذه الدراسات، بما في ذلك النماذج ومجموعات البيانات والنتائج المسجلة19,20,21,22,23,24,25,26,27,28,29,30,31.

البروتوكول

استخدمت هذه الدراسة مجموعات بيانات BVC Challenging Voice Set وMozilla Common Voice المتاحة للعموم دون مشاركة مباشرة من المشاركين. وبناءً على ذلك، لم تكن هناك حاجة للحصول على موافقة أخلاقية مؤسسية أو موافقة مستنيرة إضافية. تمت معالجة البيانات الضرورية فقط لتصنيف الجنس والعمر، ولم يتم إجراء أي محاولة لتحديد هوية المتحدثين الأفراد. وتظهر منهجية سير العمل الكاملة للإطار المقترح في الشكل 1.

جمع البيانات

تكونت مجموعة البيانات المستخدمة في النهج المقترح من ملفات صوتية بصيغة .wav تم الحصول عليها من مجموعة BVC Challenging Voice Set، وهي مجموعة بيانات صوتية متاحة للعامة طورتها مجموعة Biometrics Vision and Computing (BVC) ومستضافة على GitHub32. احتوت مجموعة البيانات على تسجيلات صوتية لـ 526 شخصاً، بما في ذلك 336 متحدثاً من الذكور و190 متحدثة من الإناث. وقد شملت ما يقرب من 3,964 تسجيلاً، تضمنت تسجيلات لجملة واحدة وجمل متعددة لكل متحدث. ويلخص الجدول 2 الخصائص الديموغرافية، والتغطية اللغوية، وخصائص التسجيل، واستراتيجية تقسيم البيانات، وإعدادات المعالجة المسبقة المستخدمة لمجموعات بيانات الكلام في إطار عمل VoiceNet-RAI المقترح.

استخلاص الميزات

تمت معالجة الملفات الصوتية لاستخراج الخصائص الأساسية، والتي تم تخزينها لاحقاً في ملف CSV. كما استُخرجت البيانات الوصفية، بما في ذلك العمر والجنس ونطق المتحدث، من ملفات README المقابلة. استُخدمت لغة Python، جنباً إلى جنب مع حزمة SciPy، لمعالجة ملفات WAV واستخراج الميزات ذات الصلة. ووظفت دوال تحويل فوريه السريع (FFT) والتردد في NumPy لتحويل الإشارات الصوتية من النطاق الزمني إلى النطاق الترددي. مثلت ملفات WAV السعة كدالة في الزمن؛ ومع ذلك، كانت الخصائص المرتبطة بالتردد، والتي يمكنها التمييز بين أصوات الذكور والإناث، ذات أهمية أكبر لمهمة التصنيف33.

لتحويل الإشارات الصوتية إلى تمثيلات في نطاق التردد، تم تطبيق تحويل فوريه المتقطع (DFT) باستخدام خوارزمية FFT. يقوم تحويل فوريه بتحويل الإشارة من النطاق الزمني إلى طيف ترددي. ونظراً لأن هذا الطيف لا يحافظ على المعلومات الزمنية، فقد تم تقسيم الإشارة الصوتية إلى مقاطع متداخلة، وطُبق تحويل فوريه على كل مقطع باستخدام منهج تحويل فوريه قصير المدى (STFT). قامت الدالة np.fft.fft بتوليد طيف التردد المركب، بينما وفرت الدالة np.fft.fftfreq ترددات العينات المقابلة. توفر في دليل العينات 10 ملفات صوتية لمتحدث واحد. تمت معالجة كل ملف WAV باستخدام نوافذ منزلقة بزمن 200 ms لاستخراج الترددات السائدة. على سبيل المثال، أنتج تسجيل صوتي مدته 4 ثوانٍ قائمة تضم 20 قيمة ترددية. وبالنسبة لدليل يحتوي على 10 تسجيلات، دُمجت القوائم العشر المقابلة، والتي تحتوي كل منها على 20 قيمة ترددية، في قائمة من القوائم. كما تم ترشيح الترددات للاحتفاظ بالقيم الواقعة بين 20 Hz و 280 Hz، مع استبعاد الضوضاء المحتملة حول 50 Hz.

تمثيل الميزات الهجين باستخدام MFCC و wav2vec 2.0

لالتقاط كلاً من تمثيلات الكلام السياقية عالية المستوى والخصائص الصوتية منخفضة المستوى، استخدمت هذه الدراسة استراتيجية هجينة لاستخراج الميزات تدمج ميزات MFCC مع تضمينات wav2vec 2.0 القائمة على نموذج Transformer.

استخراج ميزات MFCC

تُعد معاملات السيبسترال بتردد ميل (MFCCs) ميزات مستخدمة على نطاق واسع في معالجة الكلام وإشارات الصوت، لا سيما في تطبيقات مثل التعرف على الكلام وتحديد هوية المتحدث34,35. وفي هذه الدراسة، عمل استخراج MFCC على تحويل الإشارات الصوتية إلى متجهات ميزات تمثل الخصائص ذات الصلة بالإدراك الحسي للكلام. بدأت العملية بالتركيز المسبق (pre-emphasis) لتعزيز المكونات عالية التردد، يليه التأطير والتقطيع النافذي (framing and windowing) لتقسيم الإشارة إلى إطارات قصيرة ومتداخلة. أولاً، تمت إعادة أخذ عينات من كل عينة صوتية بتردد 16 kHz وتقسيمها إلى إطارات مدتها 25-ms مع تداخل قدره 10-ms. ثم طُبق تحويل فوريه السريع (Fast Fourier Transform) على كل إطار لتحويل الإشارة من المجال الزمني إلى المجال الترددي.

تم تمرير طيف التردد الناتج عبر سلسلة من بنوك مرشحات ميل (Mel filter banks) التي تحاكي الاستجابة الترددية غير الخطية للإدراك السمعي البشري. وقد ركزت بنوك المرشحات هذه على الترددات الأكثر أهمية من الناحية الإدراكية مع تقليل مساهمة الترددات الأقل إفادة. بعد ذلك، تم حساب اللوغاريتم لمخرجات كل بنك مرشحات لمحاكاة الحساسية اللوغاريتمية للسمع البشري تجاه الجهارة. ثم طُبِّق تحويل جيب التمام المتقطع (DCT) على طاقات بنوك المرشحات اللوغاريتمية لإزالة الارتباط بين المعاملات وإنتاج تمثيل مدمج للإشارة الصوتية. وقد التقطت المعاملات الناتجة، والمعروفة باسم MFCCs، الخصائص الطيفية الهامة للكلام. استُخدمت MFCCs لتصنيف الجنس والعمر لأنها التقطت الخصائص الصوتية التي تميز الأصوات وفقاً لهذه السمات.

استخراج التضمينات باستخدام wav2vec 2.0

تم تدريب نموذج wav2vec 2.0 Base مسبقاً على مجموعات بيانات كلامية ضخمة غير مصنفة. ويتكون النموذج من مشفر Transformer متعدد الطبقات يقوم بمعالجة مدخلات شكل الموجة الخام وتوليد تضمينات كلامية سياقية36.

بناءً على شكل موجي مدخل x ∈ RT، ينتج نموذج wav2vec 2.0 تسلسلاً من التمثيلات الكامنة:

Z = {z1,z1,....,zn},zi ∈ R768  (1)

حيث كانت أبعاد كل متجه تضمين 768. وللحصول على تمثيل ثابت الطول ومناسب للتصنيف، تم تطبيق عملية تجميع متوسط زمني (temporal mean pooling) عبر جميع الخطوات الزمنية.

figure-protocol-1   (2)

آلية دمج الميزات

تم دمج ميزات MFCC وwav2vec 2.0 عبر التسلسل على مستوى الميزات. وتحديداً، تم تجميع ميزات MFCC أولاً باستخدام المتوسط الزمني لإنتاج متجه ثابت الطول.

m ∈ R40  (3)

تم الحصول على متجه الميزات الهجين النهائي كما يلي:

h = [m || zpooled] ∈ R808  (4)

حيث يشير الرمز || إلى عملية التسلسل. وقد جمع هذا الدمج بين التضمينات السياقية العميقة والميزات الطيفية المصممة يدويًا، مما مكن النموذج من التقاط كل من المعلومات الدلالية رفيعة المستوى والأنماط الصوتية دقيقة التفاصيل.

أولاً، تمت إعادة أخذ عينات من جميع العينات الصوتية بتردد 16 kHz. حُسبت ميزات MFCC لكل إطار على حدة ثم أُجري لها متوسط زمني لإنتاج متجه ثابت بأبعاد 40، بينما تم تجميع تضمينات wav2vec 2.0 بالمتوسط عبر الزمن لإنتاج تمثيل بأبعاد 768. ونظراً لتحويل مجموعتي الميزات إلى متجهات ثابتة الطول قبل الدمج، لم تكن هناك حاجة للمحاذاة الزمنية على مستوى الإطار. بعد ذلك، تم دمج تمثيلات MFCC و wav2vec الناتجة في متجه ميزات هجين بأبعاد 808 قبل تمريره إلى نموذج التصنيف.

التكامل مع EfficientNet-Lite

تمت إعادة تشكيل متجه السمات المدمج، h، إلى تنسيق مناسب لتعلم السمات وتقديمه كمدخل لنموذج EfficientNet-Lite من أجل التدريب. قامت طبقة إسقاط متصلة بالكامل أولاً بخرائط المتجه ذو الـ 808 أبعاد إلى فضاء كامن أعلى أبعاداً، وبعد ذلك قامت كتل EfficientNet-Lite بتنقية السمات الهرمية. واستُخدمت طبقات تطبيع الدفعات (Batch normalization) وطبقات الإسقاط (dropout) لتقليل الإفراط في التخصيص وتحسين تعميم النموذج. كما استُخدمت دالة التنشيط SoftMax لتوليد الاحتمالات المتوقعة النهائية لفئات الجنس والعمر. عومل التمثيل المدمج، h ∈ R808، في البداية كمتجه سمات أحادي البعد ومُرِّر عبر طبقة إسقاط متصلة بالكامل قامت بخرائطه إلى 4,096 بُعداً. ثم أُعيد تشكيل التمثيل المُسقط إلى موتر (tensor) بأبعاد 1 × 64 × 64 قبل تزويده بمعمارية EfficientNet-Lite.

لمواءمة تمثيل سمات الكلام أحادي القناة، بدلاً من إدخال الصور التقليدي ثلاثي القنوات، تم تعديل طبقة التلافيف المدخلة في نموذج EfficientNet-Lite الأصلي من ثلاث قنوات إدخال إلى قناة واحدة. كما تم الاحتفاظ ببقية كتل استخراج السمات في EfficientNet-Lite دون تعديلات هيكلية رئيسية. وطُبقت طبقة تجميع متوسط عام تكيفية (adaptive global average pooling layer) على خرائط السمات النهائية لإنتاج تمثيل ثابت الطول. واستُبدل رأس التصنيف الأصلي بطبقة متصلة بالكامل مخصصة للمهمة، تحتوي على وحدتي إخراج لتصنيف النوع الاجتماعي، والعدد المقابل من وحدات الإخراج لمجموعات العمر المحددة مسبقاً. وأخيراً، طُبقت دالة التنشيط SoftMax لتوليد احتمالات الفئات. وقد دمج التمثيل الهجين المقترح بين تضمينات الكلام ذاتية الإشراف الحديثة وسمات معالجة الإشارات التقليدية؛ حيث التقطت تضمينات wav2vec 2.0 المعلومات السياقية والتبعيات طويلة المدى، بينما وفرت سمات MFCC معلومات صوتية تكميلية منخفضة المستوى. وقد أدى دمج هذه التمثيلات إلى تحسين أداء التصنيف، لا سيما في ظروف الكلام الضوضائية ومتعددة اللغات.

مصنف تعلم الآلة

في هذا البحث، تم تحليل أداء خوارزميات تعلم آلي (ML) متعددة لتصنيف النوع الاجتماعي والفئة العمرية استناداً إلى الصوت.

الغابة العشوائية (Random Forest)

استُخدمت الغابة العشوائية (Random Forest - RF) كـمُصنف قوي من مُصنفات تعلم الآلة (ML)، حيث تجمع بين عدة أشجار قرار (DTs) لتحسين دقة التنبؤ والحد من الإفراط في التخصيص (overfitting). تعمل الغابة العشوائية من خلال إجراء تعلّم تجميعي (ensemble-learning) يتم فيه تجميع التنبؤات من أشجار متعددة لإنتاج التنبؤ النهائي37,38. وقد مكن هذا النهج الغابة العشوائية من رصد أنماط متنوعة في البيانات مع تقليل الإفراط في التخصيص المرتبط عادةً بأشجار القرار الفردية. كما أدت العشوائية المُدخلة أثناء بناء الأشجار إلى تحسين قدرة النموذج على التعميم، مما جعل الغابة العشوائية مناسبة لمهام التصنيف مثل تصنيف الجنس والعمر من بيانات الصوت.

الانحدار اللوجستي

استُخدم الانحدار اللوجستي (LR) كنموذج إحصائي للتعلم الآلي (ML) لأغراض التصنيف39. وفي حالة التصنيف الثنائي، يقوم الانحدار اللوجستي بتقدير احتمالية حدوث نتيجة معينة بناءً على الميزات المدخلة باستخدام الدالة اللوجستية (sigmoid)، وتُستخدم الاحتمالات الناتجة لتوليد تنبؤات الفئات. كما كان الانحدار اللوجستي قابلاً للتطبيق على مشكلات التصنيف متعدد الفئات التي تتضمن أكثر من فئتين؛ حيث استخدم في التصنيف متعدد الفئات مناهج مثل "واحد مقابل البقية" (one-vs-rest) أو انحدار SoftMax، وذلك اعتماداً على إعدادات التصنيف.

مصنف الأشجار الإضافية

استُخدم مصنف الأشجار الإضافية (ETC) كخوارزمية تعلم تجميعي تجمع بين عدة أشجار قرار (DTs) لتوليد التنبؤات40,41. وبخلاف الغابات العشوائية (RF)، يقدم مصنف ETC عشوائية إضافية من خلال اختيار الميزات المرشحة وعتبات التقسيم بشكل عشوائي أثناء بناء الشجرة. وقد أنتج هذا الإجراء أشجاراً أقل ارتباطاً وقلل من حساسية النموذج للميزات الفردية، مما أدى إلى تحسين المتانة تجاه الضجيج. كما استُخدم مؤشر جيني (Gini index) كمعيار تقسيم لتقييم أهمية الميزات وتجزئة البيانات.

آلة متجه الدعم

تم استخدام آلة متجه الدعم (SVM) كمصنف تعلم آلي (ML) لتحديد حد قرار مثالي في فضاء ميزات عالي الأبعاد42. وكان الهدف هو تحديد مستوي فائق يحقق أقصى هامش بين الفئات. وبوجه عام، يدعم الهامش الأكبر بين حد القرار وأقرب نقاط البيانات فصلاً أفضل للفئات وقدرة أعلى على التعميم. وكانت آلة متجه الدعم قابلة للتطبيق في العديد من مهام التعلم الآلي، بما في ذلك التصنيف، والانحدار، وتحليل البيانات القائم على الميزات.

الشبكات العصبية التلافيفية

استُخدمت الشبكات العصبية الالتفافية (CNNs) كنماذج للتعلم العميق (DL) في مهام التصنيف التي تتضمن تمثيلات منظمة لبيانات الصور والصوت. كما طُبقت الشبكات العصبية الالتفافية أحادية الأبعاد (1D-CNNs) على نطاق واسع في البيانات التسلسلية والنصية. وتستخدم بنيات الشبكات العصبية الالتفافية المرشحات الالتفافية وعمليات التجميع لاستخلاص الميزات التمييزية من البيانات المدخلة43,44. ومن أجل تصنيف الجنس والعمر من بيانات الصوت، طُبقت الشبكات العصبية الالتفافية على التمثيلات المشتقة من الكلام لتعلم الأنماط المرتبطة بطبقة الصوت والتردد والنبرة والخصائص الصوتية الأخرى ذات الصلة بتمييز المجموعات العمرية والجنس.

VGG19

استُخدمت بنية VGG19 كبنية للتعلم العميق (DL) تتميز بهيكل هرمي عميق وموحد نسبيًا لاستخلاص الميزات45. وقد اعتمدت بنيتها على مرشحات تلافيفية صغيرة بحجم 3 × 3 عبر 19 طبقة، مما أتاح استخلاصًا تدريجيًا للميزات التمييزية. وعند تطبيقها على التمثيلات المشتقة من الكلام، تمكنت VGG19 من التقاط كل من الأنماط الصوتية منخفضة المستوى، مثل تغيرات طبقة الصوت والتردد، والميزات التمييزية عالية المستوى. كما أتاحت بنيتها العميقة تجريدًا تدريجيًا للميزات لنمذجة الخصائص الصوتية المرتبطة بالجنس والعمر.

EfficientNet-Lite

استُخدم EfficientNet-Lite كبنية للتعلم العميق (DL) تتسم بالكفاءة الحسابية46,47. وقد اعتمد النموذج استراتيجية قياس متوازنة لتحقيق أداء تصنيف قوي مع طلب موارد حسابية أقل مقارنة ببنيات التعلم العميق الأكثر تعقيداً. كما أخذ نهج القياس المركب الخاص به في الاعتبار عمق النموذج وعرضه ودقة المدخلات بشكل مشترك لتحقيق استخراج فعال للميزات.

تم اختيار EfficientNet-Lite لإطار عمل VoiceNet-RAI المقترح نظراً لبنيته خفيفة الوزن والتوازن الملحوظ بين أداء التصنيف وتعقيد النموذج. وبالمقارنة مع البنى الأكثر تعقيداً، فقد استخدم كتل تلافيفية فعالة وتحجيماً مركباً لتحقيق تعلم فعال للميزات بمعلمات أقل ومتطلبات حسابية منخفضة. جعلت هذه الخصائص EfficientNet-Lite مناسباً لإطار عمل تصنيف الكلام المقترح، ووفرت إمكانية نشره في البيئات محدودة الموارد.

MobileNet

استُخدم نموذج MobileNet كبنية خفيفة للتعلم العميق (DL) للتطبيقات ذات الموارد الحسابية المحدودة، بما في ذلك بيئات الحوسبة المتنقلة وحوسبة الحافة48. وقد تحققت كفاءته الحسابية بشكل أساسي من خلال الالتفافات القابلة للفصل بعمق (depthwise separable convolutions)، والتي قللت من عدد المعاملات والعمليات الحسابية مقارنة ببنيات الالتفاف التقليدية. جعلت هذه الخصائص MobileNet مناسباً لتقييم تصنيف الجنس والعمر من بيانات الصوت مع الحفاظ على متطلبات حسابية منخفضة نسبياً.

InceptionV3

استُخدم نموذج InceptionV3 كبنية عميقة لاستخراج السمات الهرمية من التمثيلات المشتقة من الكلام49. وتضمنت هذه البنية عمليات تلافيفية، وعمليات تجميع، وعمليات مختلطة لاستخراج السمات عند مستويات مختلفة من التجريد. ولغرض تصنيف النوع والعمر من بيانات الصوت، استُخدم InceptionV3 لتعلم الأنماط الصوتية المعقدة والتمثيلات الهرمية المرتبطة بالتباينات في الخصائص الصوتية.

معايير التقييم

كانت الدقة أحد أكثر مقاييس التقييم استخداماً لمهام التصنيف50. ورغم أن الدقة قدمت مقياساً مفيداً للأداء العام للتصنيف، إلا أنها لم توفر دائماً تقييماً شاملاً، لا سيما في حالات مجموعات البيانات غير المتوازنة. وبناءً على ذلك، تم استخدام مقاييس إضافية، بما في ذلك الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score، لتقييم أداء النموذج. وقد وفرت هذه المقاييس تقييماً أكثر شمولاً من خلال مراعاة التنبؤات الصحيحة والخاطئة لكل فئة.

عُرِفت الدقة بأنها نسبة الملاحظات المصنفة بشكل صحيح إلى إجمالي عدد الملاحظات. ورغم أن الدقة كانت مفيدة بشكل خاص لمجموعات البيانات المتوازنة، إلا أن مجموعة البيانات المستخدمة في هذه الدراسة كانت غير متوازنة. وبناءً على ذلك، تم أخذ الإيجابيات الحقيقية (TP)، والإيجابيات الكاذبة (FP)، والسلبيات الحقيقية (TN)، والسلبيات الكاذبة (FN) في الاعتبار عند حساب وتفسير مقاييس التصنيف. وتمثل المعادلة أدناه التعريف القياسي للدقة:

الدقة =  (TP+TN)/(TP+TN+FP+FN)×100  (5)

تقيس الدقة (Precision) قدرة المصنف على استرجاع الحالات ذات الصلة فقط:

الدقة=  TP/(TP+FP)  ×100   (6)

يقيس الاسترجاع، المعروف أيضاً بالحساسية، قدرة المصنف على تحديد جميع الحالات ذات الصلة:

الاستدعاء (Recall)=  TP/(FN+TP) × 100   (7)

تجمع قيمة F1-score بين الدقة (precision) والاسترجاع (recall) في مقياس واحد، وهي مفيدة بشكل خاص لتقييم أداء التصنيف في مجموعات البيانات غير المتوازنة:

F1-Score =2 ×(PPV ×TPR)/(TPR+PPV) × 100   (8)

النتائج

تم تقييم النتائج التجريبية لتصنيف العمر والجنس باستخدام تمثيلات ميزات تعتمد على MFCC وتمثيلات هجينة مع نماذج التعلم الآلي (ML) والتعلم العميق (DL). تم تقسيم مجموعة البيانات إلى مجموعات تدريب واختبار بنسبة 80:20، حيث استُخدمت 80% للتدريب و20% للاختبار. كما تم تطبيق التقسيم على مستوى المتحدث لمنع ظهور تسجيلات المتحدث نفسه في كلتا المجموعتين.

تم تلخيص المعاملات الفائقة وتفاصيل تنفيذ الإطار المقترح في الجدول 3. أُجريت التجارب على نظام مجهز بمعالج Intel i7-8265U CPU، وذاكرة وصول عشوائي (RAM) بسعة 16 GB، ووحدة معالجة رسومات NVIDIA Tesla K80 GPU تعمل بنظام التشغيل Windows 11. استُخدمت لغة Python ومكتبة Scikit-learn لتطوير نماذج تعلم الآلة (ML)، بينما تم تنفيذ إطار التعلم العميق (DL) المقترح باستخدام PyTorch. وقد تم تقييم هذه النماذج لتصنيف الجنس والعمر من بيانات الصوت.

تم استخدام مُحسِّن Adam بمعدل تعلم أولي قدره 1 × 10⁻4، وβ₂ = 0.999، وε = 1 × 10⁻8. كما استُخدم حجم دفعة قدره 64 وبحد أقصى 50 حقبة تدريبية (epoch)، مع ضبط التوقف المبكر على فترة صبر تبلغ أربع حقبات لتقليل الإفراط في الضبط. وطُبق معدل إسقاط (dropout rate) قدره 0.3 على الطبقات كاملة الاتصال لأغراض التنظيم. واستُخدم الإنتروبيا المتقاطعة الفئوية (Categorical cross-entropy) كدالة خسارة لمهام التصنيف. كما استُخدم مجدول معدل التعلم ReduceLROnPlateau لمراقبة خسارة التحقق.

لمنع تسريب البيانات وضمان تقييم عادل، تم تطبيق تقسيم على مستوى المتحدث بحيث لا يظهر أي متحدث في مجموعتي التدريب والاختبار معاً. بالإضافة إلى ذلك، تم إجراء تحقق متبادل خماسي الطيات (five-fold cross-validation) لتقييم قدرة النموذج المقترح على التعميم ومدى متانته.

نتائج النماذج التي استخدمت مجموعة البيانات الأصلية

يوضح الجدول 4 أداء العديد من نماذج تعلم الآلة (ML) والتعلم العميق (DL) لتصنيف الجنس على مجموعة بيانات تضم 28 لغة، دون استخدام ميزات MFCC. وقد استُخدمت الدقة (Precision)، والاستدعاء (Recall)، ومقياس F1-score، والدقة العامة (Accuracy) كمعايير للتقييم.

من بين النماذج التي تم تقييمها، حقق EfficientNet-Lite أعلى دقة بنسبة 83.48%، وبدقة تحديد (precision) بلغت 82.87%، واستدعاء (recall) بنسبة 84.28%، ودرجة F1-score بلغت 83.54%. كما أظهر MobileNet وInceptionV3 أداءً جيداً، حيث حقق MobileNet دقة بنسبة 81.33% ودرجة F1-score بلغت 83.11%، وحقق InceptionV3 دقة بنسبة 80.77% ودرجة F1-score بلغت 82.52%. وحقق نموذج CNN دقة بنسبة 75.71% ودرجة F1-score بلغت 77.43%، بينما حقق ResNet دقة بنسبة 74.37% ودرجة F1-score بلغت 75.54%. أما نماذج SVM وRF وLR وETC فقد حققت دقة تراوحت بين 71.42% و73.59% ودرجات F1-score تراوحت بين 72.48% و74.34%. وسجل VGG19 دقة أقل نسبياً بلغت 70.56%، مع استدعاء بنسبة 75.07% ودرجة F1-score بلغت 74.17%. وبشكل عام، حقق EfficientNet-Lite وMobileNet أقوى أداء بين النماذج التي تم تقييمها عند استخدام الميزات الأصلية.

نتائج النماذج التي تستخدم ميزات MFCC

تم تقييم سمات MFCC لاحقاً لتصنيف النوع الاجتماعي. يقارن الجدول 5 أداء نماذج التعلم الآلي (ML) والتعلم العميق (DL) باستخدام سمات MFCC على مجموعة البيانات التي تضم 28 لغة.

حقق نموذج EfficientNet-Lite أعلى أداء، حيث بلغت الدقة (accuracy) 92.64%، والدقة المحددة (precision) 93.79%، والاستدعاء (recall) 94.92%، ومقياس F1-score 94.84%. وحقق نموذج MobileNet دقة بلغت 91.39% ومقياس F1-score بلغ 91.07%، بينما حقق نموذج InceptionV3 دقة بلغت 90.24% ومقياس F1-score بلغ 89.83%. وحقق نموذج ResNet دقة بلغت 89.43% ومقياس F1-score بلغ 83.67%، في حين حقق نموذج CNN دقة بلغت 88.60% ومقياس F1-score بلغ 87.35%. أما نموذج VGG19 فقد حقق دقة بلغت 87.48% ومقياس F1-score بلغ 85.58%.

من بين نماذج تعلم الآلة (ML) التقليدية، حقق نموذج SVM دقة بلغت 85.47% ودرجة F1-score بلغت 84.29%؛ وحقق RF دقة بلغت 84.57% ودرجة F1-score بلغت 87.42%؛ وحقق LR دقة بلغت 83.25% ودرجة F1-score بلغت 84.98%؛ بينما حقق ETC دقة بلغت 83.59% ودرجة F1-score بلغت 85.43%. وبوجه عام، أدى إدراج سمات MFCC إلى تحسين أداء معظم النماذج مقارنة بالنتائج التي تم الحصول عليها باستخدام السمات الأصلية. وقد حقق EfficientNet-Lite أعلى أداء إجمالي في هذه التجربة.

نتائج النماذج التي تستخدم ميزات hybrid MFCC–wav2vec 2.0 مع مجموعة البيانات باللغة الإنجليزية

قامت المجموعة التالية من التجارب بتقييم تصنيف الجنس باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0 على المجموعة الفرعية للغة الإنجليزية. ويُعرض أداء النماذج التي تم تقييمها في الجدول 6. وقد حقق نموذج EfficientNet-Lite أعلى أداء، بدقة بلغت 97.87%، ودقة تحديد (precision) بلغت 98.61%، واستدعاء (recall) بنسبة 98.70%، ومقياس F1-score بنسبة 98.65%.

من بين نماذج تعلم الآلة (ML) التقليدية، حقق نموذج SVM دقة بلغت 92.58% ومقياس F1-score بلغ 91.52%؛ وحقق نموذج ETC دقة بلغت 91.49% ومقياس F1-score بلغ 92.79%؛ وحقق نموذج LR دقة بلغت 90.64% ومقياس F1-score بلغ 91.34%؛ بينما حقق نموذج RF دقة بلغت 88.36% ومقياس F1-score بلغ 90.86%. وبشكل عام، أظهرت النماذج أداءً قوياً في المجموعة الفرعية للغة الإنجليزية، حيث حقق نموذج EfficientNet-Lite أعلى القيم عبر مقاييس التقييم المذكورة.

نتائج التحقق المتبادل خماسي الطيات

تم إجراء عملية تحقق تبادلي خماسي الطيات (Five-fold cross-validation) لتقييم استقرار وقابلية تعميم الإطار المقترح. وتظهر نتائج التحقق التبادلي التي تم الحصول عليها باستخدام مجموعة بيانات الأصوات باللغة الإنجليزية في الجدول 7. حقق نموذج EfficientNet-Lite انحرافاً معيارياً قدره ±0.0033 عبر الطيات الخمس. ويشير هذا التباين المنخفض عبر الطيات إلى أداء مستقر في ظل إعدادات التحقق التبادلي التي تم تقييمها.

تصنيف العمر باستخدام بيانات الصوت

بالإضافة إلى تصنيف الجنس، تم تقييم تصنيف العمر باستخدام نماذج متعددة وميزات MFCC. يوضح الجدول 8 أداء النماذج التي تم تقييمها لتصنيف العمر.

أظهرت النتائج أن نماذج التعلم بنقل المعرفة حققت دقة تجاوزت 85%، حيث حقق نموذج MobileNet دقة بلغت 85.23% وحقق نموذج InceptionV3 دقة بلغت 86.67%. وسجل نموذج EfficientNet-Lite أعلى أداء تم رصده، بدقة بلغت 88.42%، ودقة تنبؤ (precision) بلغت 86.56%، ومعدل استدعاء (recall) بلغ 87.21%.

التحقق من صحة الإطار المقترح

لتقييم الإطار المقترح على مجموعة بيانات خارجية، أُجريت تجارب إضافية باستخدام مجموعة بيانات Mozilla Common Voice51. احتوت مجموعة البيانات على ما يقرب من 500 ساعة من تسجيلات كلام مجمعة جماعيًا مع البيانات الديموغرافية المرتبطة بها، بما في ذلك العمر والجنس ومعلومات اللهجة. وقد نُظمت هذه المدونة إلى مجموعات فرعية محددة مسبقًا للتدريب والتطوير والاختبار. عُولجت التسجيلات الصوتية باستخدام نفس خط معالجة البيانات المسبقة المستخدم في التجارب الأساسية، بما في ذلك إعادة أخذ العينات بتردد 16 kHz، واستخراج سمات MFCC ذات 40 بُعدًا، وتوليد تضمينات wav2vec 2.0 ذات 768 بُعدًا. دُمج هذان التمثيلان لإنتاج متجه سمات هجين ذي 808 أبعاد استخدمه نموذج VoiceNet-RAI. وتظهر نتائج التحقق في الجدول 9.

حققت نموذج EfficientNet-Lite، مع تمثيل الميزات الهجين من المستويين المنخفض والعالي، دقة في تصنيف الجنس بلغت 98.27%، وهي أعلى من دقة النماذج الأخرى التي تم تقييمها. ومن بين نماذج التعلم الآلي (ML)، حقق RF دقة بلغت 90.47%، وحقق SVM دقة 90.69%، بينما حقق LR دقة 89.75%. ومن بين نماذج التعلم العميق (DL) الأخرى، حقق ResNet دقة بلغت 92.19%، في حين حقق VGG19 دقة 92.12%. القيم المقابلة للدقة (precision) والاسترجاع (recall) ومقياس F1-score موثقة في الجدول 9.

دراسة الاستئصال لتمثيل الميزات ودمجها

أُجريت دراسة استئصال (ablation study) لتقييم مساهمة تمثيلات الميزات المستخدمة في الإطار المقترح. وقد نُظر في أربعة تكوينات: الميزات الخام/الأصلية، وميزات MFCC فقط، وتضمينات wav2vec 2.0 فقط، والتمثيل الهجين المقترح MFCC–wav2vec 2.0. استُخدم نموذج EfficientNet-Lite كنموذج ممثل لأنه حقق أعلى أداء عبر الإعدادات التجريبية التي تم تقييمها. وتظهر نتائج دراسة الاستئصال في الجدول 10.

حقق النموذج المرجعي باستخدام الميزات الخام دقة بلغت 83.48%، بينما حقق التمثيل القائم على MFCC دقة بنسبة 92.64% ودرجة F1-score بلغت 94.84%. وحقق التمثيل الهجين MFCC–wav2vec 2.0 دقة بنسبة 97.87% ودرجة F1-score بلغت 98.65%. وفي ظل ظروف تدريب وتقسيمات بيانات متطابقة للغة الإنجليزية، حقق التمثيل الهجين MFCC–wav2vec 2.0 دقة بنسبة 97.87%، مقارنة بنسبة 92.64% للتمثيل القائم على MFCC فقط.

أُجريت تجارب مضبوطة باستخدام تقسيمات بيانات وإعدادات تدريب متطابقة وبنية EfficientNet-Lite لتقييم مساهمة كل تمثيل للميزات. وتمت مقارنة الميزات الخام/الأصلية، والميزات المعتمدة على MFCC فقط، وتضمينات wav2vec 2.0 فقط، والتمثيل الهجين MFCC–wav2vec 2.0 تحت هذه الظروف. استُخدم هذا التصميم التجريبي لتقييم المساهمات الفردية والمشتركة لتمثيلات الميزات.

تحليل الدلالة الإحصائية

تم تقييم جميع تكوينات الميزات في هذه المقارنة باستخدام نفس المجموعة الفرعية من اللغة الإنجليزية، وتقسيمات متطابقة للبيانات على مستوى المتحدث، ونفس طيات التحقق المتقاطع الخمس. حقق النموذج المقترح دقة أعلى بشكل ملحوظ من تكوينات الميزات الخام (97.86 ± 0.23% مقابل 83.48 ± 0.24%؛ t (4) = 384.32, p < 0.001)، وتكوينات MFCC فقط (97.86 ± 0.23% مقابل 92.60 ± 0.32%؛ t (4) = 131.50, p < 0.001)، وتكوينات wav2vec 2.0 فقط (97.86 ± 0.23% مقابل 95.34 ± 0.24%؛ t (4) = 126.00, p < 0.001)، مما يؤكد أن التحسينات الناتجة عن دمج MFCC–wav2vec 2.0 كانت ذات دلالة إحصائية.

اعتبارات الذكاء الاصطناعي المسؤول وإرشادات النشر

تطلب الذكاء الاصطناعي المسؤول في التصنيف الديموغرافي القائم على الصوت مراعاة العدالة والشفافية والخصوصية وإمكانية إساءة الاستخدام والمخاطر المتعلقة بالنشر، بالإضافة إلى أداء التنبؤ. وعلى الرغم من أن تحليل المجموعات الفرعية قد قدم تقييماً تجريبياً لفروق الأداء عبر مجموعات النوع الاجتماعي واللغة التي تم تقييمها، إلا أنه لا يمكن إثبات العدالة فقط من خلال دقة التصنيف المتشابهة. وبناءً على ذلك، تم تقييم إطار عمل VoiceNet-RAI من منظورات متعددة للذكاء الاصطناعي المسؤول.

تحليل العدالة والتحيز

أُجري تحليل للعدالة عبر المجموعات الفرعية للجنس واللغة لتقييم خصائص الذكاء الاصطناعي المسؤول لإطار عمل VoiceNet-RAI المقترح. والنتائج معروضة في الجدول 11. وبالنسبة للتقييم حسب الجنس، تم تحليل أداء النموذج بشكل منفصل للمتحدثين من الذكور والإناث. وأظهرت النتائج تباينًا بنسبة أقل من 1.5% في الدقة ومقياس F1-score بين مجموعات الجنس التي تم تقييمها.

لإجراء تقييم من حيث اللغة، تم قياس الأداء عبر المجموعات اللغوية التي تم تقييمها ضمن مجموعة بيانات تضم 28 لغة. وأظهرت النتائج متوسط تباين أقل من 2% في الدقة عبر المجموعات التي خضعت للتقييم، مع ملاحظة تباين أكبر في بعض اللغات ذات الموارد المنخفضة التي تتوفر لها عينات أقل.

تم تقييم العدالة بشكل إضافي باستخدام فرق التكافؤ الديموغرافي، وفرق تكافؤ الفرص، ومعدل الإيجابيات الكاذبة (FPR)، ومعدل السلبيات الكاذبة (FNR). حيث قام فرق التكافؤ الديموغرافي بقياس الاختلافات في معدلات التنبؤ الإيجابي بين المجموعات، بينما قام فرق تكافؤ الفرص بقياس الاختلافات في معدلات الإيجابيات الحقيقية (TPRs). واستُخدم معدلا FPR وFNR لتوصيف أنماط الخطأ الخاصة بكل مجموعة فرعية. وقد استكملت هذه المقاييس دقة المستوى للمجموعة الفرعية ودرجة F1، مما وفر معلومات إضافية حول الاختلافات في أداء النموذج عبر المجموعات الديموغرافية واللغوية التي تم تقييمها. وبناءً على مجموعة البيانات وتعاريف المجموعات الفرعية التي خضعت للتقييم، أشارت النتائج إلى وجود اختلافات طفيفة نسبياً في الأداء عبر مجموعات الجنس واللغة التي تم تقييمها. ومع ذلك، اقتصرت هذه النتائج على المجموعات الديموغرافية واللغوية الممثلة في مجموعات البيانات التي تم تقييمها، ولم تثبت العدالة عبر السكان غير الممثلين أو بيئات النشر.

القابلية للتفسير والشفافية

جمع نموذج VoiceNet-RAI بين السمات الصوتية القابلة للتفسير القائمة على MFCC وتضمينات wav2vec 2.0 السياقية. وقد قيمت دراسة الاستئصال مساهمات تمثيلات السمات الفردية والمشتركة. ومع ذلك، ظلت تضمينات wav2vec 2.0 صعبة التفسير نسبيًا. وبناءً عليه، يمكن استقصاء طرق التفسير البعدية في الدراسات المستقبلية لتحديد السمات التي ساهمت بشكل أقوى في التنبؤات الفردية.

الحفاظ على الخصوصية

نظراً لأن التسجيلات الصوتية تحتوي على معلومات بيومترية حساسة، تطلب النشر الذي يحافظ على الخصوصية ممارسات تقليل البيانات، بما في ذلك معالجة المعلومات المطلوبة لمهمة التصنيف فقط وتجنب التخزين غير الضروري للصوت الخام. ومن شأن التخزين الآمن، والوصول المقيد، والاستدلال المحلي أن تقلل من مخاطر الخصوصية بشكل أكبر. لم يتم تقييم النهج الرسمية للحفاظ على الخصوصية، بما في ذلك الخصوصية التفاضلية، في الدراسة الحالية، وظلت مجالاً للبحث المستقبلي.

النشر المسؤول

يتطلب نشر VoiceNet-RAI إشرافاً بشرياً، واتخاذ قرارات قائمة على الوعي بمستوى الثقة، ومراقبة مستمرة للأداء. لا ينبغي استخدام التنبؤات ذات الثقة المنخفضة بشكل مستقل في القرارات الحرجة، كما يجب إعادة تقييم أداء النموذج عندما تختلف ظروف النشر بشكل جوهري عن الظروف الممثلة في مجموعات بيانات التدريب والتحقق.

المقارنة مع التقنيات الحديثة

يُعرض تقييم مقارن للإطار المقترح والنهج المنشورة سابقاً في الجدول 12. وقد أُخذت في الاعتبار الدراسات المنشورة بين عامي 2019 و2024، بما في ذلك النهج القائمة على تعلم الآلة (ML)، والتعلم العميق (DL)، والتعلم بنقل المعرفة (transfer learning). وشملت المقارنة الدراسات المبلغ عنها سابقاً في ذات مجال التطبيق. وكما هو موضح في الجدول 12، حقق الإطار المقترح دقة مُبلغاً عنها أعلى لتصنيف النوع والعمر مقارنة بالنهج المقارنة. ومع ذلك، ونظراً لاحتمالية اختلاف الدراسات في مجموعات البيانات، وإجراءات المعالجة المسبقة، وتقسيمات البيانات، وبروتوكولات التقييم، فإن المقارنة تعكس الأداء المُبلغ عنه وليس مقارنة تجريبية مباشرة ومضبوطة.

توفر البيانات:

إن بيانات الكلام الخام المستخدمة في هذه الدراسة متاحة للعموم من خلال مجموعة BVC Challenging Voice Set المستضافة على GitHub ومجموعة بيانات Mozilla Common Voice. يمكن الوصول إلى مجموعة بيانات BVC عبر الرابط https://github.com/OgeNI/BVC_Challenging_Voice_Set، بينما تتوفر مجموعة بيانات Common Voice على الرابط https://www.kaggle.com/datasets/mozillaorg/common-voice/data.

figure-results-1
الشكل 1: مخطط البنية. منهجية سير العمل الكاملة للإطار المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

المراجعنماذجمجموعات البياناتالنتائج
19GBC، DT، RF، SVM، NNمجموعة بيانات VoxForgeGBC 90%
20مقياس رصين (Robustscaler)، وتحليل المكونات الرئيسية (PCA)، والانحدار اللوجستي (Logistic)
الانحدار، النموذج التسلسلي
voice.mozilla.orgالنموذج التسلسلي 91%.
21الشبكات العصبونية التلافيفية (CNN)، الشبكات العصبونية التلافيفية المتكررة (CRNN)، الشبكات العصبونية التلافيفية الزمنية (TCN)مجموعة بيانات Mozilla Voice80% شبكة عصبونية تلافيفية (CNN)
22, 23الانتشار العكسي، أشجار القرار، التجميع،
الغابات العشوائية، الجيران الأقرب، الشبكات العصبية العميقة، التعلم العميق
Kaggle، ومجموعة بيانات Mozilla Voice،
أرشيف لكنات الكلام
Kaggle: التجميع (Bagging)، والخوارزمية الجارة الأقرب (KNN)، والغابات العشوائية (RF)
98.10%. الصوت الشائع: Bagging 55.39%. لكنة الكلام: Bagging 78.94%.
24الشبكات العصبية العميقة، البيرسيبترون متعدد الطبقات، الجيران الأقرب، آلات ناقلات الدعم، أشجار القرار، الغابات العشوائية،
نواة SVC RBF، وADA، وQDA، وGNB، وResNET34 وResNET50.
موزيلا كومون فويس (Mozilla Common Voice)ResNET50 98.57%.
25الشبكة العصبية الاصطناعية، آلات المتجهات الداعمة، الغابة العشوائية، شجرة القرار، ناييف بايز، الجيران الأقرب كـمدونة OGI Kids Speech الكلامية، خاصة
متن لغوي، مجموعة بيانات محددة،
للكشف عن النوع الاجتماعي باستخدام SVM بنسبة 98%،
للكشف عن العمر RF 95%
26آلات المتجهات الداعمة، التحليل التمييزي، ناييف بايز، أشجار القرار، الجيران الأقرب، التعلم التجميعي-
ble, LightGBM
Mozilla Common Voice، VoxCelebLGBM 91%
27الجار الأقرب (KNN)، آلات المتجهات الداعمة (SVM)، الانحدار الخطي (LR)، النزول الاشتقاقي العشوائي (SGD)، التكديس (Stacked)
نموذج
مصادر جندرية متنوعةالنموذج المكدس 99.64%
28الشبكات العصبية العميقة، آلات المتجهات الداعمةمصادر جندرية متنوعةآلة المتجهات الداعمة 97%
29آلات المتجهات الداعمة (SVM)، الغابات العشوائية (RF)، أشجار التصنيف والتحليل الانحداري (CART)، الجيران الأقرب (KNN)تحتوي مجموعة البيانات على ٣١٦٩ حالةعامل الاستخلاص 93%
30الشبكة العصبية التلافيفيةمجموعة بيانات الخاضعين للدراسة النيجيريينشبكة عصبونية تلافيفية (CNN) بنسبة 85.48%.
31أشجار القرار، الغابات العشوائية، الجار الأقرب، الانحدار الخطي، آلات المتجهات الداعمة، الشبكات العصبية الاصطناعية،
الشبكة العصبية التلافيفية ثنائية الأبعاد (CNN2D)
٣ مجموعات بيانات من kaggleالتنبؤ بالجنس: الشبكة العصبية الاصطناعية 85.51%،
توقع العمر: الشبكة العصبية الاصطناعية 89.20%.

الجدول 1: ملخص للدراسات الحالية حول تصنيف الجنس والعمر بناءً على الصوت، بما في ذلك النماذج ومجموعات البيانات والأداء المسجل.

خصائص مجموعة البياناتالوصف / القيمة
إجمالي عدد المتحدثين526
المتحدثون الذكور336
المتحدثات الإناث190
إجمالي التسجيلاتحوالي 3,964
عدد اللغات28
التوزيع اللغوياللغة الإنجليزية و28 لغة أصلية (الأفيمامي، والأكوكو-إيدو، والأنانغ،  إيفيك، وإيكوي، والفولاني، والهوسا، وإيبيبـيو، وإيدوما، وإيغالا، والإيغبو، وإيغيدي، وإيجاو، وإيكا، وإيكوم، وإيكويري، وإيشان، وكايري-كايري، والكانوري، ولوكا، وأورهوبو، واليوروبا، وأوبودو، وأوغوني، وأوكوبو، وأوكيريكا، والتيي، وأوكواني. وتعد قبيلة الإيغبو هي القبيلة المهيمنة من بين هذه اللغات الأصلية في مجموعة البيانات.
الفئات العمريةثلاث مجموعات عمرية: الشباب (المراهقون ومن هم في العشرينيات)، والبالغون (من هم في الثلاثينيات والأربعينيات والخمسينيات)، وكبار السن (من هم في الستينيات والسبعينيات والثمانينيات من العمر)
توزيع الفئات العمريةالمراهقون (13–19 سنة) منخفض (< 10%) العشرينات 20-29 سنة مرتفع جداً (~35-45%) الثلاثينات 30-39 سنة مرتفع (~20-30%) الأربعينات 40-49 سنة متوسط (~10-15%) الخمسينات 50-59 سنة منخفض (~5-10%) الستينات +60-80+ سنة نادر (< 5%)  
مدة التسجيل3-10 ثوانٍ
ظروف التسجيلتعديل نبضي كودي (PCM) بدقة 16 بت
معدل أخذ العينات الأصلي44.1 kHz
معدل أخذ عينات المعالجة16 كيلوهرتز
طول إطار معاملات التردد الميلّي-سبري (MFCC)25 ملي ثانية
تداخل/خطوة إطارات معاملات التردد الميللي ثانية (MFCC)١٠ مللي ثانية
تمثيل معاملات التردد الميللي-سيبسيري (MFCC)متجه متوسط زمنياً ذو 39 بُعداً
تمثيل wav2vec 2.0متجه بـ 768 بُعداً مجمّع زمنياً بمتوسط حسابي
التمثيل المدمج النهائي٨٠٧ أبعاد
تقسيم بيانات التدريب والاختبار80:20
تقسيم البياناتتقسيم مستقل عن المتحدث
التحقق المتقاطعالتحقق المتقاطع خماسي الطيات
مجموعة بيانات التحقق الخارجيةموزيلا كومون فويس (Mozilla Common Voice)

الجدول 2: الخصائص الديموغرافية، وتغطية اللغة، وتقسيم البيانات، وإعدادات المعالجة المسبقة لمجموعة بيانات الكلام المستخدمة في VoiceNet-RAI.

مَعلَمَةالقيمة / الوصف
إطار عملPyTorch
الأجهزة والمعداتوحدة معالجة الرسوميات NVIDIA (المعمقة بتقنية CUDA)
البذرة العشوائية42
المُحسِّنآدم
معدل التعلم الأولي1 × 10−4
β₁ / β₂0.9 / 0.999
آدم إبسلون1 × 10⁻⁸
حجم الدفعة64
العصور التدريبية50 (صبر التوقف المبكر = 8)
دالة الخسارةالإنتروبيا المتقاطعة الفئوية
المعايرةتسوية درجة Z (Z-score normalization)
مجدول معدل التعلمتقليل معدل التعلم عند الثبات (ReduceLROnPlateau)
معدل التسرب0.3
وقت التدريب٢٠ دقيقة
وقت الاستنتاج/للعينة١٣ ثانية
استخلاص الميزاتاستخراج الميزات
معاملات الترددات الملوّنة الميليمترية (MFCC)40
حجم النافذة٢٥ ميلي ثانية
خطوة١٠ ملي ثانية
نسخة wav2vecبعد التضمين الأساسي (المُدرَّب مسبقاً)
استراتيجية التجميعالتجميع المتوسط (Mean pooling)
دمج السماتالدمج (MFCC + wav2vec)
معاملات الترددات الميلكونية لـ سيفيسورنتس (MFCC)40
بروتوكول التقييمبروتوكول التقييم
تقسيم بيانات التدريب والاختبارفصل على مستوى المتحدث
التحقق المتبادلخماسي الطيات
مجموعات البياناتمجموعة بيانات Mozilla Common Voice (28 لغة + مجموعة فرعية باللغة الإنجليزية) ومجموعة BVC Gender &؛ مجموعة بيانات تحدي تقدير العمر من الصوت
المهامتصنيف النوع والعمر

الجدول 3: تكوين التدريب، وإعدادات استخراج الميزات، والمعلمات الفائقة، وبروتوكول التقييم المستخدم لـ VoiceNet-RAI.

النماذجالدقة (Accuracy)ضبط الدقة (Precision)الاستدعاء (Recall)مقياس F1 (F1-score)
RF71.4272.7974.4373.52
LR73.5974.2275.4074.34
ETC72.4472.3374.5273.41
SVM73.5272.6072.3972.48
CNN75.7176.5977.3477.43
VGG1970.5673.2875.0774.17
ResNet74.3773.4976.6875.54
EfficientNet-Lite83.4882.8784.2883.54
MobileNet81.3383.1982.1483.11
InceptionV380.7781.3482.6782.52

الجدول 4: أداء نماذج تعلم الآلة (ML) والتعلم العميق (DL) في تصنيف الجنس باستخدام مجموعة بيانات مكونة من 28 لغة بدون ميزات MFCC.

النماذجالدقةالإحكامالاستدعاءمقياس F1
RF84.5786.5387.3987.42
LR83.2584.4285.6484.98
ETC83.5984.2586.3685.43
SVM85.4783.3785.2684.29
CNN88.6086.7588.4687.35
VGG1987.4885.4985.8085.58
ResNet89.4384.3982.3483.67
EfficientNet-Lite92.6493.7994.9294.84
MobileNet91.3990.6491.1591.07
InceptionV390.2488.8190.7089.83

الجدول 5: أداء تصنيف النوع الاجتماعي لنماذج تعلم الآلة (ML) والتعلم العميق (DL) باستخدام ميزات معامل التردد الميلى-سيبسترالي (MFCC) على مجموعة بيانات مكونة من 28 لغة.

النماذجالدقةالدقةالاستدعاءمقياس F1
تردد راديوي88.3690.9189.9490.86
الاستجابة المناعية (LR)90.6492.2491.3091.34
سلسلة نقل الإلكترونات91.4992.8092.7992.79
آلة المتجهات الداعمة (SVM)92.5892.7590.6491.52
الشبكات العصبية الالتفافية93.6994.6994.5394.34
VGG1991.3792.6493.4893.21
شبكة ResNet95.2896.3995.5295.43
EfficientNet-Lite97.8798.6198.7098.65
شبكة موبايل نت (MobileNet)96.4195.5196.3996.24
InceptionV396.3595.2996.8496.08

الجدول 6: أداء تصنيف الجنس لنماذج تعلم الآلة (ML) والتعلم العميق (DL) باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0 على المجموعة الفرعية للغة الإنجليزية.

النماذجالدقةالإحكامالاستدعاءمقياس F1
الطي الأول97939694
الطي الثاني96949695
الطي الثالث97949595
الطي الرابع96939594
الطي الخامس97949695
المتوسط96.693.695.694.6

الجدول 7: أداء التحقق المتقاطع خماسي الطيات لنموذج VoiceNet-RAI على المجموعة الفرعية للغة الإنجليزية.

النماذجالدقةالإحكامالاستدعاءمقياس F1
RF80.1578.6879.2779.04
LR81.2880.6980.4380.54
ETC80.5881.2180.8281.04
SVM82.5481.3182.1481.78
CNN85.2784.3984.4784.43
VGG1983.7382.9783.5383.48
ResNet82.6881.4280.7881.95
EfficientNet-Lite88.4286.5687.2186.97
MobileNet85.2385.6485.9585.81
InceptionV386.6785.8686.7886.35

الجدول 8: أداء نماذج تعلم الآلة (ML) والتعلم العميق (DL) في تصنيف العمر من حيث الدقة (accuracy)، والضبط (precision)، والاستذكار (recall)، ومقياس F1-score.

النماذجالدقةالدقةالاسترجاعمقياس F1
التردد الراديوي (RF)90.4792.8290.8591.32
التحلل السكري (LR)89.7590.4489.6190.03
سلسلة نقل الإلكترونات92.6391.2991.5591.42
آلة المتجهات الداعمة (SVM)90.6991.8491.8191.82
الشبكة العصبية التلافيفية (CNN)94.6395.5294.2494.94
VGG1992.1291.3490.5291.10
الشبكة العصبية المتبقية (ResNet)92.1991.9892.2792.25
EfficientNet-Lite98.2798.6398.4498.56
MobileNet97.2896.3697.0196.40
InceptionV395.8596.1897.3597.17

الجدول 9: نتائج التحقق الخارجي لتصنيف الجنس على مجموعة بيانات Mozilla Common Voice باستخدام تمثيل الميزات الهجين MFCC–wav2vec 2.0.

تكوين الميزاتالدقة (%)الإحكام (%)مقياس F1 (%)
الميزات الخام (بدون MFCC)83.4882.8783.54
MFCC فقط92.6493.7994.84
wav2vec 2.0 فقط95.3496.3295.18
MFCC + wav2vec (المقترح)97.8798.6198.65

الجدول 10: تحليل الاستئصال لتمثيلات الميزات باستخدام EfficientNet-Lite.

مجموعة التقييممجموعة فرعيةالدقة (%)مقياس F1 (%)معدل الإيجابيات الكاذبةاختزال النترات (FNR)فرق التكافؤ الديموغرافيفرق تكافؤ الفرص
الجنسذكر97.9597.950.0210.024__
الجنسأنثى97.6298.500.0240.027__
التفاوت بين الجنسينالذكر مقابل الأنثى____0.0120.003
اللغات غنية الموارد98.1098.800.0180.021__
اللغات شحيحة الموارد96.8597.900.0310.034__
التفاوت اللغويمرتفع مقابل منخفض____0.0280.014

الجدول 11: تقييم العدالة عبر المجموعات الفرعية للجنس وموارد اللغة.الاختصارات: FPR = معدل الإيجابيات الكاذبة؛ FNR = معدل السلبيات الكاذبة. يمثل الفرق في التكافؤ الديموغرافي والفرق في تكافؤ الفرص التفاوتات بين المجموعات، لذا يتم الإبلاغ عنها لمقارنات المجموعات الفرعية بدلاً من المجموعات الفردية. وتشير قيم التفاوت المنخفضة إلى سلوك أكثر اتساقاً للنموذج عبر المجموعات.

المرجعالمنهجيةالدقة
16سرطان المرارة90%.
17النموذج التسلسلي91%
18الشبكات العصبونية الالتفافية80%
19التجميع (Bagging)، والخوارزمية الأقرب للجيران (KNN)، والغابات العشوائية (RF)98.10%.
20ResNET5098.57%.
21آلة ناقلات الدعم (SVM)98%
22LGBM91%
23النموذج المتراكم99.64%
24آلة المتجهات الداعمة (SVM)97%
25التردد الراديوي93%
26الشبكات العصبونية التلافيفية85.48%
27الشبكات العصبية الاصطناعية89.20%
تتناول هذه الدراسةEfficientNet-Lite97.87%

الجدول 12: مقارنة دقة VoiceNet-RAI مع النهج الرائدة التي تم الإبلاغ عنها سابقاً لتصنيف النوع والعمر بناءً على الصوت.

المناقشة

طورت هذه الدراسة وأقامت تقييمًا لإطار عمل مؤتمت لتصنيف النوع الاجتماعي والعمر من بيانات الصوت من خلال دمج سمات MFCC وتضمينات wav2vec 2.0 مع نموذج EfficientNet-Lite. وفي التجارب الأولية، حقق EfficientNet-Lite دقة بلغت 83.48%، ودقة تحديد (precision) بنسبة 82.87%، وحساسية (recall) بنسبة 84.28%، ومقياس F1-score بنسبة 83.54% باستخدام السمات الأصلية. وبعد دمج سمات MFCC، تحسن الأداء بشكل ملحوظ، حيث بلغت الدقة 92.64%، ودقة التحديد 93.79%، والحساسية 94.92%، ومقياس F1-score بنسبة 94.84% على مجموعة البيانات التي تضم 28 لغة. وباستخدام تمثيل MFCC–wav2vec 2.0 الهجين على المجموعة الفرعية للغة الإنجليزية، حقق EfficientNet-Lite دقة بلغت 97.87%، ودقة تحديد 98.61%، وحساسية 98.70%، ومقياس F1-score بنسبة 98.65%. كما تم تقييم القدرة على التعميم باستخدام مجموعة بيانات Mozilla Common Voice، والتي أظهر من خلالها إطار العمل المقترح أداءً قويًا أيضًا. بالإضافة إلى ذلك، تم تقييم استقرار النموذج باستخدام التحقق المتقاطع خماسي الطيات (five-fold cross-validation).

أشار التحسن الملحوظ بعد دمج ميزات MFCC إلى أن الخصائص الطيفية منخفضة المستوى، بما في ذلك درجة الصوت، والجرس، ومعلومات المجرى الصوتي، ظلت تمييزية للغاية في تصنيف الجنس والعمر. وأشيرت الزيادة الإضافية في الأداء التي تحققت باستخدام تمثيل MFCC–wav2vec 2.0 الهجين إلى أن التضمينات السياقية القائمة على Transformer قد وفرت معلومات تكميلية لم يتم استيعابها بالكامل من خلال الميزات الصوتية المصممة يدويًا وحدها. وقد يفسر هذا التكامل تحسن أداء التمثيل الهجين المقترح مقارنة بالتكوينات الأصلية وتلك التي اعتمدت على MFCC فقط. كما أشار الأداء الأقوى الملحوظ في المجموعة الفرعية للغة الإنجليزية إلى أن التباين اللغوي قد يكون قد ساهم في صعوبة التصنيف. وعند دمج لغات متعددة، ربما أدت الاختلافات في النطق، واللهجة، والبنية الصوتية، وتوزيع العينات إلى إدخال تباين إضافي، بينما وفر إعداد اللغة الواحدة مساحة ميزات أكثر تجانسًا. وعلاوة على ذلك، أشار التحقق باستخدام مجموعة بيانات Mozilla Common Voice إلى أن التمثيل المقترح قد عمم نتائجه إلى ما بعد مجموعة البيانات الأساسية، على الرغم من أن الاختلافات في ظروف التسجيل والتوزيعات الديموغرافية قد تظل مؤثرة على الأداء.

بشكل عام، أشارت النتائج إلى أن أداء VoiceNet-RAI كان مدفوعاً بالمساهمات التكاملية للتمثيلات الكلامية الطيفية والسياقية بدلاً من الاعتماد على نوع واحد من الميزات. ومع ذلك، فإن التباينات المتبقية في الأداء عبر اللغات والفئات العمرية سلطت الضوء على الحاجة إلى إجراء تقييم أوسع للمجموعات الفرعية، واختبارات المتانة ضد الضوضاء، وإجراء مقارنات إضافية مع نماذج الكلام الحديثة ذات التعلم الخاضع للإشراف الذاتي.

تشمل النهج البديلة لتصنيف الجنس والعمر بناءً على الكلام استخدام الميزات الصوتية المصممة يدويًا مع مصنفات التعلم الآلي التقليدية، والتعلم القائم على الشبكات العصبية التلافيفية (CNN) من تمثيلات الكلام، وطرق التجميع، والنماذج ذات الإشراف الذاتي مثل HuBERT و WavLM و data2vec. وفي المقابل، يدمج VoiceNet-RAI المعلومات الطيفية القائمة على معاملات الكيفية الترددية الميالة (MFCC) مع تضمينات wav2vec 2.0 السياقية للاستفادة من نقاط القوة المتكاملة لتمثيلات الكلام المصممة يدويًا والمكتسبة.

كانت لهذه الدراسة عدة قيود؛ أولاً، اتسمت مجموعة البيانات الأساسية بتوزيعات غير متوازنة عبر الجنس واللغات والفئات العمرية، مما قد يكون قد أثر على أداء المجموعات الفرعية وحدّ من إمكانية تعميم النتائج على الفئات غير الممثلة بشكل كافٍ. ثانياً، قد تكون الاختلافات في أجهزة التسجيل، واللكنات، والنطق، والظروف الصوتية قد أثرت على موثوقية التصنيف. ثالثاً، على الرغم من أن التحقق باستخدام مجموعة بيانات Mozilla Common Voice قد دعم إمكانية التعميم خارج مجموعة البيانات الأساسية، إلا أن التقييم الأوسع باستخدام مجموعات بيانات إضافية من العالم الحقيقي ظل ضرورياً. وأخيراً، أثار تطبيق التصنيف الديموغرافي القائم على الصوت مخاوف تتعلق بالخصوصية والعدالة والأخلاقيات، لا سيما في التطبيقات غير المنضبطة أو ذات التأثير العالي. لذا، سيكون من الضروري مراقبة الأداء بشكل مستمر، وتوفير إشراف بشري، واتباع ممارسات نشر تراعي الخصوصية لضمان التنفيذ المسؤول. وقد أظهر الإطار المقترح إمكانات للتطبيقات في مجال التفاعل بين الإنسان والحاسوب، والمصادقة القائمة على الصوت، وتحليلات الكلام، والتحقيق الجنائي الرقمي. وسيقوم العمل المستقبلي بمقارنة VoiceNet-RAI مع نماذج الكلام ذاتية الإشراف الحديثة، بما في ذلك HuBERT و WavLM و data2vec، واستكشاف آلية انتباه محددة للمهام على تمثيل MFCC–wav2vec 2.0 المدمج. وبخلاف آلية الانتباه الذاتي الداخلية لـ wav2vec 2.0، فإن الآلية المستقبلية المقترحة ستعمل على موازنة المعلومات الزمنية وعلى مستوى الميزات ذات الصلة بالمهمة بشكل صريح لتصنيف الجنس والعمر.

الإفصاحات

ليس لدى المؤلفين أي تضاربات في المصالح للإفصاح عنها.

شكر وتقدير

يود المؤلفون تقديم الشكر لمشروع دعم الباحثين بجامعة الأميرة نورة بنت عبد الرحمن رقم (PNURSP2026R748)، وجامعة الأميرة نورة بنت عبد الرحمن، الرياض، المملكة العربية السعودية لتمويل هذا البحث.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مجموعة الأصوات الصعبة من BVCمجموعة رؤية وحوسبة القياسات الحيوية / OgeNIمجموعة الأصوات الصعبة BVChttps://github.com/OgeNI/BVC_Challenging_Voice_Set
EfficientNet-LiteجوجلEfficientNet-Lite، والنسخة الدقيقة المستخدمةhttps://github.com/tensorflow/tpu/tree/master/models/official/efficientnet/lite
وحدة معالجة الرسومياتNVIDIATesla K80https://www.nvidia.com/
مجموعة بيانات موزيلا كومون فويس (Mozilla Common Voice)مؤسسة موزيلا (Mozilla Foundation)Common Voice، الإصدار المستخدم في التجاربhttps://www.kaggle.com/datasets/mozillaorg/common-voice/data
NumPyمطورو NumPyالإصدار المحدد المستخدم في التجاربhttps://numpy.org/
المعالجإنتلIntel Core i7-8265Uhttps://www.intel.com/
بايثونمؤسسة برمجيات بايثون (Python Software Foundation)الإصدار الدقيق المستخدم في التجاربhttps://www.python.org/
PyTorchمؤسسة PyTorchالإصدار الدقيق المستخدم في التجاربhttps://pytorch.org/
Scikit-learnمطورو Scikit-learnالإصدار الدقيق المستخدم في التجاربhttps://scikit-learn.org/
SciPyمطورو SciPyالإصدار الدقيق المستخدم في التجاربhttps://scipy.org/
wav2vec 2.0 Baseميتا إيه آي (Meta AI)facebook/wav2vec2-basehttps://huggingface.co/facebook/wav2vec2-base
ويندوز 11مايكروسوفتويندوز 11، الإصدار/البناء المحدد في حال توفرهhttps://www.microsoft.com/windows/windows-11

المراجع

  1. Pahwa A, Aggarwal G. Speech feature extraction for gender recognition. Int J Image Graph Signal Process. 2016;8:17.
  2. Ericsdotter C, Ericsson AM. Gender differences in vowel duration in read Swedish: Preliminary results. Work Pap Lund Univ Dep Linguist Phon. 2001;49:34-37.
  3. Gamit MR, Dhameliya K, Bhatt NS. Classification techniques for speech recognition: A review. Int J Emerg Technol Adv Eng. 2015;5:58-63.
  4. Rabiner LR, Juang BH. Fundamentals of Speech Recognition. PTR Prentice Hall; Englewood Cliffs, NJ; 1993.
  5. Hansen JHL, Hasan T. Speaker recognition by machines and humans: A tutorial review. IEEE Signal Process Mag. 2015;32(6):74-99.
  6. Zhang Y, et al. Towards end-to-end speech recognition with deep convolutional neural networks [conference presentation]. Presented at: Interspeech 2016; San Francisco, CA; 2016. p. 410-414. Available from: https://www.isca-archive.org/interspeech_2016/zhang16b_interspeech.html
  7. Kabil SH, Muckenhirn H, Magimai-Doss M. On learning to identify genders from raw speech signal using CNNs [conference presentation]. Presented at: Interspeech 2018; Hyderabad, India; 2018. p. 287-291. Available from: https://www.isca-archive.org/interspeech_2018/kabil18_interspeech.html
  8. Albawi S, Mohammed TA, Al-Zawi S. Understanding of a convolutional neural network [conference presentation]. Presented at: 2017 International Conference on Engineering and Technology (ICET); Antalya, Türkiye; 2017. p. 1-6. Available from: https://ieeexplore.ieee.org/document/8308186
  9. Abdi H, Williams LJ. Principal component analysis. Wiley Interdiscip Rev Comput Stat. 2010;2(4):433-459.
  10. Mavaddati S. Voice-based age, gender, and language recognition based on ResNet deep model and transfer learning in spectro-temporal domain. Neurocomputing. 2024;580:127429.
  11. Jiang H, et al. 3WD-DRT: A three-way decision enhanced dynamic routing transformer for cost-sensitive multimodal sentiment analysis. Inf Sci. 2026;725:122704.
  12. Jameel HK, Al Ghrairi AHT, Neamah MM. Self-supervised learning for speech recognition: A review. Dijlah J Eng Sci. 2026;3(2).
  13. Anidjar OH, Yozevitch R. Transformer-based language-independent gender recognition in noisy audio environments. Sci Rep. 2025;15(1):14421.
  14. Sinha A, Kathania HK, Kurimo M. A study on the layer-wise transferability of self-supervised learning features for children's speech processing tasks. Speech Commun. 2026;180:103392.
  15. Li M, Han KJ, Narayanan SS. Automatic speaker age and gender recognition using acoustic and prosodic level information fusion. Comput Speech Lang. 2013;27(1):151-167.
  16. Sánchez-Hevia HA, Gil-Pita R, Utrilla-Manso M, Rosa-Zurera M. Age group classification and gender recognition from speech with temporal convolutional neural networks. Multimed Tools Appl. 2022;81:3535-3552.
  17. Abu Mallouh A, Qawaqneh Z, Barkana BD. New transformed features generated by deep bottleneck extractor and a GMM–UBM classifier for speaker age and gender classification. Neural Comput Appl. 2018;30:2581-2593.
  18. Almomani A, et al. Age and gender classification using backpropagation and bagging algorithms. Comput Mater Contin. 2023;74(2):3045-3062.
  19. Sahar RM, Rao TS, Anuradha S, Rao BS. Performance analysis of ML algorithms to detect gender based on voice. In: Recent Trends in Intensive Computing. 2021. p. 163-171. Available from: https://journals.sagepub.com/doi/abs/10.3233/APC210192
  20. Kone VS, et al. Voice-based gender and age recognition system [conference presentation]. Presented at: 2023 International Conference on Advancement in Computation & Computer Technologies (InCACCT); Gharuan, India; 2023. p. 74-80. Available from: https://ieeexplore.ieee.org/document/10141801
  21. Alhussein M, Muhammad G. Voice gender recognition under unconstrained environments using self-attention. Appl Acoust. 2021;175:107823.
  22. Yücesoy E. Automatic age and gender recognition using ensemble learning. Appl Sci. 2024;14(16):6868.
  23. Alnuaim AA, et al. Speaker gender recognition based on deep neural networks and ResNet50. Wirel Commun Mob Comput. 2022;2022:4444388.
  24. Ibrahim F, Nahar KMO, Al-Shannaq MA. Gender identification and age estimation of Arabic speaker using machine learning. J Theor Appl Inf Technol. 2020;98(19):3242-3256.
  25. Kannapiran P, Sindha MMR. Voice-based gender recognition model using FRT and LightGBM. Teh Vjesn. 2023;30:282-291.
  26. Alkhammash EH, Hadjouni M, Elshewey AM. A hybrid ensemble stacking model for gender voice recognition approach. Electronics. 2022;11:1750.
  27. Mutiany M, Herlistiono IO. Gender detection by voice using deep learning. Int J Innov Sci Res Technol. 2020;5(10):841-845.
  28. Raahul A, Sapthagiri R, Pankaj PK, Vijayarajan V. Voice based gender classification using machine learning. IOP Conf Ser Mater Sci Eng. 2017;263(4):042083. Available from: https://iopscience.iop.org/article/10.1088/1757-899X/263/4/042083
  29. Iloanusi O, et al. Voice recognition and gender classification in the context of native languages and lingua franca [conference presentation]. Presented at: 2019 6th International Conference on Soft Computing & Machine Intelligence (ISCMI); Johannesburg, South Africa; 2019. p. 175-179. Available from: https://ieeexplore.ieee.org/document/9004306
  30. Gupta Y, Gangwar K, Singhal M, Hemavathi D. Gender and age recognition using audio data-artificial neural networks. In: Soft Computing for Security Applications: Proceedings of ICSCS 2021. Springer; 2022. p. 449-470. Available from: https://link.springer.com/chapter/10.1007/978-981-16-5301-8_34
  31. Qawaqneh Z, Mallouh AA, Barkana BD. Deep neural network framework and transformed MFCCs for speaker’s age and gender classification. Knowl-Based Syst. 2017;115:5-14.
  32. OgeNI. BVC Challenging Voice Set [Internet]. GitHub; 2025 [cited 2026 Aug 16]. Available from: https://github.com/OgeNI/BVC_Challenging_Voice_Set
  33. Oppenheim AV, Schafer RW. Discrete-Time Signal Processing. 3rd ed. Pearson; Upper Saddle River, NJ; 2010.
  34. Logan B. Mel frequency cepstral coefficients for music modeling [conference presentation]. Presented at: International Society for Music Information Retrieval Conference (ISMIR); Plymouth, UK; 2000. Available from: https://ismir.net/conferences/ismir-2000/
  35. Davis SB, Mermelstein P. Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans Acoust Speech Signal Process. 1980;28(4):357-366.
  36. Baevski A, Zhou H, Mohamed A, Auli M. wav2vec 2.0: A framework for self-supervised learning of speech representations [conference presentation]. Presented at: Advances in Neural Information Processing Systems 33 (NeurIPS 2020); Virtual; 2020. p. 12449-12460. Available from: https://proceedings.neurips.cc/paper/2020/hash/92d1e1eb1cd6f9fba3227870bb6d7f07-Abstract.html
  37. Yıldırım Ş, Bingöl MS. Metaheuristic approaches to enhance voice-based gender identification using machine learning methods. Appl Sci. 2025;15(23):12815.
  38. Breiman L. Random forests. Mach Learn. 2001;45:5-32.
  39. Hosmer DW Jr, Lemeshow S, Sturdivant RX. Applied Logistic Regression. 3rd ed. Wiley; Hoboken, NJ; 2013.
  40. Geurts P, Ernst D, Wehenkel L. Extremely randomized trees. Mach Learn. 2006;63:3-42.
  41. Yücesoy E, Nabiyev VV. A new approach with score-level fusion for the classification of a speaker age and gender. Comput Electr Eng. 2016;53:29-39.
  42. Cortes C, Vapnik V. Support-vector networks. Mach Learn. 1995;20:273-297.
  43. Abdel-Hamid O, et al. Convolutional neural networks for speech recognition. IEEE/ACM Trans Audio Speech Lang Process. 2014;22(10):1533-1545.
  44. Nasaruddin N, Pratama Tresma MAP, Muchamad MK, Fuadi Z. Voice frequency-based gender classification using convolutional neural network for smart home. IEEE Access. 2024;12:104190-104203.
  45. Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition [conference presentation]. Presented at: International Conference on Learning Representations (ICLR); San Diego, CA; 2015. Available from: https://iclr.cc/archive/www/2015.html
  46. Tan M, Le QV. EfficientNet: Rethinking model scaling for convolutional neural networks [conference presentation]. Presented at: 36th International Conference on Machine Learning (ICML); Long Beach, CA; 2019. p. 6105-6114. Available from: https://proceedings.mlr.press/v97/tan19a.html
  47. Ertam F. An effective gender recognition approach using voice data via deeper LSTM networks. Appl Acoust. 2019;156:351-358.
  48. Zhao L, Wang L, Jia Y, Cui Y. A lightweight deep neural network with higher accuracy. PLoS One. 2022;17(8):e0271225.
  49. Szegedy C, et al. Rethinking the Inception architecture for computer vision [conference presentation]. Presented at: IEEE Conference on Computer Vision and Pattern Recognition (CVPR); Las Vegas, NV; 2016. p. 2818-2826. Available from: https://openaccess.thecvf.com/content_cvpr_2016/html/Szegedy_Rethinking_the_Inception_CVPR_2016_paper.html
  50. Sokolova M, Lapalme G. A systematic analysis of performance measures for classification tasks. Inf Process Manag. 2009;45(4):427-437.
  51. Mozilla Common Voice Project. Common Voice Dataset [Internet]. 2024 [cited 2024 Jun 18]. Available from: https://www.kaggle.com/datasets/mozillaorg/common-voice/data

إعادة الطباعة والأذونات

الوسوم

VoiceNet Wav2vec 2 0 MFCC EfficientNet Lite