مقالة منهجية

البحث في التعرف على الصوت المرضي بناء على XGBoost

DOI:

10.3791/68784

مايو 29, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

هنا، نقدم بروتوكولا لإنشاء نموذج ذكاء اصطناعي غير جراحي قائم على XGBoost لتشخيص سلائل الحبال الصوتية باستخدام قاعدة بيانات ساربروكن.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ومع النمو المستمر للتواصل الاجتماعي البشري، يزداد عدد الأشخاص الذين يعانون من اضطرابات الصوت أيضا. نظرا للمزايا الموضوعية وغير التدخلية لطرق الكشف الصوتي للصوت المرضي، أصبح استخدام تحليل إشارات الكلام في التعرف على الصوت المرضي نقطة بحثية ساخنة. اختار هذا المقال أولا 101 حرف متحرك مستمر /a/ من قاعدة بيانات SVD الألمانية كموضوع بحثي. ثانيا، باستخدام تقنية حزمة المويجات لتحليل الزمن والتردد، يتم استخراج أربعة معلمات ديناميكية غير خطية، وهي الإنتروبيا التقريبية، إنتروبيا العينة، الإنتروبيا الضبابية، وإنتروبيا التبديل، من الإشارات الفرعية كمجموعة معلمات الميزة لمصنف الصوت المرضي. أخيرا، يتم اختيار خوارزمية التعلم الآلي XGBoost كطريقة للتعرف على الأنماط لإنشاء مصنف صوتي مرضي، ويتم التحقق من أداء التصنيف باستخدام التحقق المتقاطع الخماسي ومنحنى ROC. أظهرت النتائج التجريبية أن دقة مصنف الصوت المرضي ل XGBoost هي 0.857، ودرجة F1 هي 0.875، وقيمة AUC هي 0.944، وكلها أعلى من المصنف الذي أنشأه SVM، مما يشير إلى أن XGBoost يقدم أداء أفضل في التعرف على الصوت المرضي.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

عدد الأشخاص الذين يعانون من اضطرابات الصوت في تزايد مستمر. وفقا للإحصائيات، يعاني ثلث السكان من مشاكل في الصوت في مرحلة ما من حياتهم1. بالنسبة لمستخدمي الصوت المحترفين مثل المغنين والمعلمين، بسبب سوء استخدامهم المتكرر وإساءة استخدام صوتهم، تكون نسبة الإصابة بأمراض الحلق أعلى. أجرت دراستان استطلاعات على معلمين في تيانجين وأورومتشي، وأظهرت النتائج أن احتمال الإصابة باضطرابات صوتية هو 33.81٪ و28.23٪ على التوالي: 2.3. ونتيجة لذلك، يزداد التركيز على اكتشاف وتشخيص الصوت المرضي في الممارسة السريرية. حاليا، تستخدم طرق التقييم الذاتي، وفحص الحنجرة، وطرق الكشف الصوتي بشكل رئيسي لتشخيص أمراض الصوت في الممارسة السريرية4،5. طريقة الكشف الصوتي تحول إشارات الصوت إلى إشارات رقمية للبحث، مما يضمن الموضوعية ويتجنب ألم المريض أثناء الفحص6. لذلك، أصبح الكشف الصوتي أداة مساعدة فعالة للأطباء في التشخيص السريري، وتتزايد الأبحاث حوله.

أهم التقنيات لتشخيص الصوت المرضي باستخدام طرق التحليل الصوتي هي استخراج الخصائص والتعرف على الأنماط. منذ الستينيات، بدأ الباحثون في استخراج بعض المعايير الصوتية التقليدية لدراسة الصوت المرضي، ووجدوا العديد من معايير الخصائص الصوتية الفعالة والمتينة، مثل اضطراب التردد الأساسي، واضطراب السعة، ومعاملات التردد المغناطيسي (MFCC)7. في السنوات الأخيرة، لم يقتصر الباحثون على دراسة المعلمات الصوتية التقليدية فقط، بل بدأ استخدام المعلمات الديناميكية غير الخطية أيضا في مجال التعرف على الصوت المرضي8. كما أن له تأثيرا جيدا جدا. مع التطور السريع لتعلم الآلة، ظهرت المزيد من طرق التعرف على الأنماط بسرعة تشغيل عالية وأداء تصنيف جيد. هناك أيضا المزيد والمزيد من طرق التعرف على الأنماط المستخدمة في التعرف على الصوت المرضي، مثل آلات الناقلات الداعمة (SVM)، والغابات العشوائية، والشبكات العصبية، والتعلم العميق9،10. XGBoost هو طريقة للتعرف على الأنماط حظيت باهتمام في السنوات الأخيرة. لا يتطلب تطبيع الميزات ويمكنه اختيار الميزات بنفسه. يمكنه التكيف مع وظائف فقدان مختلفة ويستخدم مصطلحات تنظيم التنظيم لمنع الإفراط في التركيب. يتميز بخصائص السرعة السريعة، وقابلية الحمل، وتحمل الأخطاء. لذلك، تحاول هذه المقالة تطبيق طريقة XGBoost على التعرف على الصوت المرضي لتحقيق نتائج أفضل في التعرف.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يتم توضيح سير العمل التقني لهذه الدراسة في الشكل 1.

1. الحصول على عينات صوتية

  1. مصدر البيانات التجريبية من SVD في ألمانيا12.
  2. احصل على 101 حالة من بيانات صوت الحروف المتحركة /a/، بما في ذلك 45 حالة (19 ذكرا و26 أنثى) لمرضى السلائل الصوتية و56 حالة (28 ذكرا و28 أنثى) لأشخاص طبيعيين.

2. تفكيك حزمة المويجات لبيانات الصوت13

  1. إجراء بحث شامل عبر ثلاث مويجات دوبيشي (db1، 3، 5) وثلاثة أعماق تحلل (4، 6، 8 مستويات) باستخدام برنامج MATLAB R2023a.
  2. استخدم معدل أخذ عينات 16 كيلوهرتز، وتحليل حزمة المويجات بأربعة مستويات db3 (WPD) لتقسيم إشارة الكلام إلى 16 نطاقا فرعيا (دقة 500 هرتز لكل منها) (الشكل 2).

3. استخراج معلمات الميزة

  1. استخراج تسلسلات معاملات منفصلة من 16 نطاقا فرعيا تم الحصول عليها عبر WPD على المستويات الرابعة بواسطة بايثون 3.10، وتعمل كقيم إدخال لجميع معادلات الإنتروبيا الموضحة أدناه.
    ملاحظة: جميع المعادلات المستخدمة في هذه الدراسة اشتقت من خوارزميات منشورة سابقا (كمافي r) ولم تكن مشتقة بشكل مستقل.
  2. احسب الإنتروبيا التقريبية لتسلسلات النطاق الفرعي 16 ووترا يوميا باستخدام الصيغة أدناه14:
    figure-protocol-1(1)
    figure-protocol-2(2)
    Cim (r)={d[X(i), X(j)]المعاملات: يتم اختيار بعد النمط m ك2، ويتم اختيار تحمل التشابه r من 0.1 إلى 0.25 مضروبا في الانحراف المعياري14.
  3. احسب إنتروبيا العينة لتسلسلات النطاق الفرعي 16 ووترا يوميا باستخدام الصيغة أدناه15:
    figure-protocol-3(4)
    figure-protocol-4(5)
    Bim (r) = {d[X(i), X(j)]المعاملات: يتم اختيار بعد النمط m ك1 أو 2، ويتم اختيار تسامح التشابه r من 0.1 إلى 0.25 مضروبا في الانحراف المعياري15.
  4. احسب دالة العضوية الضبابية باستخدام الصيغة أدناه16:
    figure-protocol-5(7)
  5. احسب الإنتروبيا الضبابية بالصيغة أدناه17:
    figure-protocol-6(8)
    figure-protocol-7(9)
    figure-protocol-8(10)
    المعاملات: يتم اختيار بعد النمط m كأنه 2، ويتم اختيار تسامح التشابه r بمقدار 0.15 ضعف الانحراف المعياري.
  6. احسب انتروبيا التبديل بالصيغة أدناه18:
    figure-protocol-9(11)
    المعلمات: يتم اختيار بعد النمط m كأنه 6، وتم تحديد تأخير الزمن L = 2 في النهاية لاستخراج الإنتروبيا بالتبديل.

4. تأسيس نموذج

  1. قسم عينات الصوت من المرضى العاديين والمرضى الذين يعانون من سلائل الحبال الصوتية إلى مجموعة بيانات تدريبية ومجموعة بيانات اختبار بنسبة 8:2.
  2. استخدم مجموعة بيانات التدريب لضبط المعلمات وتدريب النماذج، ثم طبق المصنف الناتج على مجموعة بيانات الاختبار لتصنيف الأمراض.
  3. قم بإجراء نمذجة SVM باستخدام بايثون 3.10.
    1. تأكيد الطبيعة غير الخطية للبيانات من خلال مقارنة أداء نواة SVM. أظهرت الاختبارات الأولية مع نواة خطية دقة ضعيفة، في حين أن نواة دالة الأساس الشعاعية (RBF) حسنت نتائج التصنيف بشكل كبير، مما أظهر أن فضاء الميزات يتطلب حدود قرار غير خطية.
    2. استخدم متجهات ميزات الإنتروبيا ذات الستة عشر بعد (المستخرجة عبر WPD) كمدخل لمصنف SVM. تنفيذ نواة RBF لتحويل ميزات الصوت غير الخطية إلى فضاء عالي الأبعاد.
    3. قم بإجراء بحث شبكي باستخدام بايثون (scikit-learn) لتحديد التركيبة المثلى بين معامل العقوبة C وعرض النواة γ خلال مرحلة التدريب. قيم كل مجموعة معلمات من خلال تعظيم معدل التعرف على التحقق المتبادل.
    4. تدريب نموذج SVM باستخدام عينات صوتية من أشخاص طبيعيين ومرضى يعانون من سلائل في الحبال الصوتية. استخدم المعلمات الفائقة المثلى التي تم الحصول عليها من البحث الشبكي لبناء النموذج النهائي المدرب.
    5. طبق النموذج المدرب على عينات اختبار غير مرئية. تخضع كل عينة اختبار لنفس إجراء استخراج WPD وانتروبيا كما في بيانات التدريب. يتنبأ SVM بتسمية الفئة الثنائية (السلائل الطبيعية مقابل البوليبات الصوتية) بناء على الموقع المكاني لمتجه ميزة الاختبار بالنسبة لحدود القرار الأمثل.
  4. نفذ إجراء نمذجة XGBoost باستخدام بايثون 3.10.
    1. استخدم بحث شبكة يعتمد على بايثون لتحسين المعلمات الفائقة الرئيسية (بما في ذلك معدل التعلم وعمق الشجرة) خلال مرحلة التدريب. تقييم تركيبات المعلمات المتعددة عبر التحقق المتقاطع لتحديد التكوين الذي يعظم دقة التصنيف.
    2. تدريب مصنف XGBoost ثنائي باستخدام ستة عشر ميزة إنتروبيا مستخرجة من عينات صوتية. تطبيق المعاملات الفائقة المثلى التي تم الحصول عليها من البحث الشبكي لبناء النموذج النهائي.
    3. اختبر النموذج المدرب على مجموعة تحقق مستقلة تتكون من عينات غير مرئية. تقيم هذه الخطوة قدرة المصنف على التعميم من خلال تقييم أدائه على بيانات لم تستخدم أثناء التدريب.

5. تقييم أداء النموذج

  1. نفذ طريقة تحقق متقاطع من خمسة أضعاف.
    1. قسم مجموعة بيانات الصوت المعالجة مسبقا بشكل عشوائي إلى خمسة طيات متساوية. استخدم أربع طيات كمجموعة تدريب لبناء النموذج واستخدم الطي المتبقي كمجموعة تحقق لتقييم الأداء.
    2. كرر هذه العملية خمس مرات. استخدم متوسط نتائج التكرارات الخمس كأداء نهائي للنموذج.
  2. احصل على مصفوفة الالتباس.
    1. إنشاء مصفوفة الالتباس بمقارنة التسميات المتوقعة للمصنف مع تسميات الحقيقة الأرضية لجميع عينات الاختبار وفقا لنتائج التحقق المتقاطع الخماسية. قم بتجميع هذه المقارنات الفردية في جدول طوارئ باستخدام مكتبة بايثون scikit-learn لقياس التصنيفات الصحيحة وغير الصحيحة، كما هو موضح في الجدول 1.
  3. احسب الدقة والدقة والحساسية ودرجة F1 لوصف فعالية نموذج التصنيف. صيغ الحساب ذات الصلة هي كما يلي.
    الدقة = (TP + TN)/(TP + TN + FP + FN)
    الدقة = TP/(TP + FP)
    الحساسية = الاستدعاء = TPR = TP/(TP+ FN)
    F1 = (2 × الدقة × الاستدعاء)/ (الدقة + الاستدعاء)
    ملاحظة: تم اشتقاق هذه المقاييس (TP، TN، FP، FN) من عناصر مصفوفة الالتباس.
  4. صف منحنى ROC باستخدام AUC.
    1. رسم منحنى ROC لعرض المقايضة بين معدل الإيجابي الحقيقي (TPR) ومعدل الإيجابي الكاذب (FPR) عبر جميع عتبات التصنيف. احسب المساحة تحت المنحنى (AUC) كمقياس ملخص لقياس القدرة التمييزية العامة للنموذج.
      ملاحظة: تشير قيمة AUC الأقرب إلى 1 إلى احتمال أعلى أن المصنف يميز بشكل صحيح بين الأفراد الطبيعيين وأولئك الذين يعانون من سلائل في الحبال الصوتية، بغض النظر عن عتبة القرار المحددة.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في هذه الدراسة، تم استخدام تحليل حزم المويجات لإجراء تحليل الزمن والتردد لإشارات الصوت. من خلال دمج المعلمات الديناميكية غير الخطية—بما في ذلك الإنتروبيا التقريبية، وإنتروبيا العينة، والإنتروبيا الضبابية، وإنتروبيا التبديل—تم توصيف خصائص تعقيد وعدم انتظام الأصوات المرضية المرتبطة بسوائل الأحبال الصوتية بشكل منهجي. تم بناء مصنفين مرضيين للصوت لاحقا بناء على خوارزمية آلة الدعم المتجه (SVM) وخوارزمية XGBoost على التوالي. باستخدام نهج البحث الشبكي، تم تحديد تكوينات المعلمات المثلى لكل نموذج،...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يمثل التشخيص المرضي للصوت باستخدام تحليل إشارات الكلام نهجا غير جراحي وموضوعي19. وبالتالي، برز تصنيف الصوت المرضي كمحور بحثي مهم في معالجة وتعرف إشارات الكلام، مما أظهر قيمة تطبيقية سريرية كبيرة وآفاق تطورية20. استخدمت هذه الدراسة عينات نطق تم جمعها من SVD كمجموعات تجريبية. من خلال معالجة إشارات الكلام وتقنيات التعلم الآلي، تم إنشاء مصنف صوتي مرضي.

لضمان الحفاظ على خصائص الإشارة المحلية، تم اعتماد تحويل حزمة المو...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعلن المؤلفون أنهم لا يملكون مصالح متنافسة.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

وقد دعم المشروع من قبل مشروع تحسين قدرات مستشفى مقاطعة جيانغسو (JSPH-MC-2023-12). يرغب المؤلفون في شكر الأستاذ المشارك شان لي من كلية الاقتصاد والإدارة، وطاقم المختبر الرئيسي لتقنية ذكاء الدماغ والآلة (وزارة التعليم) في جامعة نانجينغ للملاحة الجوية والفضائية، على توجيهاتهم في المنهجية وتحليل البيانات وتوليد الأشكال. وقد ضمنت هذه المساهمات التقدم السلس لهذا البحث.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
MATLAB ذا ماث ووركسR2023aالمنصة البرمجية الأساسية للحوسبة العددية ونمذجة الخوارزميات.
برامج بايثونمؤسسة بايثون للبرمجياتبايثون 3.10لغة البرمجة الأساسية المستخدمة طوال الدراسة.
قاعدة بيانات الصوت في ساربروكن، SVDمعهد الصوتيات، جامعة سارلاندSaarbrü قاعدة بيانات الصوت (SVD)قاعدة بيانات متاحة للجمهور لتسجيلات الأصوات المرضية والطبيعية. يحتوي على حروف متحركة مستمرة ونطق مستمر من أشخاص يعانون من حالات مثل سوائل الأحبال الصوتية، بالإضافة إلى عناصر تحكم صحية. يستخدم لأغراض البحث الأكاديمي وفقا لشروط الوصول المحددة.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Byeon, H. The risk factors related to voice disorder in teachers: a systematic review and meta-analysis. Int J Environ Res Public Health. 16 (19), 3675(2019).
  2. Fu, D. H., et al. The prevalence and risk factors for 47796 teachers of Tianjin middle school elementary school and kindergartens. J Audiol Speech Pathol. 24 (6), 559-564 (2016).
  3. Han, Y., et al. Urumqi 11689 secondary school teachers of throat disease investigation. Lin Chuang Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 26 (7), 302-305 (2012).
  4. Xu, W. The pathway to standardization in the diagnosis and treatment of voice disorders. Zhonghua Er Bi Yan Hou Tou Jing Wai Ke Za Zhi. 58 (Z1), 92-98 (2023).
  5. Reghunathan, S., et al. Components of voice evaluation. Otolaryngol Clin North Am. 52 (4), 589-595 (2019).
  6. Ulozaite-Staniene, N., et al. Exploring the feasibility of the combination of acoustic voice quality index and glottal function index for voice pathology screening. Eur Arch Otorhinolaryngol. 276 (6), 1737-1745 (2019).
  7. Liu, B., et al. Acoustic character governing variation in normal, benign, and malignant voices. Folia Phoniatr Logop. 77 (2), 137-146 (2025).
  8. Zhang, F., et al. Nonlinear dynamic analysis and perturbation measurement used for discriminating pathological voices and their correlations with perceptual evaluation. J Voice. , (2024).
  9. Peng, X., et al. Voice disorder classification using convolutional neural network based on deep transfer learning. Sci Rep. 13 (1), 7264(2023).
  10. Syed, S. A., et al. Inter classifier comparison to detect voice pathologies. Math Biosci Eng. 18 (3), 2258-2273 (2021).
  11. Yuan, Z. N., et al. A predictive model for hospital death in cancer patients with acute pulmonary embolism using XGBoost machine learning and SHAP interpretation. Sci Rep. 15 (1), 18268(2025).
  12. Barry, W. J., Pütze, M. Saarbrucken voice database. , Available from: http://www.stimmdatenbank.coli.uni-saarland.de/ (2025).
  13. Yang, S. M., et al. Research on multi-source signal recognition algorithm based on wavelet packet analysis. Comput Simul. 41 (12), 418-423 (2024).
  14. Pincus, S. M. Approximate entropy as a measure of system complexity. Proc Natl Acad Sci U S A. 88 (6), 2297-2301 (1991).
  15. Richman, J. S., Moorman, J. R. Physiological time-series analysis using approximate entropy and sample entropy. Am J Physiol Heart Circ Physiol. 278 (6), H2039-H2049 (2000).
  16. Zadeh, L. A. Fuzzy sets. Inf Control. 8 (3), 338-353 (1965).
  17. Chen, W., et al. Characterization of surface EMG signal based on fuzzy entropy. IEEE Trans Neural Syst Rehabil Eng. 15 (2), 266-272 (2007).
  18. Bandt, C., Pompe, B. Permutation entropy: a natural complexity measure for time series. Phys Rev Lett. 88 (17), 174102(2002).
  19. Lopes, L. W., et al. Accuracy of acoustic analysis measurements in the evaluation of patients with different laryngeal diagnoses. J Voice. 31 (3), 382.e15-382.e26 (2017).
  20. Pham, T. D., et al. Diagnosis of pathological speech with streamlined features for long short-term memory learning. Comput Biol Med. 170, 107976(2024).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

XGBoost ROC

مقالات ذات صلة