تدرس الدراسة الحالية عدة خوارزميات تعلم آلي على مجموعة بيانات سعودية للكشف عن الربو. على عكس الأساليب الحديثة التي تستخدم التعلم الآلي على مجموعات البيانات السريرية لتشخيص الربو، يحقق النظام المقترح أداء أفضل، مع تحسن بنسبة 3.9٪ في دقة التشخيص.
مقالة بحثية
تدرس الدراسة الحالية عدة خوارزميات تعلم آلي على مجموعة بيانات سعودية للكشف عن الربو. على عكس الأساليب الحديثة التي تستخدم التعلم الآلي على مجموعات البيانات السريرية لتشخيص الربو، يحقق النظام المقترح أداء أفضل، مع تحسن بنسبة 3.9٪ في دقة التشخيص.
وفقا للأبحاث، تم التعرف على زيادة في الأمراض المزمنة، بما في ذلك الربو. عدد مرضى الربو في السعودية يثير القلق بسبب الظروف الجوية ونمط الحياة، خاصة في فترة ما بعد الجائحة. يتطلب ذلك حلا لتقليل العدوى من خلال تطوير نظام ذكي للكشف عن الربو في مرحلة مبكرة، مما يؤدي إلى الوقاية من المرض أو تمكين العلاج المبكر. في هذه الدراسة، تم استخدام التعلم الآلي لتطوير أدوات لتتبع أعراض الربو في مرحلة مبكرة. على الرغم من وجود محاولات سابقة متعددة لتطبيق التعلم الآلي للتنبؤ بحدوث الربو. ومع ذلك، فإن التركيز على تحديد المرض في مرحلة ما قبل ظهور الأعراض، خاصة في السياق السعودي، يعد مجالا مهملا نسبيا. تم الحصول على مجموعة البيانات للدراسة الحالية من مستشفى جامعة الملك فهد في الدمام، المملكة العربية السعودية، وشملت اختبارات قياسية تجرى على المرضى، بما في ذلك تحاليل الدم، والاختبارات الفيروسية، واختبارات الكيمياء الحيوية. تحتوي مجموعة البيانات على 17 سمة ذات دلالة مهمة وتشمل معلومات ل 328 مريضا بالربو: 165 إيجابيا، و163 سلبيا. الطرق المختارة للتطبيق هنا هي الغابات العشوائية (RF)، الشبكات العصبية الاصطناعية (ANN)، آلات الدعم المتجهة (SVM)، وبايز الساذجة (NB). تم اختيار كل من هذه الطرق بناء على ميزاتها المميزة. كشفت النتائج التجريبية أن طرق الترددات الراديوية والتقنية الافتراضية (SVM)، وANN حققت 94٪، وهي أعلى دقة وتحسنت مقارنة بأحدث التقنيات بنسبة 3.9٪. ومن الجدير بالذكر أن تسع من أصل سبعة عشر ميزة ممكنة تم استخدامها لتحقيق الدقة المذكورة أعلاه. على الرغم من أن الترددات الراديوية وSVM وANN تحقق نفس الدقة، إلا أن تكلفة الخطأ في الشبكة أعلى. لذلك، فإن الراديو الراديوي وSVM متفوقان بناء على نمط النتائج، ولهذا يتم اقتراحهما لهذه المشكلة.
بعد إجراء أبحاث موسعة، لاحظ الباحثون أن الأمراض المزمنة أصبحت أكثر شيوعا1. الربو هو مرض التهابي مزمن في المجاري الهوائية يتميز بنوبات متكررة من ضيق التنفس والصفير. يختلف انتشار الربو عالميا، حيث يتراوح بين 1–20٪ لكل من الأطفال والبالغين، ويؤثر على ملايينالأشخاص حول العالم. ترتبط هذه التغيرات واسعة النطاق بالتغيرات البيئية، بما في ذلك في دول مختلفة، بالإضافة إلى استخدام أدوات تقييم مختلفة وتعريفات وبائية متنوعة للربو. الربو لديه معدل وفيات منخفض نسبيا مقارنة بعدة أمراض مزمنة معروفة أخرى.2. ومع ذلك، تشير التقارير إلى أن نمط الربو في المملكة العربية السعودية في ازدياد 3.4.
الربو هو حالة التهابية مزمنة تؤدي إلى تضيق التجويف. يضيق مسار الطيران ناتج عن توسع انبعاث السوائل الجسدية، بالإضافة إلى سماكة فاصل القصبات الهوائية بسبب الوذمة، والتليف تحت الظهارة، وتضخم العضلات الملساء. تم استخدام أجهزة فيزيولوجية مرضية مدفوعة بأنواع خلايا مختلفة، بما في ذلك الخلايا المناعية، لتقييم هذه الحالات5. بسبب الظروف الجوية القاسية ونمط الحياة الداخلي بشكل رئيسي في السعودية، يعد الربو من أكثر الأمراض المزمنة انتشارا. أظهرت عدة مسوحات معدل الربو الساحق6. أصبح المرض مشكلة كبيرة، ويتطلب نظام استجابة مبكرة للمساعدة في تقليل عدد الحوادث وجعل الوساطة المبكرة ممكنة في الوقاية أو الشفاء من المرض في مرحلة مبكرة.
على عكس الأفراد، للربو تأثير عميق على المجتمعات والعائلات. إذا لم يتم التحكم بها، تفرض قيودا قاسية على حياة المريض وتمنعه من الانخراط في العديد من الأنشطة اليومية. في السعودية، تعد الظروف الجوية القاسية، بما في ذلك الجو الحار والعواصف الرملية الواسعة الانتشار، والاستخدام المفرط لأنظمة التكييف/التبريد الداخلية، من العوامل الرئيسية للربو. بذلت الجمعية السعودية لجراحة الصدر (STS) جهودا ملحوظة لتوفير أفضل الأدوية لالتهابات الجهاز التنفسي.7. ومع ذلك، هناك حاجة إلى تشخيص استباقي للربو لتقليل معدل الإصابة، خاصة في سيناريو ما بعد الجائحة (كوفيد-19). كما تم الاستنتاج أن التاريخ العائلي، والتدخين، والتهاب الأنف التحسسي هي من بين أهم عوامل الخطر للإصابة بالربو بين البالغين السعوديين. تم التوصية بإجراء أبحاث إضافية للتحقيق في عوامل أخرى تضع أساس الدراسة.
في هذا البحث، وبالنظر إلى الدراسات السابقة حول تشخيص الربو، الهدف هو تعزيز دقة التشخيص. تم استخدام التقنيات المقترحة، بما في ذلك الغابة العشوائية (RF)، والشبكة العصبية الاصطناعية (ANN)، وآلة الناقل الداعمة (SVM)، وجهاز بايز الساذج (NB)، في دراسات سابقة، مما أدى إلى تحسينات ملحوظة في نتائج التشخيص. على سبيل المثال، استخدم الباحثون ANN وSVM وNB في الدراسات8، 9، 10. في الدراسة الحالية، تم دراسة أساليب التعلم الآلي للمساعدة كنظام إنذار مبكر يكتشف حتى المؤشرات الصغيرة لمرض الربو في المراحل الأولى (مرحلة ما قبل ظهور الأعراض). انتشار مرض الربو في المملكة العربية السعودية، خاصة في فترة ما بعد الجائحة، مع عوامل مثل نمط الحياة الداخلي بسبب الظروف الجوية القاسية، ومجاري التكييف، والعواصف الرملية، من بين العوامل الرئيسية. ومع ذلك، لا توجد دراسة جديرة بالذكر تحقق في العوامل الحاسمة التي شهدتها في الماضي القريب. لمعالجة هذه الفجوة البحثية، تهدف الدراسة الحالية إلى دراسة دور التعلم الآلي في الكشف المبكر عن الربو بين البالغين السعوديين. علاوة على ذلك، الهدف الأساسي هو تحقيق أعلى دقة ممكنة مع أقل عدد من الميزات. على الرغم من وجود جهود معروفة في الماضي لاستخدام التعلم الآلي للتنبؤ بوجود مرض الربو 8,9,10. تهدف الدراسة الحالية إلى الاستفادة من مجموعة بيانات سعودية، تم الحصول عليها لأول مرة من مستشفى في القطاع العام في المحافظة الشرقية، مع التركيز على تشخيص المرض في مرحلة مبكرة (التشخيص الاستباقي). يعترف بتعلم الآلة (ML) كطريقة لاستخراج المعرفة من البياناتالمجمعة 11,12. يوفر دقة التنبؤ التي تم الحصول عليها من عملية التعلم في الأمثلة السابقة باستخدام تقنيات تعلم آلي متنوعة. يشمل التعلم الآلي عدة طرق وخوارزميات واستراتيجيات لمعالجة المشكلات التحليلية والتنبؤية في مجالات طبية واسعة، مثل الكشف المبكر عن وجود المرض13,14.
تم إجراء عدة دراسات للتنبؤ بمرض الربو باستخدام تقنيات متنوعة. طور الباحثون شبكة عصبية اصطناعية (ANN) لتصنيف الربو اعتمادا على اختبارات المرضى الديناميكية والثابتة.8. تستخدم المعايير المقاسة مثل قياس التنفس، وقياس الاهتزاز النبضي (IOS)، والاستماع الصناعي، ونتائج الحساسية، والمعلومات حول الأعراض في الشبكة العصبية العصبية. تمكن المعلومات المحددة الشبكة الوطنية من اقتراح التصنيف المناسب للربو. وبالمثل، أجرى الباحثون دراسة لمعالجة التحديات فيتشخيص أمراض الصدر. تم استخدام أجهزة الدعم الناقلة (SVM) وطرق SVM التكيفية (ASVM) لتشخيص أمراض الصدر مثل الربو. تم الحصول على أفضل دقة تصنيف لجميع أمراض الصدر باستخدام طريقة ASVM. استخدم الباحثون عدة هياكل شبكات عصبية، مثل NN متعدد الطبقات (MLNN) مع خوارزمية الانتشار العكسي (BPA) مع طبقة واحدة وطبقتين مخفيتين، وNN الاحتمالية (PNN)، وكمية الناقل التعليمي (LVQ)، وNN الانحدار العام (GRNN)، لتشخيص أمراض الصدر، بما في ذلك مرض الربو15. بالإضافة إلى ذلك، أجرى بعضهم دراسة مقارنة تهدف إلى تشخيص أمراض الصدر باستخدام جهاز مناعي صناعي (AIS). وقد طبقت الدراسات المذكورة هياكل مختلفة لتشخيص مشاكل أمراض الصدر باستخدام مجموعات بياناتها المختلفة. بالنسبة للربو، تم تحقيق أعلى نتيجة باستخدام AIS بدقة إجمالية بلغت 90.91٪16. علاوة على ذلك، بحث الباحثون في فعالية الشبكة العميقة (DNN) لتحسين الدقة في تشخيص الربو وقارنوا أداء التنبؤ لخوارزميات التعلم الآلي المختلفة، لا سيما مع الانحدار اللوجستي وSVM. أظهرت الدراسة أن الاختبار التجريبي الذي استخدم نموذج علامات الربو كان أكثر فعالية في التشخيص الدقيق للربو9. أظهرت دراسة أخرى القدرة الكبيرة للتعلم الآلي باستخدام بيانات المراقبة عن بعد للتنبؤ بتفاقم الربو قبل حدوثها من خلال أساليب تعلم الآلة المختارة مثل SVM وNaïve Bayes لتنفيذ تجربتهم10.
بخلاف ذلك، استخدم الباحثون عدة تقنيات تعلم آلي لتشخيص مرض الزهايمر (AD) بشكل استباقي، بما في ذلك SVM، k-NN، التعزيز التكيفي (AdaBoost)، وتعزيز تدرج الإكستريم (XGBoost)17. أجرى الباحثون دراسة لتشخيص مرض السكري بشكل أولي أيضا، من خلال دراسة أربعة أساليب تعلم آلة، وهي NB، SVM، K-NN، وANN. أظهرت أهم ثلاث ميزات في مجموعة البيانات السعودية أعلى متوسط دقة يبلغ 68٪. تمت مقارنة أداء تقنيات القياس بناء على الدقة والدقة والاستدعاء ودرجة F1. حصلت الشبكة الوطنية على أعلى دقة تصنيف بلغت 77.5٪18. وبالمثل، جرب نفس مجموعة الباحثين أداء أربع تقنيات تصنيف — وهي NB وSVM وK-NN وANN — لتشخيص مرض الكلى المزمن بشكل استباقي، وتطبيقها على مجموعة البيانات السعودية19. علاوة على ذلك، أجرى المؤلفون دراسة لتشخيص سرطان الغدة الدرقية بشكل بدائي باستخدام أربع تقنيات تعلم آلة: ANN، SVM، RF، وNB. باستخدام 14 ميزة من مجموعة البيانات السعودية، حصل المؤلفون على أعلى متوسط دقة بنسبة 95٪. تمت مقارنة أداء تقنيات القياس باستخدام الدقة والدقة والاسترجاع ودرجة F1. حصل ال RF على أعلى دقة تصنيف تبلغ 90.91٪20. كما أجرى الباحثون دراستين أسفرتا عن نتائج مذهلة في التشخيص الاستباقي لالتهاب المفاصل الروماتويدي. تم اختيار عدة تقنيات تعلم آلة، مثل SVM، الانحدار اللوجستي (LR)، وAdaBoost، واستخدامها كتقنيات مرشحة لمجموعة تصويت. في البداية، تم استخدام مجموعة بيانات واحدة، وكانت الأخرى متوازنة بتطبيق SMOTE. تم اختبار تقنية التصويت الجديدة باستخدام طريقتين متتاليتين لاختيار الميزات. أي أن الاختيار الأمامي والخلفي يستخدم للعثور على أفضل مجموعة فرعية من فضاء الميزات تقدم أعلى المؤشرات لكل تقنية. باستخدام 30 ميزة من البيانات الأصلية وتقنية اختيار الميزات التسلسلية للأمام، كانت النسب المئوية المكتسبة واعدة، مع قيم دقة واسترجاع ودقة بلغت 94.03٪، 96٪، و93.51٪ على التوالي21. وبالمثل، يمكن العثور على طرق ذكية أخرى في الطب والمجالات ذات الصلة في العديد من الدراسات22،23،24،25،26.
التقنيات المقترحة في هذا العمل هي RF، SVM، ANN، وNB بسبب نتائجها المتميزة في مشاكل مماثلة. في الدراسة الحالية، النتائج التي تم الحصول عليها من خلال التجارب. بعد خطوات تحسين مختلفة واختيار الميزات، يتضح أن التقنيات المقترحة واعدة لتشخيص الربو باستخدام مجموعة البيانات المستهدفة.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يصف هذا القسم خوارزميات التعلم الآلي التي تم التحقيق في النهج المقترح لتشخيص الربو. تستند المعايير والأسباب وراء اختيار الطريقة المقترحة إلى مراجعة شاملة للأدبيات وتاريخ طويل من التعامل مع التشخيص الاستباقي لعدة أمراض مزمنة 27,28,29,30,31. وقد أنتجت هذه الخوارزميات نتائج واعدة. جميع المواد والأدوات المستخدمة في هذه الدراسة مدرجة في جدول المواد.
آلات الدعم المتجه (SVM)
تعد خوارزمية SVM من أنجح الخوارزميات في التعرف على الأنماط والتصنيف32. يستخدم التصنيف الثنائي، حيث يصنف مجموعة تدريب من المتجهات إلى فئتين. ينتمي إلى عائلة خوارزميات التعلم المراقب، حيث يتم توليد الناتج المطلوب تحت إشراف32. بالمقارنة مع خوارزميات التصنيف الأخرى في تعلم الآلة، يوفر SVM نتائج أفضل لأداء التصنيف. لذلك، تم استخدامه على نطاق واسع في العديد من التطبيقات مثل التعرف على الكلام، والوجوه، والتعرف على خط اليد. علاوة على ذلك، تم تطبيق SVM أيضا في مجالات مختلفة، بما في ذلك التنبؤ بالأمراض والتنبؤ بالمخزون. بالإضافة إلى ذلك، وبسبب عدم حساسيتها للضوضاء أو الإفراط في التركيب، يمكن ل SVM التعامل مع البيانات غير المتوازنة، وهو حالة نموذجية في التشخيصات الطبية، حيث تكون الحالات الإيجابية أقل من الحالات السلبية32.
في التصنيف، يفصل SVM بين فئتين برسم حدود قرار، حيث يمكنه التنبؤ بالتصنيفات من خلال تمييز متجه أو أكثر من متجهات الميزات32. يشار إلى حدود القرار باسم المستوى الفائق، وهو الأبعد عن أقرب نقاط البيانات لكل فئة. تعرف هذه النقاط باسم متجهات الدعم. يوضح الشكل 1 بعض المستويات الفائقة المرشحة في بيانات قابلة للفصل خطيا. تظهر المعادلة 1 معادلة المستوى الفائق، بينما تظهر المعادلتان 2 و3 العناصر الموجودة فوق وتحت المستوى32:
معادلة المستوى الفائق (1)
هنا، w هو متجه يمثل الوزن، x هو متجه يمثل المدخل، و b. يمثل انحياز محتمل.
لكل j، بحيث
= +1 (2)
لكل i، بحيث
= -1 (3)

الشكل 1: SVM نموذجي مع فئتين منفصلتين. يظهر هذا الشكل نموذج SVM نموذجي مع فئتين منفصلتين. الاختصارات؛ SVM = آلة دعم متجه. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الشبكة العصبية الاصطناعية (ANN)
الشبكة العصبية الذهنية هي تقنية ذكاء حاسوبي في الحوسبة الناعمة تحاكي وظائف نظام الدماغ البشري. يحتوي على عدد هائل من الخلايا العصبية المترابطة33. يعد من بين خوارزميات التعلم الآلي الخاضعة للإشراف التي يمكنها التعلم من مجموعات البيانات النموذجية وتحسين أدائها من خلال التعلم، مما يولد مخرجات مفيدة33. تتكون بنية ANN من عدة طبقات: طبقة إدخال، طبقة مخفية، وطبقة إخراج. كل واحدة منها تتكون من مجموعة من الخلايا العصبية المتصلة33.
يقوم الخلبون الذي يستقبل البيانات من الخارج ببعض المعالجة ثم يرسل البيانات إلى طبقة أخرى تعرف بطبقة الإدخال. الغرض من طبقة الإدخال ليس إجراء أي عملية معقدة على البيانات؛ بل هو ببساطة تكرار قيمة الإدخال وإرسالها إلى الطبقةالتالية 33. تحتوي طبقة الإخراج على الخلايا العصبية التي تنتج بيانات لبرنامج المستخدم. بين هاتين الطبقتين، تقع الطبقة المخفية كطبقة اختيارية لأداء العمليات الحسابية. تعمل الطبقة المخفية كطبقة وسيطة تستقبل المدخلات من الخلايا العصبية المدخلة، وتقوم بعمليات رياضية عليها، ثم تنقل النتائج إلى طبقة33 أخرى. يوضح الشكل 2 بنية الشبكة الصلبة الوطنية.

الشكل 2: التغذية للأمام والارتداد في هيكل ANN النموذجي. يصور هذا الشكل شبكة تغذية أمامية مع انتشار عكسي في بنية شبكة ذات شبكة ذات شبكة طبيعية نموذجية. الاختصارات؛ ANN = شبكة عصبية اصطناعية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
شبكة التغذية الأمامية هي نهج يخزن بيانات الإدخال في اتجاه متقدم. في الاتجاه المعاكس، تحدث عملية الانتشار العكسي مع تحديث أوزان الشبكة العصبية في نهج عكسي للحصول على التدرجات، باستخدام شبكة عصبية تحتوي على عدة طبقات مخفية. العيب في هذه العملية هو اختفاء أو انفجار التدرجات. تحافظ دالة التنشيط على الخصائص غير الخطية لشبكة ANN الخاصة بهم، مما يمكنها من تعلم العلاقات التفصيلية بين بيانات الإدخال والإخراج، كما هو معلن كتقريب عالمي. يوضح الشكل 3 البنية الرئيسية للشبكة العصبية الاصطناعية. كما يوضح دالة التنشيط المطبقة على خرج كل خلية عصبية، والتي تمثل مجموع جميع أوزان الإدخال. يحمل التحيز مجموع جميع الأوزان ويتم تضمينه في مدخل الخليةالعصبية 33.

الشكل 3: عصبون إدراكي نموذجي لعصبون ANN. يصور هذا الشكل عصبون بيرسيبترون واحد من شبكة ANN النموذجية. الاختصارات؛ ANN = شبكة عصبية اصطناعية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الغابة العشوائية (RF)
تعد الترددات الراديوية من أبرز خوارزميات التصنيف في تعلم الآلة. يتكون من عدة أشجار قرار فردية تعمل معا كفرقة واحدة وتنتج الإنتاج النهائي29. المفهوم الأساسي وراء الأداء الناجح للراديو هو أنه يتكون من العديد من الأشجار غير المترابطة بشكل معتدل (تشكل غابة)، والتي تعمل كلجنة واحدة. وبالتالي، ستكون أكثر كفاءة من جميع النماذج التي تعمل بشكل مستقل34. تم تطوير خوارزمية الترددات الراديوية بشكل أساسي من قبل مجموعة من الباحثين35. لفهم كيفية عمل الترددات الراديوية بشكل أفضل، من الضروري فهم أشجار القرار35. ينطبق عليه بالتساوي على كل من المشكلات المنفصلة والمستمرة، وبشكل خاص التصنيف، والكشف، والانحدار، على التوالي36. كلما زادت الأشجار في الغابة، كانت النتيجة أقرب إلى الدقة، ولكن مع تعقيد حسابي إضافي36، كما هو موضح في الشكل 4.

الشكل 4: مخطط الغابة العشوائية. يظهر هذا الشكل مخططا لغابة عشوائية نموذجية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
نايف بايز (NB)
بايز الساذجة (NB) هي خوارزمية تصنيف تستخدم مبرهنة بايز لتصنيف الأجسام. وهي طريقة شائعة جدا تستخدم في معظم المجالات الطبية، خاصة لتشخيص الأعراض. في هذه الطريقة، تأخذ الكائنات افتراضات الاستقلال الرئيسية، مما يجعل العلاقة بين السمات مستقلة عن بعضها البعض. وبسبب طبيعتها الساذجة، تعد من أبسط خوارزميات التصنيف في تعلم الآلة37. استنادا إلى مجموعة البيانات المعطاة، يحدد NB احتمالية وجود مخرج معين. نموذج NB سهل التطوير، ويمكنه إدارة بيانات كبيرة، وهو خوارزمية متقدمة وخفيفة من الناحية الحاسوبية. بالإضافة إلى ذلك، يقدم وظائف متواضعة، مما ينتج عنه معرفة رقمية واسمية. المتانة والتفسيرات البسيطة للتعلم هي أيضا من المزايا المحتملة لمصنف NB. إذا تم استخدامه على كمية محدودة من البيانات، فسيؤدي ذلك إلى نتيجة غير دقيقة نسبيا. يعتمد ذلك على سجلات ضخمة، والتي تعتبر أقل دقة مقارنة بالتقنيات الأخرى37.
التحليل الإحصائي
يساعد التحليل الإحصائي لمجموعة البيانات في تصور وفهم نمط مجموعة البيانات من أجل معالجة ونماذج بيانات مسبقة أفضل. وفي هذا الصدد، تم تنفيذ الخطوات التالية. أولا، للتحقيق فيما إذا كانت الميزات الديموغرافية غير متوازنة بين المجموعات الإيجابية والسلبية، بما في ذلك العمر والجنس، يتم إجراء تحليل إحصائي على برنامج SPSS. ثانيا، تجميع البيانات الكمية باستخدام اختبار t عينة مستقل إذا تم تحقيق التوزيع الطبيعي وتجانس التباين، أو اختبار مان-ويتني U. وأخيرا، تم تجميع البيانات التصنيفية باستخدام اختبار كاي-تربيع أو اختبار فيشر الدقيق38.
التنفيذ
وصف مجموعة البيانات
تم الحصول على مجموعة البيانات للدراسة الحالية من مستشفى جامعة الملك فهد في الدمام، المملكة العربية السعودية، بعد موافقة مجلس مراجعة المؤسسات (IRB). تم جمع البيانات المذكورة وفقا للاختبارات القياسية بين المرضى. غالبا ما يتم تشخيص الربو من خلال الفحوصات القياسية بين المرضى، بما في ذلك تحاليل الدم، واختبارات الفيروسات، واختبارات الكيمياء الحيوية. في الدراسة الحالية، تم تجنيد المرضى والأشخاص الأصحاء (HC) وتقييمهم سريريا بناء على الفرز والاختبارات المرضية القياسية التي أجريت في المستشفى بناء على توصيات الأطباء في القسم. تم تحديد معايير الإدراج والاستبعاد السريرية من قبل الأطباء بناء على نتائج المختبر. لاحقا، تم توفير البيانات المؤهلة والمثبتة للدراسة. تحتوي مجموعة البيانات على سبعة عشر خاصة، حيث تتوفر لجميع مرضى الربو. تتضمن مجموعة البيانات 328 حالة إجمالية منها 165 حالة إيجابية للربو و163 حالة سلبية. توزيع الجنس والعمر في المجموعات الإيجابية والسلبية مدرج في الجدول 1.
| الأمثلة | إيجابي | سلبي | |
| ذكر | 145 | 107 | 38 |
| أنثى | 183 | 57 | 126 |
| المجموع | 328 | 164 | 164 |
الجدول 1: توزيع مجموعة البيانات بين الجنسين. يوضح هذا الجدول توزيع الجنس في مجموعة البيانات.
يوضح الجدول 2 توزيع الأعمار بين الفئتين.
| النطاق العمري | توزيع الأعمار (الفئة = 1) | توزيع الأعمار (الفئة = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
الجدول 2: توزيع عمر مجموعة البيانات. يوضح هذا الجدول توزيع العمر في مجموعة البيانات.
كان العمر (p < 0.001 في اختبار مان-ويتني U) والجنس (p < 0.001 في اختبار كاي-تربيع) غير متوازنين بين المجموعتين الإيجابية والسلبية. ومع ذلك، لا يوجد تحيز في عملية التوظيف. يعتقد أن التوزيع غير المتوازن قد يعكس التوزيع العمري الفريد لهذه الدفعة المرضى. تشمل معايير الإدراج العوامل السريرية لوجود المرض وغيابه؛ يتم النظر في التركيبة السكانية، بما في ذلك الجنس والعمر والسكان المحليين. علاوة على ذلك، تم جمع البيانات بموافقة مستنيرة. العمر والجنس مشمولان كميزات محتملة في مجموعة الميزات، كما هو مذكور أدناه. ومع ذلك، فإن التحليلات الصريحة القائمة على العمر والجنس ليست ضمن نطاق الدراسة وتترك كأعمال مستقبلية.
يتم تخزين مجموعة البيانات كقيم رقمية. يحتوي عمود "الفئة" على القيم 0 و1، حيث يمثل 0 "المريض الطبيعي" و1 يمثل "مريض الربو".
وفي هذا الصدد، تم استخدام السمات السبعة عشر التالية:
الفئة: (0 = "طبيعي"، 1 = "مريض ربو")
1. العمر بالسنوات (العمر)
2. الجنس (1 = ذكر، 0 = أنثى): الجنس
3. البازوفيلز (BASO)
4. الإيوسينوفيلز (EOS)
5. الهيماتوكريت (HCT)
6. الهيموغلوبين (HGB)
7. الخلايا اللمفاوية (LYM)
8. متوسط الهيموغلوبين الجسيمي (MCH)
9. متوسط تركيز الهيموغلوبين في الجسمية (MCHC)
10. متوسط حجم الجسيمات (MCV)
11. الخلايا الأحادية (MONO)
12. متوسط حجم الصفائح الدموية (MPV)
13. وظيفة العدلات (NEUT)
14. عدد الصفائح الدموية (PLATELET_COUNT)
15. عدد خلايا الدم الحمراء (RBC)
16. عرض توزيع الخلايا الحمراء (RDW)
17. خلايا الدم البيضاء (WBC)
الميزات الإحصائية لمجموعة البيانات
لفهم أفضل، يتم عرض تحليل إحصائي لمجموعة البيانات في الجداولالتالية 38. يوضح الجدول 3 المتوسط، والوسيط، والانحراف المعياري، والقصوى، والقيم الدنيا لمجموعة البيانات قيد الدراسة.
| قاسية | الوسيط | الانحراف المعياري | ماكس | مين | |
| العمر | 39.1 | 36 | 18.136 | 93 | 2 |
| الجنس | 0.442 | 0 | 0.4974 | 1 | 0 |
| باسو | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| ليمب | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| مونو | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| نيوت | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| الفئة | 0.5 | 0.5 | 0.5008 | 1 | 0 |
الجدول 3: الميزات الإحصائية لمجموعة البيانات. يسرد هذا الجدول الميزات الإحصائية للبيانات.
بالإضافة إلى ذلك، يوضح الجدول 4 معامل الارتباط الحاصل بين كل سمة وسمة الفئة. تقع قيمه بين 0 (الأقل ارتباطا) و1 (الأكثر ارتباطا). يضاف كتحليل إحصائي أولي لشرح خصائص مجموعة البيانات. ال MPV، الجنس، HGB، MCHC، والعمر من بين أهم السمات.
| أزواج السمات | معامل الارتباط |
| العمر | 0.212473 |
| الجنس | 0.423584 |
| باسو | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| ليمب | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| مونو | 0.055476 |
| MPV | 0.564992 |
| نيوت | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| الفئة | 1 |
الجدول 4: ارتباط مع سمة الفئة. يوضح هذا الجدول العلاقة بين السمات (الميزات) وسمة الفئة.
الإعداد التجريبي
في الدراسة الحالية، تستخدم لغة البرمجة بايثون لمعالجة مجموعة البيانات المجمعة مسبقا. بسبب الخطأ البشري، هناك قيم محددة مفقودة أثناء إدخال البيانات والاختيار. تم استخدام تقنيات الحساب للتعامل مع القيم المفقودة في مجموعة البيانات. يتم ذلك عن طريق استبدال القيم المفقودة بمتوسط السمة. وبسبب بساطتها، وتوافقها مع النماذج، والحفاظ على قيم متوسط العينة، كما نوقش مع المتخصصين في الرعاية الصحية. علاوة على ذلك، يتم اختيار الخصائص باستخدام معاملات الارتباط لترتيب السمات. تم اختيار الميزات ذات قيم الارتباط الأعلى للتحليل جنبا إلى جنب مع مجموعة الميزات الكاملة. تم استخدام مكتبات بايثون لتنفيذ النهج المقترح، وضبط المعاملات الفائقة، والحصول على النتائج. تم إجراء اختيار وإزالة الميزات بواسطة طريقة اختيار السمات لتحديد مجموعات الميزات بأعلى دقة. بالإضافة إلى ذلك، تم استخدام بايثون لتقييم الدقة باستخدام طرق التحقق المتقاطع 10 أضعاف وتقييم نسبة التقسيم المباشر، كما هو محدد في المعادلات39,40. وأخيرا، تم حساب متوسط مخرجات جميع طرق التقييم لمقارنة طرق التقييم المستخدمة وتحديد الطريقة ذات الدقة المتوسطةالأفضل 38. بالإضافة إلى ذلك، تم توليد مصفوفات الالتباس باستخدام المعلمات المثلى ل SVM وANN وRF وNB. بعد ذلك، تم إجراء مقارنة بين نسب الإيجابيات الكاذبة (FP)، والسلبيات الكاذبة (FN)، والإيجابيات الحقيقية (TP)، والسلبيات الحقيقية (TN) من خلال حساب درجة F1، وهي مقياس فعال لمقارنة أفضل طريقة41,42.
مقاييس التقييم
لتقييم أداء النهج المقترح، يتم النظر في أربعة مقاييس أداء معروفة. وتحديدا، الدقة، الاستدعاء، ونتيجة F1. تعد دقة التصنيف هي المقياس الأساسي لأن نسبة الحالات المصنفة بشكل صحيح تحسب لكل حالة. الدقة هي عدد نقاط TP الإجمالية المتوقعة. الاستدعاء هو عدد TP أكثر من كل إيجابية فعلية. أداء F1 لكل فئة. وفقا لقدرة المخرجات، يتم الحصول على المقاييس التالية 43,44,45:
النتيجة الإيجابية الحقيقية (TP): نتيجة تشخيص صحيح كربو.
النتيجة الإيجابية الكاذبة (FP): نتيجة تشخيص خاطئ بالربو.
السلبية الحقيقية (TN): نتيجة الحالات الصحيحة التي تم تشخيصها بأنها غير ربو.
سلبي كاذب (FN): نتيجة تشخيص خاطئ على أنه غير ربو (ربو).
(4)
(5)
(6)
استراتيجية التحسين
لتحديد المعلمات المثلى لكل من الأساليب المقترحة، تم استخدام تقنية البحث الشبكي. يتم وضع قيم المعاملات الممكنة المحددة في طريقة البحث الشبكي. لذلك، يمكنه تحقيق أفضل أداء ممكن لتحسين الدقة.
توضح الأشكال 5–7 نتائج تقنية البحث الشبكي لجميع الأساليب الأربعة المقترحة وإجراءات التنفيذ على مجموعة البيانات بمساعدة أفضل ثمانية عشر سمة. يعرض الشكل 5 دقة SVM التي تم الحصول عليها من خلال قيم معلمات مختلفة. قيم الإدخال للتكلفة والجاما المقابلة لأنواع متعددة من النوى هي كما يلي:
أنواع النواة: خطية، شعاعية، سنجية، ومتعددة الحدود.
غاما: 0.001 و0.0001.
التكلفة: 1، 10، 100، و1000.

الشكل 5: SVM بأنواع مختلفة من التكلفة والجاما. يظهر هذا الشكل سلوك SVM بأنواع مختلفة من التكلفة والجاما. الاختصارات؛ SVM = آلة دعم متجه. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
بالنسبة للراديو الراديوي، فإن قيم الإدخال المنهجي الموضحة في الشكل 6 هي كما يلي:
أسماء المعلمات، مع قيمها الخاصة، موفرة أدناه:
عدد الميزات: 'تلقائي'، 'SQRT'.
أقصى عمق: 1، 3، 5، 7.
تقسيم عينات المين: 2، 3، 4، 5.
عينات الورقة الصغيرة: 2، 3، 4، 5.

الشكل 6: RF بقيم عمق مختلفة وأوراق العينة المنخفضة. يظهر هذا الشكل سلوك الترددات الراديوية بأعماق مختلفة وقيم أوراق العينة المختلفة. الاختصارات؛ RF = غابة عشوائية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
بالنسبة للشبكة الصلبة العصبية، يتم تحديد قيم الإدخال التحليلي في الشكل 7.
أسماء المعلمات، إلى جانب قيمها الخاصة، هي كما يلي:
أحجام الطبقات المخفية: (50، 50، 50)، (50، 100، 50)، و(100).
التفعيل: 'تانه' و'ريلو'.
الحل: 'sgd' و'آدم'.
ألفا: 0.1، 0.01، 0.001، 0.0001، 0.5، 0.005، 0.0005، و0.05.
معدل التعلم: 'ثابت' و'تكيف'.

الشكل 7: شبكة ذات صلبة ذات قيم ألفا مختلفة وأحجام طبقات مخفية. يصور هذا الشكل سلوك الشبكة ذات الطابع العصبي العصبي بقيم ألفا مختلفة وأحجام طبقات مخفية. الاختصارات؛ ANN = شبكة عصبية اصطناعية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
| المصنف | المعلمة | القيمة |
| SVM | غاما | 0.0001 |
| نوع النواة | 'RBF' | |
| التكلفة 'C' | 10 | |
| الحالة العشوائية | 42 | |
| RF | أقصى عمق | 3 |
| عينات المينيوم من ورقة | 2 | |
| تقسيم العينات الأدنى | 2 | |
| الحالة العشوائية | 42 | |
| آن | التفعيل | 'ريلو' |
| ألفا | 0.001 | |
| حجم الطبقة المخفية | (50,50,50) | |
| معدل التعلم | 'ثابت' | |
| الحل | 'آدم' | |
| الحالة العشوائية | 42 |
الجدول 5: ملخص المعلمات المثلى للمصنفات المقترحة. يلخص هذا الجدول المعلمات المثلى التي تم الحصول عليها للمصنفات المقترحة.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تأثير اختيار الميزات
في الدراسة الحالية، تم استخدام طريقة معامل الارتباط المعتمدة على إزالة الميزات التكرارية لاختيار الميزات. يستخدم معامل الارتباط لترتيب الميزات من الأعلى إلى الأدنى وفقا لقيم الارتباط الخاصة بها. يستخدم الحذف التكراري للميزات للمساعدة في اختيار الميزات المناسبة للنموذج، حيث يزيل تدريجيا أضعف الميزات حتى يبقى واحدة فقط. كل عملية تشغل المصنفات الأربعة المختارة مع التحقق المتقاطع 10 أضعاف للعثور على المجموعة ذات أعلى دقة. فيما يلي طريقة الاستبعاد:
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تستخدم الدراسة الحالية عدة خوارزميات تعلم آلة، بما في ذلك SVM وANN وRF وNB. بعد إجراء عدة تجارب، وضبط المعلمات الفائقة واختيار الميزات، تم الاستنتاج أن SVM وANN وRF تظهر دقة تشخيصية مذهلة تبلغ 94٪، بينما NB أقل نسبيا عند 83.33٪. تم التحقق من النتائج باستخدام التحقق المتقاطع بعشرة مرات واختيار الميزات المحسن، بالإضافة إلى أفضل نسبة تقسيم. وفقا للبيانات المقدمة، تم تصنيف سبعة عشر معلما للمرضى حسب قيم معاملات الارتباط، وأظهر أن انخفاض MPV وGENDER لهما أعلى ارتباط إيجابي بالربو. من ناحية أخر...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تم الحصول على مجموعة البيانات من المستشفى بموجب IRB-2020-09-429. يعلن المؤلفون أنه لا توجد لديهم تضارب مصالح للإبلاغ عنه بشأن الدراسة الحالية. تمت إضافة الدراسة إلى مستودع ريسيرش سكوير كطبعة أولية مع الاقتباسالتالي رقم 50.
مساهمات المؤلفين:
تم تنفيذ التصور من قبل S.O.، M.I.B.A. وA.R.؛ تم الإشراف من قبل S.O.، M.I.B.A. وJ.A.؛ تم كتابة المسودة الأصلية بواسطة S.S.A.، E.A. وZ.A.؛ تم تنفيذ التنفيذ بواسطة S.A.A.، Y.A. وR.A.؛ تم التحقق من ذلك بواسطة J.A.، M.A. وS.D.؛ تم تنظيم البيانات بواسطة A.B.، Y.A.، E.A. وZ.A.؛ تم تنفيذ المراجعة والتحرير بواسطة A.R.، S.D. وA.B.؛ تم تنفيذ إدارة المشاريع بواسطة A.R.، S.D. والماجستير، وتم تنفيذ الاستحواذ على التمويل بواسطة A.B.، S.D. وA.R.
يرغب المؤلفون في الاعتراف بدعم المتخصصين في الرعاية الصحية في التحقق من نتائج الدراسة.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Excel 365 | Microsoft | Excel 365 | يستخدم لتخزين البيانات الأولية بتنسيق csv |
| Laptop/Machine | Dell | XPS9320 | RAM 16GB، الجيل الثاني عشر Intel(R) Core(TM) i7-1260P |
| Mlxtend 0.23.4 | Google colab Notebook | Mlxtend 0.23.4 | يستخدم لبناء نماذج التدريب |
| Numpy 2.0.2 | Google colab Notebook | Numpy 2.0.2 | يستخدم لبناء نماذج التدريب |
| Pandas 2.2.2 | Google colab Notebook | Pandas 2.2.2 | يستخدم لبناء نماذج التدريب |
| Python 3.12.12 | Google colab Notebook | Python 3.12.12 | يستخدم لبناء نماذج التدريب |
| Sklearn 1.6.1 | Google colab Notebook | Sklearn 1.6.1 | يستخدم لبناء نماذج التدريب |
| SPSS | IBM, USA | الإصدار 26.0 | يستخدم للتحليل الإحصائي |
| XGbbost 3.1.2 | Google colab Notebook | XGbbost 3.1.2 | يستخدم لبناء نماذج التدريب |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن