مقالة منهجية

بروتوكول تجريبي قابل للتكرار لتطوير وتقييم نماذج الذكاء الاصطناعي القابلة للتفسير في أنظمة الرعاية الصحية

2 مشاهدة

DOI:

10.3791/73848

سبتمبر 15, 2026

في هذه المقالة

ملخص

يقدم هذا البروتوكول سير عمل قابلاً للتكرار لتطوير نماذج الذكاء الاصطناعي القابلة للتفسير في الرعاية الصحية وتقييمها وتفسيرها. وهو يدمج عمليات تحضير البيانات الموحدة، وتطوير النماذج، وتقنيات القابلية للتفسير، والتقييم الكمي، وممارسات قابلية التكرار لتعزيز الشفافية والموثوقية والقابلية للتطبيق السريري.

الملخص

يتم اعتماد الذكاء الاصطناعي (AI) بشكل متزايد كأداة قيمة لاتخاذ القرارات السريرية، والتنبؤ بالأمراض، والتشخيص الطبي، والرعاية الصحية الشخصية. ومع ذلك، لا يزال نقص الشفافية، والتطبيق غير المتسق لطرق الذكاء الاصطناعي القابل للتفسير (XAI)، ومحدودية القابلية للتكرار تشكل عوائق رئيسية أمام النشر الموثوق لنماذج الذكاء الاصطناعي في البيئات السريرية. تقترح هذه الورقة بروتوكولاً منهجياً وقابلاً للتكرار وشفافاً لتطوير وتقييم وتفسير نماذج الذكاء الاصطناعي القابلة للتفسير في تطبيقات الرعاية الصحية. يبدأ سير العمل بإعداد البيئة الحسابية، يليه الحصول على البيانات وتوصيفها، والمعالجة المسبقة، وهندسة الميزات، وتطوير النموذج، وتحسين المعلمات الفائقة، وتقييم الأداء التنبئي، وتحليل القابلية للتفسير، والتحقق الإحصائي، وتقييم القابلية للتكرار. يتضمن البروتوكول طرق XAI مثل SHapley Additive exPlanations (SHAP)، وLocal Interpretable Model-agnostic Explanations (LIME)، وGradient-weighted Class Activation Mapping (Grad-CAM)، وIntegrated Gradients، وتصور الانتباه (attention visualization)، والتفسيرات المضادة للواقع (counterfactual explanations) لإنشاء تفسيرات للنموذج على المستويين العالمي والمحلي. يركز البروتوكول على عدة مكونات رئيسية، بما في ذلك إعداد مجموعات بيانات رعاية صحية معيارية، وتطوير نماذج تعلم آلي مستقرة، وتقييم الأداء التنبئي، وتوليد تفسيرات ذات صلة سريرياً، والتقييم الإحصائي للقابلية للتكرار عبر التجارب المكررة. ومن خلال دمج تطوير النموذج، والقابلية للتفسير، والتقييم الكمي والنوعي، والتحقق الإحصائي، وتقييم القابلية للتكرار في سير عمل موحد، يوفر هذا البروتوكول إطاراً شاملاً لتطوير نماذج ذكاء اصطناعي شفافة وقابلة للتكرار لتطبيقات الرعاية الصحية.

المقدمة

أصبح الذكاء الاصطناعي مكوناً أساسياً في الرعاية الصحية الحديثة من خلال تمكين التحليل الذكي للبيانات السريرية المعقدة ودعم اتخاذ القرارات الطبية القائمة على الأدلة1. وقد أدت الرقمنة السريعة للرعاية الصحية من خلال السجلات الصحية الإلكترونية، ونظم التصوير الطبي، والأجهزة القابلة للارتداء، وتقنيات الجينوم إلى توليد أحجام كبيرة من البيانات غير المتجانسة التي تتطلب مناهج حوسبية متقدمة للتفسير الفعال2.

أظهرت خوارزميات تعلم الآلة (ML) والتعلم العميق (DL) قدرات ملحوظة في استخراج أنماط ذات دلالة من مجموعات بيانات الرعاية الصحية متعددة الأبعاد، مما أدى إلى تحسين دقة التشخيص، والتنبؤ بالأمراض، وتقييم نتائج المرضى3. وقد تم تطبيق النماذج القائمة على الذكاء الاصطناعي بنجاح في الأشعة، وعلم الأمراض، وأمراض القلب، والأورام، وطب العيون، وغيرها من التخصصات الطبية لمساعدة الأطباء في الكشف عن الأمراض في مراحل مبكرة والتوصية باستراتيجيات علاجية مخصصة4. كما ساهمت هذه التقنيات في تحسين سير العمل، وتقليل التباين التشخيصي، وتحسين استخدام موارد الرعاية الصحية5.

أدت التطورات الأخيرة في الأجهزة الحسابية، والحوسبة السحابية، وأطر الذكاء الاصطناعي مفتوحة المصدر إلى تسريع تطوير ونشر تطبيقات الرعاية الصحية الذكية6. وبناءً على ذلك، أصبح الذكاء الاصطناعي تقنية تمكينية أساسية للطب الدقيق وأنظمة دعم القرار السريري7. ورغم هذه التطورات، لا يزال الاعتماد الواسع للذكاء الاصطناعي في الممارسة السريرية الروتينية محدوداً لأن العديد من النماذج عالية الأداء لا تقدم سوى رؤى قليلة حول كيفية توليد تنبؤاتها8.

تعمل معظم خوارزميات التعلم العميق كنماذج "صندوق أسود" معقدة، حيث يصعب على السريريين والباحثين فهم عملية صنع القرار الداخلية فيها9. وعلى الرغم من أن هذه النماذج غالباً ما تحقق أداءً تنبؤياً ممتازاً، إلا أن افتقارها إلى الشفافية يضعف ثقة المستخدم ويفرض تحديات أمام التحقق السريري، والموافقة التنظيمية، وسلامة المرضى10. ويجب أن يكون المتخصصون في الرعاية الصحية قادرين على تبرير القرارات المدعومة بالذكاء الاصطناعي قبل دمجها في الممارسة السريرية الروتينية، خاصة في البيئات الطبية عالية المخاطر11.

لقد برز الذكاء الاصطناعي القابل للتفسير (XAI) كنهج فعال لتحسين شفافية نماذج تعلم الآلة وقابليتها للتفسير12. وبدلاً من التعامل مع نماذج التنبؤ كأنظمة معتمة، توفر تقنيات XAI معلومات حول الميزات، أو مناطق الصور، أو المتغيرات السريرية التي تساهم في التنبؤات الفردية13. وتمكن هذه التفسيرات الأطباء من فهم سلوك النموذج بشكل أفضل، وتحديد التحيزات المحتملة، وتحديد ما إذا كانت القرارات الناتجة عن الذكاء الاصطناعي تتوافق مع المعرفة الطبية الراسخة14.

تم تقديم العديد من تقنيات القابلية للتفسير لتطبيقات الرعاية الصحية. حيث تقيس تفسيرات SHapley الإضافية (SHAP) مساهمة كل ميزة في تنبؤ النموذج بناءً على نظرية الألعاب التعاونية15. بينما تقوم التفسيرات المحلية القابلة للتفسير والمستقلة عن النموذج (LIME) بإنشاء نموذج مبسط وشرح تنبؤات نموذج الصندوق الأسود16. وبالنسبة لمهام الصور الطبية التي تستخدم نماذج التعلم العميق، تقوم خرائط التنشيط الموزونة بالتدرج (Grad-CAM) بإنشاء خرائط حرارية تشير بصرياً إلى مناطق الصورة التي تساهم في قرارات التصنيف17. وقد أدى الجمع بين هذه الطرق إلى تعزيز شفافية أنظمة الذكاء الاصطناعي بشكل كبير عبر مختلف مجالات الرعاية الصحية18.

على الرغم من الاهتمام المتزايد بطرق التفسير في سياقات الرعاية الصحية، إلا أن استخدامها لا يزال متبايناً في الدراسات السابقة. ولا يختلف الباحثون في استخدام استراتيجيات المعالجة المسبقة فحسب، بل يختلفون أيضاً في تصميم بنية النموذج، ومقاييس التقييم، وحتى تقنيات التفسير19. كما أن العديد من الأوراق البحثية تشير إلى دقة تنبؤية عالية، ولكنها تخفق في تقديم تقييم شامل لجودة التفسيرات أو إمكانية تكرار نتائجها20.

تعد قابلية التكرار إحدى العقبات الرئيسية في علوم الذكاء الاصطناعي الحديثة؛ حيث غالبًا ما تغفل الأوراق البحثية الكشف عن إصدار البرمجيات، والبيئة الحسابية، ومسار المعالجة المسبقة، وإعدادات المعاملات الفائقة، وتهيئة البذور العشوائية، وتكوينات الأجهزة21. وبسبب ذلك، غالبًا ما يفشل الباحثون المستقلون في إعادة إنتاج النتائج المنشورة أو التحقق من الطرق المنشورة باستخدام مجموعات بيانات أو منصات برمجية أخرى22. ويعد نقص التوثيق المفصل أحد العوامل التي تعيق دراسات القياس المرجعي، والأبحاث التعاونية، والترجمة السريرية لأنظمة الذكاء الاصطناعي23.

وإدراكاً لهذه التحديات، شددت العديد من المنظمات والوكالات التنظيمية على أهمية توفير ذكاء اصطناعي شفاف وموثوق وقابل للتكرار في تطبيقات الرعاية الصحية24. وقد ساهمت إرشادات التقارير الحالية في تحسين التوثيق المنهجي، إلا أنها تصف بشكل أساسي ما يجب الإبلاغ عنه بدلاً من تقديم إجراءات تجريبية معيارية يمكن للباحثين تنفيذها مباشرة25. وبناءً على ذلك، لا تزال هناك حاجة إلى بروتوكول شامل يدمج تحضير مجموعات البيانات، وتطوير النماذج، وتحليل القابلية للتفسير، والتقييم الإحصائي، وممارسات إمكانية التكرار في سير عمل تجريبي واحد26.

يوفر البروتوكول التجريبي الموحد عدة مزايا لمجتمع الذكاء الاصطناعي في مجال الرعاية الصحية. علاوة على ذلك، فإنه يعزز الاتساق المنهجي، ويسهل مقارنة الدراسات المستقلة، ويزيد من شفافية التجارب الحسابية، ويتيح التحقق الموثوق من النتائج المنشورة27. كما تساعد سير العمل الموحدة في التعليم والتدريب، والبحث التعاوني، والتقييم التنظيمي من خلال إجراءات موثقة بوضوح وقابلة للتكرار عبر مختلف المختبرات ومؤسسات الرعاية الصحية28.

تم تطوير واختبار بروتوكول تجريبي قابل للتكرار لتدريب وتقييم نماذج الذكاء الاصطناعي في أنظمة الرعاية الصحية. يحدد البروتوكول معايير تهيئة البيئة الحسابية، والمعالجة المسبقة لمجموعات بيانات الرعاية الصحية، وتطوير نماذج تعلم الآلة، وتطبيق طرق الذكاء الاصطناعي القابل للتفسير (XAI)، وتقييم الأداء التنبؤي، وإجراء التحقق الإحصائي، وتقييم قابلية التكرار29. ومن المرجح أن يؤدي دمج هذه المكونات في سير عمل متماسك إلى تعزيز الشفافية والموثوقية وقابلية التكرار في أبحاث الذكاء الاصطناعي في مجال الرعاية الصحية، فضلاً عن المساعدة في تطوير أنظمة صحية ذكية وموثوقة30.

البروتوكول

استخدمت تجربة التحقق المُنفذة مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) المتاحة علناً والمجهولة الهوية، ولم تتضمن سجلات مرضى يمكن تحديد هويتهم أو استقطاب مرضى جدد. وبناءً على ذلك، لم يكن هناك حاجة إلى موافقة مستنيرة أو موافقة من مجلس المراجعة المؤسسية (IRB)/لجنة الأخلاقيات، وأُجريت جميع التحليلات وفقاً لشروط مجموعة البيانات المطبقة وسياسات البحث المؤسسية.

يستخدم مثال التحقق العملي مجموعة بيانات سكري الهنود من قبيلة "بيما" (Pima Indians Diabetes Dataset) المتاحة للعموم، والتي تحتوي على 768 سجلاً للتنبؤ الثنائي بمرض السكري. وقد طُبق سير العمل الأساسي المكون من تسع مراحل على مجموعة البيانات هذه. شملت المراحل الأساسية التسع اختيار مجموعة البيانات والتحقق من صحتها، وتكوين البيئة الحوسبية، والمعالجة المسبقة للبيانات، وتقسيم مجموعة البيانات، وتطوير النموذج وتدريبه، وتقييم الأداء التنبئي والحوسبي، وتحليل القابلية للتفسير، والتحقق الإحصائي، وتقييم إمكانية التكرار. أما التحقق الخارجي وتقييم الخبراء السريريين فقد تم الإبقاء عليهما كـوحدات تحقق اختيارية ولم يتم تنفيذهما في هذا المثال العملي. يوضح الشكل 1 سير عمل البروتوكول الأساسي، ويلخص الجدول 1 المراحل الأساسية التسع التي تم تنفيذها فقط في عملية التحقق العملية الحالية؛ بينما تم وصف التحقق الخارجي وتقييم الخبراء السريريين الاختياريين بشكل منفصل ضمن البروتوكول ولم يتم إدراجهما ضمن المراحل التجريبية التسع.

1. اختيار مجموعة بيانات الرعاية الصحية والتحقق من صحتها

  1. اختر مجموعة بيانات السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) كمجموعة بيانات أساسية لمثال التحقق العملي. تحقق من مصدر مجموعة البيانات، وحجم العينة، وهدف التنبؤ، وتوزيع الفئات، وبنية البيانات.
  2. طبق معايير الاشتمال والاستبعاد وجودة البيانات المحددة مسبقاً. قم بإزالة السجلات المكررة وغير الصالحة قبل تطوير النموذج.
  3. سجل مصدر مجموعة البيانات، وخصائصها، ومهمة التنبؤ، وتوزيع الفئات، ومعايير الاشتمال والاستبعاد، واستراتيجية التقسيم في الجدول 2.
  4. طبق معايير القرار لاختيار مجموعة البيانات والنموذج:
    1. حدد هدف التنبؤ قبل اختيار مجموعة البيانات، أو بنية النموذج، أو استراتيجية المعالجة المسبقة، أو طريقة القابلية للتفسير.
    2. طابق نمط مجموعة البيانات مع هدف التنبؤ. اختر البيانات الجدولية للمتغيرات السريرية المهيكلة، أو بيانات التصوير للصور الطبية، أو بيانات السلاسل الزمنية للإشارات الفسيولوجية، أو البيانات النصية للسرديات السريرية، أو البيانات متعددة الأنماط عند توفر أنماط تكميلية لنفس المريض أو وحدة الدراسة.
    3. قيم مجموعات البيانات المرشحة وفقاً لحجم العينة، وتوفر النتائج، وتوزيع الفئات، والبيانات المفقودة، وجودة التعليقات التوضيحية، والأهمية السريرية، واكتمال البيانات، وإمكانية الوصول إليها. اختر مجموعة البيانات التي تستوفي المتطلبات المحددة مسبقاً.
    4. اختر نماذج تعلم الآلة التقليدية للبيانات الجدولية المهيكلة عندما يحد حجم العينة أو الموارد الحسابية أو متطلبات القابلية للتفسير من استخدام البنى المعقدة. اختر بنيات التعلم العميق عندما تتوفر بيانات تدريب كافية ومدخلات عالية الأبعاد، مثل الصور الطبية أو الإشارات الفسيولوجية أو النصوص السريرية.
    5. اختر البنيات متعددة الأنماط فقط عندما تتوفر أنماط متعددة لنفس المريض أو وحدة الدراسة ويمكن محاذاتها بشكل موثوق دون التسبب في تسرب المعلومات. اختر عمليات المعالجة المسبقة وفقاً لخصائص نمط البيانات المختار.
    6. اختر طرق القابلية للتفسير وفقاً للنموذج ونمط البيانات. استخدم الطرق المستقلة عن النموذج مثل SHAP أو LIME لنماذج البيانات الجدولية المناسبة، والطرق الخاصة بالنمط مثل Grad-CAM للنماذج القائمة على الصور، عند الاقتضاء.
    7. وثق المبررات لاختيار مجموعة البيانات، واستراتيجية المعالجة المسبقة، والنموذج، وطريقة القابلية للتفسير. احتفظ بهذه القرارات كجزء من سجل إعادة الإنتاجية.

2. تهيئة البيئة الحسابية لتطوير نموذج الذكاء الاصطناعي القابل للتفسير (XAI)

  1. قم بتهيئة نظام التشغيل، ووحدة المعالجة المركزية (CPU)، وذاكرة الوصول العشوائي (RAM)، ووحدة التخزين، ووحدة معالجة الرسوميات (GPU) وفقاً لمتطلبات النموذج المختار. ثم أنشئ بيئة Python معزولة وقم بتثبيت المكتبات المطلوبة لتعلم الآلة، والتعلم العميق، والإحصاء، والتصور البياني، والذكاء الاصطناعي القابل للتفسير (XAI).
  2. سجّل بيئة الحوسبة الفعلية، وبنية النموذج، والمعلمات الفائقة المستخدمة في عملية التحقق التي تم إجراؤها في الجدول ٣حدد المُحسِّن (optimizer)، ومعدل التعلم، وحجم الدفعة، والعدد الأقصى للدورات (epochs)، ودالة الخسارة، ومعلمات التسوية (regularization parameters)، واستراتيجية التحقق، وتكوين التوقف المبكر، وتكوين البذرة العشوائية، وطرق القابلية للتفسير، والأجهزة المستخدمة، ونظام التشغيل، وإصدار لغة Python، وإصدارات المكتبات البرمجية ذات الصلة. ميّز هذه الإعدادات المستخدمة تجريبيًا عن الإعدادات العامة أو الموصى بها في البروتوكول.
  3. استخدم التكوين الوارد في الجدول 3 عند إعادة إنتاج عملية التحقق من مجموعة بيانات سكري هنود البيما (Pima Indians Diabetes Dataset)، والنتائج المقابلة المتعلقة بالتنبؤ، وقابلية التفسير، والإحصاءات، وقابلية إعادة الإنتاج.
  4. قم بتشغيل نص برمجي للتحقق (validation script) للتأكد من نجاح استيراد الحزم، وتحميل مجموعة البيانات، وتنفيذ النموذج، وتوليد المخرجات. حافظ على تكوين البيئة النهائي لضمان قابلية تكرار النتائج.

3. تحضير وتوصيف مجموعات البيانات الرعاية الصحية لتطوير نموذج الذكاء الاصطناعي القابل للتفسير (XAI)

  1. اختيار مجموعة بيانات الرعاية الصحية والحصول عليها
    1. اختر مجموعة بيانات رعاية صحية مناسبة لمهمة التنبؤ السريري المحددة. قم بتقييم مجموعات البيانات المرشحة وفقاً لهدف البحث، ونوع البيانات، وحجم العينة، وجودة التعليقات التوضيحية، وتوازن الفئات، والأهمية السريرية.
    2. يُفضل استخدام مجموعات البيانات المرجعية المتاحة للعموم عندما تعالج مهمة التنبؤ بشكل كافٍ وتسهل عملية التحقق المستقل.
    3. احصل على الموافقات الأخلاقية المطلوبة، والتصاريح المؤسسية، وتصريح الوصول إلى البيانات قبل الحصول على مجموعات البيانات المؤسسية أو الداخلية. احصل على مجموعة البيانات المختارة من مستودع موثق أو قاعدة بيانات مؤسسية معتمدة.
    4. احتفظ بملفات مجموعة البيانات الأصلية دون تعديل، وسجل مزود مجموعة البيانات، والإصدار، ومعلومات الاستحواذ، وشروط الترخيص، ومعايير الشمول، ومعايير الاستبعاد، والبيانات الوصفية المصاحبة. نظم مجموعة البيانات في أدلة منفصلة للبيانات الخام، والتوصيفات، والبيانات الوصفية، والمعلومات التكميلية.
  2. توصيف مجموعة بيانات الرعاية الصحية
    1. حدد المتغيرات التنبؤية، وتسميات النتائج، وأنواع السمات، وأنماط البيانات، وتوزيعات الفئات. حدد عدد الأشخاص، والعينات، وأبعاد السمات، والتوصيفات المتاحة.
    2. تأكد من أن خصائص مجموعة البيانات تتوافق مع طريقة الذكاء الاصطناعي المختارة.
    3. استخدم مجموعة بيانات مرض السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) كـمجموعة البيانات التجريبية الوحيدة المُطبقة للتحقق من صحة البروتوكول الأساسي المكون من تسع مراحل. قم بتضمين مجموعات البيانات الإضافية المدرجة في جدول 2 فقط لإثبات مدى قابلية تطبيق البروتوكول العام عبر البيانات الجدولية السريرية، والسجلات الصحية الإلكترونية، وصور تنظير الجلد، وبيانات السلاسل الزمنية الفسيولوجية، والتصوير الطبي. ولا يجوز استخدام هذه المجموعات الإضافية من البيانات في تدريب النموذج، أو اختباره، أو التحقق الإحصائي، أو استخراج النتائج التجريبية الواردة في التقرير.
  3. تقييم جودة مجموعة البيانات
    1. افحص مجموعة البيانات بحثاً عن السجلات المكررة، والملفات التالفة، والقيم المفقودة، وأخطاء التعليقات التوضيحية، ومدخلات البيانات غير المنتظمة. قم بإزالة السجلات المكررة المؤكدة وتصحيح التجاوزات في التنسيق التي تم التحقق منها. وثق جميع إجراءات ضبط جودة مجموعة البيانات.
    2. تحقق من تطابق بيانات التصوير والبيانات السريرية والمخبرية والفيزيولوجية من خلال معرفات الأشخاص عند استخدام مجموعات البيانات متعددة الوسائط.
    3. قم بإزالة السجلات المكررة أو غير المتسقة، ومعالجة القيم المفقودة، وتوحيد الميزات العددية، وترميز المتغيرات الفئوية، وتطبيق المعالجة المسبقة الخاصة بكل نمط. قم بتقسيم مجموعة البيانات إلى مجموعات مستقلة للتدريب والتحقق والاختبار. ارجع إلى الشكل 2 لسير العمل الخاص بإعداد مجموعات بيانات الرعاية الصحية، ومعالجتها الأولية، وتقسيمها، وتقييم جودتها.
  4. ضمان خصوصية البيانات والامتثال الأخلاقي
    1. قم بإزالة المعرفات المباشرة من البيانات الصحية. وطبق إجراءات إخفاء الهوية أو إضفاء أسماء مستعارة عند الاقتضاء. وتعامل مع المعلومات الصحية الخاصة بالمرضى وفقاً للمتطلبات الأخلاقية، ومتطلبات حماية البيانات، والموافقة المستنيرة، والمتطلبات المؤسسية المعمول بها.
    2. سجّل الموافقة الأخلاقية المعمول بها، والتنازل، وإجراءات حوكمة البيانات، وطرق إخفاء الهوية، ومسار عمل إعداد مجموعة البيانات.
    3. قيّم التحيز الخوارزمي المحتمل من خلال مقارنة أداء النموذج عبر المجموعات الفرعية الديموغرافية أو السريرية ذات الصلة، وذلك عندما تكون هذه المعلومات متاحة ومسموحاً بها أخلاقياً.
    4. وثّق الغرض من الاستخدام، والمجتمع المستهدف، ومحدودية النموذج، وأنماط الفشل المحتملة، ومتطلبات الإشراف البشري، والمتطلبات الأخلاقية، ومتطلبات حماية البيانات، والمتطلبات التنظيمية للرعاية الصحية المعمول بها.
    5. سجّل قيود العدالة المحددة واعتبارات الذكاء الاصطناعي المسؤول كجزء من التوثيق النهائي للنموذج.
      ملاحظة: احصل على مجموعة بيانات رعاية صحية معيارية وموثقة تكون مناسبة لتطوير نماذج الذكاء الاصطناعي، ومتوافقة أخلاقياً، وخالية من التناقضات الجوهرية المحددة.

4. المعالجة المسبقة لبيانات الرعاية الصحية وتقسيمها لتدريب نموذج الذكاء الاصطناعي

  1. إجراء مراقبة الجودة
    1. فحص مجموعة البيانات بحثاً عن السجلات المكررة، والقيم المفقودة، والقيم غير الصالحة، والتسميات غير المتسقة، والقيم المتطرفة، والملفات التالفة.
    2. إزالة أو تصحيح الملاحظات غير الصالحة وفقاً لمعايير محددة مسبقاً وتسجيل جميع الاستبعادات. والتحقق من اتساق المتغيرات التنبؤية وتسميات النتائج.
  2. معالجة البيانات المفقودة
    1. تحديد كمية الفقد لكل متغير. وتطبيق استراتيجية التعويض أو الاستبعاد المحددة مسبقاً.
    2. تقدير معالم التعويض باستخدام بيانات التدريب فقط وتطبيق التحويل الملائم على بيانات التحقق والاختبار.
  3. تطبيع وتحويل البيانات
    1. تطبيق قياس الميزات، أو التطبيع، أو الترميز، أو تقليل الأبعاد، أو أي تحويلات أخرى يتطلبها النموذج المختار. ويتم ملاءمة جميع التحويلات المعتمدة على البيانات باستخدام بيانات التدريب فقط.
    2. تطبيق التحويلات الملائمة دون تغيير على بيانات التحقق والاختبار.
  4. تحديد كمية عدم التوازن في الفئات في بيانات التدريب. وتطبيق أوزان الفئات، أو SMOTE، أو الإفراط في أخذ العينات، أو التكبير على مجموعة بيانات التدريب فقط. مع الحفاظ على التوزيع الأصلي لمجموعات بيانات التحقق والاختبار.
  5. التأكد من عدم مشاركة أي شخص خاضع للدراسة، أو ملاحظة مكررة، أو عينة مكبرة، أو إحصائية معالجة مسبقة، أو معيار اختيار ميزات، أو عينة اصطناعية بين أقسام التدريب والتقييم.

5. تطوير وتكوين نموذج الذكاء الاصطناعي القابل للتفسير (XAI)

  1. تحديد بنية النموذج من خلال تحديد أنماط بيانات الإدخال، وعمليات المعالجة المسبقة، وأجهزة تشفير الميزات الخاصة بكل نمط، وآلية دمج الميزات، وطبقة التنبؤ، ووحدة القابلية للتفسير.
  2. اختيار بنية تعلم الآلة أو التعلم العميق وفقاً لمهمة التنبؤ ونمط الإدخال. وتكوين طبقة الإدخال، ومكونات استخراج الميزات، والطبقات الخفية، وطبقة المخرجات، ودوال التنشيط. كما يتم تحديد المُحسّن، ومعدل التعلم، وحجم الدفعة، ودالة الخسارة، وعدد الدورات (epochs)، والمنتظمات، والإسقاط (dropout)، والتوقف المبكر، وجدول معدل التعلم.
  3. تحسين المعلمات الفائقة باستخدام بيانات التدريب والتحقق فقط.
  4. تسجيل البنية النهائية وتكوين المعلمات الفائقة في الجدول 3.
  5. التحقق من توافق أبعاد الإدخال والمخرجات قبل البدء في التدريب.
    ملاحظة: إنشاء نموذج ذكاء اصطناعي قابل للتفسير (XAI) مهيأ بالكامل يتضمن بنية مناسبة، ومعلمات فائقة محددة، وتقنيات قابلية للتفسير مدمجة.

6. تدريب وتحسين وحفظ نموذج الذكاء الاصطناعي القابل للتفسير (XAI)

  1. قم بتحميل مجموعات بيانات التدريب والتحقق المحددة مسبقاً وتكوين النموذج النهائي. ابدأ تشغيل النموذج باستخدام البذرة العشوائية ومعايير التدريب المحددة مسبقاً.
  2. درب النموذج باستخدام المحسِّن، ودالة الخسارة، وحجم الدفعة، ومعايير التوقف المحددة.
  3. راقب أداء التحقق واحتفظ بنقطة الفحص المقابلة لمعيار اختيار النموذج المحدد مسبقاً. قم بتقييم نقطة الفحص المختارة على مجموعة بيانات الاختبار المستقلة دون إجراء مزيد من التحسين.
  4. احفظ النموذج المدرب، وتكوين المعالجة المسبقة، والمعلمات الفائقة، والبذرة العشوائية، وسجل التدريب.
    ملاحظة: احصل على نموذج XAI محسَّن تم تدريبه والتحقق من صحته باستخدام مجموعة بيانات الرعاية الصحية المُعدة. احتفظ بالنموذج الأفضل أداءً، والمعلمات الفائقة، وسجلات التدريب، وتكوين المعالجة المسبقة، والبيئة الحوسبية لضمان إمكانية التكرار.

7. تقييم الأداء التنبؤي والحسابي

  1. تقييم الأداء التنبؤي
    1. قم بتحميل النموذج المُحسَّن ومجموعة بيانات الاختبار المستقلة بعد إتمام تدريب النموذج وتحسين المعلمات الفائقة. حافظ على ثبات معلمات النموذج المدرب ومسار المعالجة المسبقة دون تغيير أثناء الاختبار.
    2. قم بإنشاء تنبؤات لجميع العينات في مجموعة بيانات الاختبار. قارن المخرجات المتوقعة مع تسميات الحقيقة الأرضية المقابلة لها.
  2. حساب مقاييس الأداء
    1. اختر مقاييس التقييم وفقاً لنوع مهمة التنبؤ.
    2. احسب الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1-score، والدقة المتوازنة (balanced accuracy)، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) لمهام التصنيف، حسبما يتطلب الأمر. واحسب متوسط الخطأ المطلق (MAE)، وجذر متوسط مربع الخطأ (RMSE)، ومعامل التحديد (R2)، والمقاييس الأخرى ذات الصلة لمهام الانحدار، حسبما يتطلب الأمر.
  3. تقييم تعميم النموذج ومتانته
    1. قيّم النموذج باستخدام مجموعة بيانات خارجية تم جمعها بشكل مستقل عن مجموعة بيانات التطوير كلما توفرت هذه البيانات.
    2. يفضل استخدام مجموعات بيانات خارجية مصدرها مؤسسة رعاية صحية مختلفة، أو منطقة جغرافية مختلفة، أو مجموعة مرضى مختلفة لتقييم القابلية للنقل.
    3. أجرِ التحقق الزمني باستخدام بيانات جُمعت خلال فترة لاحقة عندما تتوفر مجموعات بيانات طولية.
    4. أجرِ التحقق متعدد المراكز من خلال تقييم النموذج النهائي بشكل منفصل عبر المؤسسات المشاركة عندما تتوفر بيانات متعددة المراكز.
    5. أجرِ التحقق الجغرافي باستخدام مجموعة سكانية مستقلة من منطقة جغرافية مختلفة عندما يكون ذلك ممكناً.
    6. سجّل فروق الأداء وفترات الثقة بين مجموعات بيانات التطوير والبيانات الخارجية.
  4. تقييم الأداء الحوسبي
    1. قس وقت تدريب النموذج في البيئة الحوسبية المحددة مسبقاً، ووقت الاستنتاج والاختبار في ظل ظروف حوسبية متطابقة، واستهلاك الذاكرة، وحجم النموذج، ومدى استغلال المكونات المادية.
    2. كرر القياسات الحوسبية عبر عمليات تشغيل مستقلة.
    3. احسب متوسط وقت التنفيذ للتقليل من تأثير التباين التجريبي.
  5. مقارنة أداء النموذج
    1. اختر طرق تعلم آلي تقليدية أو طرق تعلم عميق مناسبة لإجراء تقييم مقارن.
    2. قيّم نموذج XAI المقترح والنماذج المقارنة باستخدام مجموعة البيانات نفسها. طبق إجراءات المعالجة المسبقة ومقاييس التقييم المتطابقة على جميع النماذج المقارنة.
    3. أجرِ جميع التجارب المقارنة ضمن البيئة الحوسبية نفسها.
      ملاحظة: احصل على أدلة تجريبية على الاستقرار التنبؤي وقابلية التكرار في ظل الظروف الحوسبية ومجموعة البيانات المختبرة.

8. توليد مخرجات الذكاء الاصطناعي القابل للتفسير (XAI) وتقييمها

  1. توليد تفسيرات النموذج
    1. تحميل نموذج XAI المُحسّن. اختيار عينات التقييم التي لم تُستخدم في تدريب النموذج. تطبيق طرق القابلية للتفسير المحددة مسبقاً دون تعديل النموذج المُدرّب أو مسار المعالجة المسبقة.
    2. توليد تفسيرات عامة ومحلية للنموذج
      1. توليد تفسيرات عامة لتوصيف السلوك الشامل للنموذج التنبئي.
      2. توليد تفسيرات محلية لتوصيف تنبؤات النموذج الفردية.
      3. تطبيق SHAP على مجموعة بيانات Pima Indians Diabetes لتوليد تفسيرات عامة ومحلية لتنبؤات النموذج الجدولي.
      4. توليد مخطط ملخص SHAP لتصور الاتجاه العام وحجم مساهمات الميزات.
      5. توليد مخطط أهمية الميزات SHAP باستخدام متوسط قيم SHAP المطلقة لترتيب الميزات وفقاً لمساهمتها الإجمالية في تنبؤات النموذج.
      6. توليد مخطط شلال SHAP لتنبؤ ممثل من مجموعة الاختبار لتوضيح مساهمات الميزات الخاصة بالمريض.
      7. توليد مخطط اعتماد الميزات SHAP لفحص العلاقة بين ميزة مختارة ومساهمتها في مخرجات النموذج.
      8. تطبيق LIME على تنبؤات ممثلة من مجموعة الاختبار لتوليد تفسيرات محلية لتنبؤات النموذج الفردية.
      9. توليد تفسير مضاد حقيقةي (counterfactual) خاص بالمريض لتوضيح التغييرات في الميزات المرتبطة بتغيير في النتيجة المتوقعة.
      10. اختيار تقنيات إضافية للقابلية للتفسير وفقاً لنمط البيانات وبنية النموذج.
      11. استخدام Grad-CAM أو خرائط البروز (saliency maps) للنماذج القائمة على الصور المتوافقة، وتصورات الانتباه (attention visualizations) للبنيات القائمة على المحولات (transformer)، وIntegrated Gradients للنماذج القابلة للتفاضل عند الاقتضاء.
      12. التعامل مع Grad-CAM، ورسم خرائط البروز، وتصور الانتباه، وIntegrated Gradients كخيارات بروتوكول عامة تعتمد على نمط البيانات، وعدم تفسيرها أو الإبلاغ عنها كنتائج تجريبية من التحقق من مجموعة بيانات Pima Indians Diabetes ما لم يتم إجراء التحليلات المقابلة فعلياً.
    3. تطبيق طرق القابلية للتفسير على عملية التحقق من Pima
      1. تطبيق SHAP وLIME على مجموعة بيانات Pima Indians Diabetes لتوليد تفسيرات عامة ومحلية لتنبؤات النموذج الجدولي.
      2. توليد تصورات ملخص SHAP، وأهمية الميزات، والشلال، واعتماد الميزات من نتائج التحقق من Pima.
      3. توليد تفسير محلي LIME لتنبؤات ممثلة من مجموعة الاختبار.
      4. توليد تفسير مضاد حقيقةي خاص بالمريض لتوضيح التغييرات في الميزات المرتبطة بتغيير في تنبؤ النموذج.
      5. التعامل مع Grad-CAM، وتصور الانتباه، ورسم خرائط البروز، وIntegrated Gradients كخيارات قابلية للتفسير تعتمد على النمط لأنواع بيانات الرعاية الصحية وبنيات النماذج الأخرى.
      6. عدم الإبلاغ عن Grad-CAM، أو تصور الانتباه، أو رسم خرائط البروز، أو Integrated Gradients كفائدة تجريبية من التحقق العملي لـ Pima ما لم يتم إجراء التحليلات المقابلة فعلياً.
  2. تقييم جودة التفسير
    1. تقييم ما إذا كانت التفسيرات الناتجة تعكس عملية تنبؤ النموذج. تقييم استقرار التفسيرات عبر التشغيلات التجريبية المتكررة، واتساق مخرجات التفسير تحت ظروف حسابية متطابقة.
    2. تقييم حساسية مخرجات التفسير للتغيرات في بيانات الإدخال عند الاقتضاء. مقارنة التفسيرات الناتجة مع المعرفة المتوفرة في المجال أو تفسيرات الخبراء.
    3. تحديد الميزات التنبؤية أو المناطق التشريحية التي تتوافق مع المعرفة الطبية الراسخة عندما تكون هذه المقارنات متاحة.
    4. تسجيل مستوى الاتفاق أو الاختلاف بين التفسيرات الناتجة والتفسير السريري المتاح.
  3. قياس عدم اليقين في التنبؤ
    1. توليد تقديرات الثقة في التنبؤ للعينات التي تم تقييمها باستخدام طريقة لتقدير عدم اليقين مناسبة لبنية النموذج المختارة وتطبيق الرعاية الصحية.
    2. تطبيق Monte Carlo dropout، أو التنبؤ القائم على المجموعات (ensemble-based prediction)، أو الاستدلال البايزي (Bayesian inference)، أو التنبؤ المتوافق (conformal prediction)، أو أي نهج آخر معتمد لتقدير عدم اليقين عند الاقتضاء.
    3. تكرار تمريرات التنبؤ العشوائية عند استخدام Monte Carlo dropout وحساب متوسط التنبؤ وتباين التنبؤ لكل عينة تقييم.
    4. الإبلاغ عن ثقة التنبؤ أو فترات عدم اليقين جنباً إلى جنب مع تنبؤات النموذج المقابلة.
    5. تقييم ما إذا كانت تقديرات عدم اليقين تحدد التنبؤات المرتبطة بموثوقية أقل أو زيادة في خطأ التنبؤ. الحفاظ على طريقة تقدير عدم اليقين، والمعاملات، والبذور العشوائية، ومخرجات عدم اليقين الناتجة لضمان إمكانية التكرار.
  4. توثيق وحفظ مخرجات القابلية للتفسير
    1. حفظ جميع درجات أهمية الميزات الناتجة، والخرائط الحرارية، وخرائط البروز، وتصورات الانتباه، والتفسيرات الخاصة بالمريض. تخزين مخرجات القابلية للتفسير باستخدام تنسيقات ملفات معيارية. أرشفة المخرجات مع النموذج المُدرّب وتكوين المعالجة المسبقة.
    2. تسجيل الإعدادات الحسابية، ومعاملات التفسير، ووقت التنفيذ، وإصدارات البرامج المستخدمة لتوليد التفسيرات. الحفاظ على وثائق القابلية للتفسير الكاملة لتسهيل المراجعة المستقلة وإمكانية التكرار.
  5. تقييم جودة التفسير كمياً
    1. تقييم إخلاص التفسير (explanation faithfulness) من خلال إحداث اضطراب منهجي أو حجب الميزات المحددة كأهمية وقياس التغيير المقابل في مخرجات النموذج. حساب درجة إخلاص التفسير عن طريق مقارنة حجم الإسناد بالتغيير الناتج في تنبؤ النموذج.
    2. تقييم استقرار التفسير من خلال توليد تفسيرات لتشغيلات متكررة، أو مدخلات مضطربة، أو عينات متشابهة سريرياً وحساب التشابه بين أنماط الإسناد الناتجة. حساب عدم الإخلاص (infidelity) عن طريق قياس التباين بين تغيير المخرجات المتوقع والتغيير المقدر من إسناد التفسير تحت اضطرابات الإدخال الموجهة.
    3. بالنسبة لتفسيرات الصور الطبية، يتم تقييم دقة التحديد الموضعي باستخدام منطقة اهتمام محددة من قبل خبير عندما تكون التعليقات المرجعية متاحة. تقييم الفائدة السريرية من خلال الحصول على تقييمات مستقلة من خبراء سريريين مؤهلين باستخدام معايير تفسير محددة مسبقاً.
    4. حساب Cohen's kappa أو Fleiss' kappa عندما يقوم عدة خبراء بتقييم صلة التفسير أو الاتفاق بشكل مستقل.
      ملاحظة: توليد تفسيرات عامة ومحلية تصف السلوك التنبئي لنموذج الذكاء الاصطناعي المُدرّب. الحفاظ على مخرجات القابلية للتفسير والتكوينات المقابلة لضمان التفسير الشفاف والتقييم القابل للتكرار.

9. إجراء التحقق الإحصائي وتقييم إمكانية التكرار

  1. إجراء التحقق الإحصائي
    1. اختر الأساليب الإحصائية وفقاً لهدف الدراسة، والتصميم التجريبي، وتوزيع البيانات، وخصائص المتغيرات التي يتم تقييمها.
    2. سجّل المتغيرات المستمرة كمتوسط ± انحراف معياري أو كـوسيط ونطاق ربيعي، حسبما هو مناسب، والمتغيرات الفئوية كأعداد ونسب مئوية.
    3. أجرِ تحققاً تقاطعياً خماسياً (five-fold cross-validation) على مجموعة التدريب لتقييم استقرار أداء النموذج، وسجّل الدقة (accuracy)، وAUC-ROC، والدقة (precision)، والاستدعاء (recall)، وF1-score كمتوسط ± انحراف معياري عبر الطيات. قدّر فواصل ثقة 95% لمقاييس أداء مجموعة الاختبار المستقلة باستخدام 1,000 عينة إعادة سحب (bootstrap resamples).
    4. قارن النموذج المقترح مع النماذج المرجعية CNN وRandom Forest وSVM باستخدام اختبار McNemar لمقارنات الدقة المزدوجة، واختبار DeLong لمقارنات AUC-ROC المرتبطة، واختبار bootstrap المزدوج مع 1,000 عينة إعادة سحب لمقارنات F1-score.
    5. سجّل إحصائية الاختبار المقابلة والقيمة الاحتمالية (p-value) الدقيقة لكل مقارنة، واستخدم مستوى دلالة ثنائي الطرف α = 0.05.
  2. مقارنة أداء النموذج إحصائياً
    1. قارن نموذج الذكاء الاصطناعي القابل للتفسير المقترح مع النماذج المرجعية المختارة من أحدث تقنيات تعلم الآلة والتعلم العميق.
    2. طبق اختبار Student's t-test أو اختبار Mann-Whitney U عند مقارنة مجموعتين، حسبما هو مناسب. طبق تحليل التباين أحادي الاتجاه (one-way ANOVA) للمقارنات البارامترية القابلة للتطبيق التي تشمل أكثر من مجموعتين. طبق اختبار Kruskal-Wallis للمقارنات غير البارامترية القابلة للتطبيق التي تشمل أكثر من مجموعتين.
    3. اعتبر القيمة p < 0.05 ذات دلالة إحصائية، كما هو محدد في المخطوطة الأصلية.
    4. استخدم مستوى دلالة ثنائي الطرف α = 0.05 لجميع المقارنات الإحصائية المحددة مسبقاً وسجّل إحصائيات الاختبار والقيم الاحتمالية المقابلة.
    5. سجّل فواصل ثقة 95% لمقاييس أداء التنبؤ الرئيسية.
    6. استخدم إعادة سحب bootstrap لتقدير فواصل الثقة لمقاييس الأداء عند الاقتضاء. استخدم اختبار DeLong لمقارنة قيم ROC-AUC المرتبطة عندما يتم تقييم نفس الأشخاص بواسطة نموذجين. استخدم اختبار McNemar لمقارنة نتائج التصنيف الفئوية المزدوجة الناتجة عن نفس الأشخاص. استخدم إجراءات bootstrap المزدوجة لمقارنة F1-score أو مقاييس الأداء المشتقة الأخرى عند الاقتضاء.
    7. قيّم المعايرة باستخدام مخططات المعايرة، وميل/تقاطع المعايرة، ودرجة Brier عندما تتوفر التنبؤات الاحتمالية.
    8. بالنسبة للتحقق من مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset)، استخدم المقارنة الإحصائية المزدوجة المحددة مسبقاً للنموذج المقترح والنماذج المرجعية. طبق الاختبار المختار باستمرار على تنبؤات مجموعة الاختبار المزدوجة أو قياسات أداء التشغيل المتكرر، حسبما يتناسب مع المقارنة. استخدم مستوى دلالة ثنائي الطرف α = 0.05 وسجّل إحصائية الاختبار والقيمة الاحتمالية الدقيقة. لا تسجّل اختبارات إحصائية بديلة على أنها قد أجريت ما لم تُعرض نتائجها في قسم النتائج.
    9. طبق الاختبارات ثنائية الطرف وفسر الدلالة الإحصائية باستخدام عتبة محددة مسبقاً وهي p < 0.05.
  3. تقييم متانة النموذج
    1. كرر إجراء التدريب والتقييم الكامل 10 مرات باستخدام بذور عشوائية (random seeds) مختلفة مع الحفاظ على تقسيم مجموعة البيانات المحدد مسبقاً، وإجراءات المعالجة المسبقة، وبنية النموذج، والمعلمات الفائقة (hyperparameters)، وبيئة البرمجيات، وبروتوكول التقييم.
    2. سجّل AUC-ROC والدقة وF1-score لكل تشغيل مستقل وسجّل المتوسط ± الانحراف المعياري عبر التشغيلات العشرة.
    3. قارن قيم الأداء الناتجة عبر التشغيلات المتكررة لتقييم استقرار التنبؤ وقابلية التكرار تحت تهيئات عشوائية مختلفة.
  4. تقييم قابلية تكرار التفسير
    1. أنتج نسب السمات (feature attributions)، أو خرائط الانتباه (attention maps)، أو مخرجات تفسيرية أخرى عبر عمليات تجريبية متعددة عندما يتضمن التقييم قياس استقرار التفسير. قارن مخرجات التفسير كمياً عبر التشغيلات المتكررة باستخدام مقياس تشابه مناسب أو مقياس اتفاق قائم على الرتب.
    2. بالنسبة للتحقق الحالي من مجموعة بيانات سكري الهنود البيما، لا تسجّل مقاييس كمية لاستقرار التفسير ما لم تكن مخرجات التفسير والتحليلات المتكررة المقابلة قد أُجريت.
    3. قيّم الاتفاق بين التفسيرات الناتجة عن النموذج وتفسيرات السريريين عندما تتوفر التقييمات السريرية المناسبة. احسب معامل كابا لكوهين (Cohen's kappa) أو كابا لفليس (Fleiss' kappa)، حسبما هو مناسب، لتقييم الاتفاق بين المقيمين.
  5. توثيق قابلية التكرار
    1. احفظ البيانات الخام، وإجراءات المعالجة المسبقة، وكود المصدر، والنماذج المدربة، وتكوينات المعلمات الفائقة، ومخرجات القابلية للتفسير، ونصوص التحليل الإحصائي، والنتائج الناتجة.
    2. سجّل بيئة البرمجيات وتكوين الأجهزة المستخدم في سير العمل. أعد تنفيذ سير العمل الكامل بشكل مستقل باستخدام الملفات والتكوينات المؤرشفة.
    3. قارن أداء التنبؤ المكرر مع النتائج التجريبية الأصلية، وتفسيرات النموذج المكررة مع مخرجات القابلية للتفسير الأصلية.
    4. سجّل أي اختلافات لوحظت أثناء التكرار. حدث التوثيق التجريبي ليعكس ملاحظات قابلية التكرار المحددة أثناء التنفيذ المستقل.
      ملاحظة: احصل على نتائج أداء تنبؤي وقابلية تفسير متحقق منها إحصائياً يمكن تقييمها عبر التجارب المتكررة. احفظ التوثيق الحسابي والتحليلي والمنهجي الكافي لتمكين التحقق المستقل من سير العمل الكامل.
  6. قائمة مراجعة قابلية التكرار
    1. سجّل اسم مجموعة البيانات، وإصدارها، وتاريخ الحصول عليها، ومصدرها، ومعايير الاشتمال، ومعايير الاستبعاد، والعدد النهائي للعينة. سجّل جميع عمليات المعالجة المسبقة، ومعلمات التحويل، وإعدادات التسوية (normalization)، وإجراءات اختيار السمات، وقواعد تقسيم البيانات.
    2. سجّل نظام التشغيل، ووحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسوميات (GPU)، وذاكرة الوصول العشوائي (RAM)، وإصدار Python، وإصدارات أطر العمل (frameworks)، وإصدارات المكتبات. سجّل جميع مواصفات بنية النموذج والمعلمات الفائقة.
    3. سجّل المحسن (optimizer)، ومعدل التعلم، وحجم الدفعة (batch size)، وعدد الدورات (epochs)، ودالة الخسارة، والتنظيم (regularization)، ومعايير التوقف المبكر. سجّل جميع البذور العشوائية وإعدادات مولد الأرقام العشوائية.
    4. احفظ أوزان النموذج المدرب وتكوينات المعالجة المسبقة. احفظ سجلات التدريب، ونصوص التقييم، ونصوص التحليل الإحصائي، ومخرجات القابلية للتفسير. سجّل إصدارات النموذج والبرمجيات المستخدمة في التجارب النهائية.
    5. احفظ البيئة الحسابية الكاملة المطلوبة للتكرار المستقل.
    6. وثّق مدى توفر كود المصدر، ومجموعات البيانات، وأوزان النماذج، والمواد الداعمة الخاضعة للقيود الأخلاقية والقانونية والتراخيص والخصوصية.
    7. أعد تنفيذ سير العمل المؤرشف بشكل مستقل وقارن النتائج المكررة بالنتائج الأصلية.
    8. وثّق جميع متطلبات قابلية التكرار باستخدام قائمة المراجعة الموحدة.

النتائج

تم تنفيذ إطار عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) كمجموعة بيانات تمثيلية للرعاية الصحية. وقد استُخدمت مجموعة بيانات مرض السكري لدى الهنود البيما كالمجموعة الوحيدة للتحقق التجريبي، حيث تم توليد جميع النتائج التنبؤية، والنتائج المتعلقة بقابلية التفسير، والنتائج الإحصائية، ونتائج إعادة الإنتاجية من هذه المجموعة. أما المجموعات TCGA-BRCA وTCGA-UCEC وMIMIC-III وISIC 2019 وHAM10000 وOhioT1DM وBraTS 2021 فلم يتم تقييمها تجريبياً، وأُدرجت فقط كأمثلة توضح قابلية تطبيق البروتوكول العام عبر أنماط بيانات الرعاية الصحية المختلفة. وقد استُخدمت مجموعة البيانات الكاملة بعد إزالة السجلات غير الصالحة والمكررة، وإجراء عمليات المعالجة المسبقة المحددة قبل تطوير النموذج. كما قُسمت مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار باستخدام استراتيجية تقسيم طبقية محددة مسبقاً، مع الحفاظ على استقلال العينات عبر المجموعات الفرعية الثلاث لتقليل احتمالية تسرب البيانات.

تم تكوين النموذج التنبؤي باستخدام البنية والمعلمات الفائقة المحددة مسبقاً. وقد تم تدريب النموذج باستخدام مُحسِّن Adam مع معدل تعلم وحجم دفعة محددين مسبقاً لمدة تصل إلى 100 دورة تدريبية (epochs). كما طُبق نظام التوقف المبكر بناءً على خسارة التحقق، وتم الاحتفاظ بالنموذج المقابل لأفضل أداء تحقق. وبغرض تحسين إمكانية إعادة الإنتاج، تم تحديد بذور عشوائية لتقسيم مجموعة البيانات، وتهيئ النموذج، والتجارب المكررة.

تم تقييم النموذج المدرب على مجموعة اختبار مستقلة باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1 (F1-score)، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، والمتوسط الدقيق (AP). تمت مقارنة النموذج المقترح مع نماذج أساسية محددة مسبقاً باستخدام إجراءات معالجة مسبقة، وتقسيمات بيانات، وبروتوكولات تقييم متطابقة. كما تم إنشاء منحنيات خصائص تشغيل المستقبل (ROC)، ومنحنيات الضبط والاستدعاء، ومصفوفة ارتباك بناءً على تنبؤات مجموعة الاختبار المستقلة.

تم إجراء تحقق تقاطعي خماسي الطيات على بيانات التدريب لتقييم استقرار الأداء. كما تم تقدير فترات ثقة بنسبة 95% لمقاييس الأداء الرئيسية، وأجريت مقارنات إحصائية محددة مسبقاً بين النموذج المقترح والنماذج المرجعية.

أنتج التحقق المتقاطع خماسي الطيات دقة بلغت 93.01 ± 0.48%، ومنحنى خصائص عامل التشغيل للمستقبل (AUC-ROC) بمقدار 0.954 ± 0.007، ودقة تنبؤ (precision) بلغت 92.42 ± 0.87%، واسترجاعاً (recall) بنسبة 93.02 ± 0.45%، ومقياس F1-score بنسبة 92.72 ± 0.62%. وكانت فواصل الثقة بطريقة bootstrap بنسبة 95% المقدرة من 1,000 عينة متكررة هي 0.897–0.973 للدقة، و0.890–0.970 لدقة التنبؤ، و0.880–0.963 للاسترجاع، و0.887–0.965 لمقياس F1-score، و0.931–0.984 لـ AUC-ROC. أُجريت المقارنات الإحصائية مع النماذج المرجعية للشبكات العصبية التلافيفية (CNN)، والغابة العشوائية (Random Forest)، وآلات ناقل الدعم (SVM) باستخدام اختبار McNemar للدقة، واختبار DeLong لـ AUC-ROC، واختبار bootstrap المزدوج مع 1,000 عينة متكررة لمقياس F1-score.

تم تكرار إجراء التدريب والتقييم الكامل عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة. وأسفرت عمليات التشغيل المكررة عن AUC-ROC بلغت 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، ودرجة F1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبياً عبر عمليات التنفيذ المكررة. وتم تلخيص مقاييس الأداء التي تم الحصول عليها عبر عمليات التنفيذ المكررة باستخدام المتوسط والانحراف المعياري. كما تم فحص التباين عبر عمليات التشغيل لتحديد ما إذا كان أداء التنبؤ ظل مستقراً تحت التنفيذ المكرر.

لم يتم إجراء التحقق الخارجي في هذا المثال العملي نظراً لعدم استخدام مجموعة بيانات خارجية مستقلة. وبناءً على ذلك، فإن جميع النتائج التنبؤية والإحصائية ونتائج قابلية التكرار المذكورة تم الحصول عليها من مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) باستخدام أقسام التدريب والتحقق والاختبار المستقل المحددة مسبقاً. وقد تم الإبقاء على التحقق الخارجي في البروتوكول كإجراء اختياري للتطبيقات التي تتوفر فيها مجموعة بيانات مستقلة من مؤسسة أو مجموعة سكانية أو منطقة جغرافية أو فترة زمنية مختلفة.

تم إنشاء تفسيرات النماذج باستخدام تقنيات القابلية للتفسير القابلة للتطبيق على مجموعة بيانات السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) الجدولية، بما في ذلك SHAP وLIME. تم تقييم أهمية الميزات العالمية، كما تم إنشاء تفسيرات محلية خاصة بكل مريض باستخدام عينات الاختبار المستبعدة. وقد سُجلت مخرجات التفسير جنباً إلى جنب مع تنبؤات النموذج وقيم الميزات المقابلة لها لتسهيل إعادة الإنتاج والتفسير اللاحق.

لأغراض الوضوح، اشتمل المثال العملي الحالي على المراحل التسع الأساسية لسير العمل المحددة في الجدول 1. وقد تم الإبقاء على التحقق الخارجي وتقييم الخبراء السريريين كـوحدات تحقق اختيارية ضمن البروتوكول العام. لم يتم إجراء التحقق الخارجي لعدم استخدام أي مجموعة بيانات خارجية مستقلة، كما لم يتم إجراء تقييم الخبراء السريريين لعدم إشراك لجنة رسمية لتقييم الخبراء في هذا المثال العملي الحالي. وبناءً على ذلك، لا تُعتبر هذه الوحدات الاختيارية جزءًا من سير العمل التجريبي المكون من تسع مراحل، ولا يتم الإبلاغ عنها كـنتائج تجريبية.

أنتجت إجراءات المعالجة المسبقة وتقسيم مجموعة البيانات مجموعة بيانات موحدة مناسبة لتطوير النموذج. حيث تمت إزالة السجلات المكررة وغير المتسقة، ومعالجة القيم المفقودة وفقاً للاستراتيجية المحددة مسبقاً، وتوحيد الميزات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار. وتلخص Table 2 خصائص مجموعة البيانات الناتجة وإجراءات المعالجة المسبقة. ويوضح Figure 2 سير عمل تحضير ومعالجة مجموعة بيانات الرعاية الصحية العامة، بينما يوضح Figure 3 سير عمل التحضير التجريبي والمعالجة المسبقة والتقسيم وتقييم الجودة المطبق خصيصاً على Pima Indians Diabetes Dataset. كما تلخص Table 3 البيئة الحسابية النهائية وبنية النموذج وتكوين المعلمات الفائقة المستخدمة لإنتاج النتائج المسجلة.

أدى تنفيذ القسمين 3 و4 إلى الحصول على مجموعة بيانات رعاية صحية موحدة ومناسبة لتطوير النموذج. وقد عملت إجراءات المعالجة المسبقة على إزالة السجلات المكررة وغير المتسقة، واستكمال القيم المفقودة، وتوحيد الميزات العددية، وتشفير المتغيرات الفئوية حيثما كان ذلك مناسباً، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار. وفرت البيانات الناتجة المدخلات الموحدة المطلوبة لتطوير النموذج لاحقاً.

بعد الانتهاء من القسمين 5 و6، أظهر النموذج الذي تم تكوينه تقارباً مستقراً أثناء التدريب. وقد أظهرت منحنيات التعلم انخفاضاً متزامناً في خسائر التدريب والتحقق، وزيادة في دقة التدريب والتحقق. كما أدى تحسين المعلمات الفائقة إلى تحسين تعميم النموذج، دون وجود دليل على حدوث فرط تخصيص جوهري. ولدعم قابلية التكرار، تم أرشفة النموذج المحسن جنباً إلى جنب مع البنية النهائية، وإعدادات المعلمات الفائقة، وإصدارات البرامج، والبذور العشوائية، وأوزان النموذج المدرب. وتلخص الجدول 4 مواصفات تدريب النموذج ونتائج التحسين، بينما تُعرض منحنيات تعلم التدريب والتحقق المقابلة في الشكل 4.

قيم القسم 7 الأداء التنبئي للنموذج باستخدام مقاييس أداء معيارية. وشملت مقاييس التصنيف التي تم تقييمها كلًا من الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، ومتوسط الدقة (AP). وتمت مقارنة النموذج المقترح بنماذج الأساس المحددة مسبقًا باستخدام نفس تقسيمات مجموعة البيانات، وإجراءات المعالجة المسبقة، وبروتوكول التقييم. ويظهر مقارنة الأداء التنبئي في الجدول 5، بينما تظهر منحنيات ROC، ومنحنيات الضبط والاستدعاء، ومصفوفة الارتباك، ومقاييس الأداء المقارنة في الشكل 5.

بعد القسم 8، تم إنشاء تفسيرات شاملة ومحلية لتنبؤات النموذج لتقييم مدى قابليته للتفسير. تم إنشاء تفسيرات النموذج باستخدام SHAP و LIME لمجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) الجدولية، كما تم تقديم تفسير مضاد للواقع خاص بمريض معين لتوضيح التغيير في التنبؤ. استُخدم SHAP لإنشاء تصورات لأهمية الميزات الشاملة، ومخططات الشلال الخاصة بكل مريض، وتصورات الاعتماد على الميزات، بينما استُخدم LIME لإنشاء تفسيرات محلية من عينات الاختبار المستبقاة. وتظهر مخرجات القابلية للتفسير المقابلة في الشكل 6.

قيمت المرحلة النهائية من البروتوكول الموثوقية الإحصائية وقابلية تكرار سير العمل. حيث تم تكرار سير العمل الكامل عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة، مع الحفاظ على نفس استراتيجية تقسيم مجموعة البيانات، ومعاملات المعالجة المسبقة، وبنية النموذج، والمعاملات الفائقة، وبيئة البرمجيات، وإجراءات التقييم. وقد أسفرت عمليات التشغيل المكررة عن AUC-ROC بقيمة 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، وF1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبيًا عبر عمليات التنفيذ المكررة.

لم يتم تقييم استقرار التفسيرات كمياً في عملية التحقق الحالية. وبالرغم من توليد تفسيرات SHAP وLIME لمجموعة بيانات Pima Indians Diabetes، إلا أنه لم يتم إجراء تحليل منفصل لارتباط الرتب بين التشغيلات أو تحليل تداخل الميزات. وبناءً على ذلك، لم يتم تسجيل أي مقاييس عددية للتفسير أو الاستقرار أو اتفاقية الإسناد. وقد تم الإبقاء على التقييم الكمي لاستقرار التفسير في البروتوكول العام كإجراء اختياري لإعادة الإنتاجية في التطبيقات التي تتوفر فيها مخرجات تفسيرية متكررة.

تم تقييم المقارنات الإحصائية باستخدام عتبة دلالة محددة مسبقًا بقيمة p < 0.05. استُخدمت الاختبارات الإحصائية ثنائية الطرف حيثما كان ذلك مناسبًا، وتم تسجيل إحصائيات الاختبار المقابلة، وقيم p، وفترات الثقة 95% لتحديد الدلالة الإحصائية ومدى عدم اليقين في فروق الأداء الملحوظة. وتلخص الجدول 6 نتائج التحقق الإحصائي التجريبي وقابلية التكرار، بما في ذلك أداء التحقق المتقاطع، وفترات الثقة، والمقارنات الإحصائية، وتباين التشغيل المتكرر. كما تظهر التحليلات المقابلة للاختبارات الإحصائية وقابلية التكرار في الشكل 7.

قدمت هذه النتائج دليلاً تجريبياً على الاستقرار التنبؤي وقابلية التكرار في ظل الظروف الحسابية ومجموعة البيانات التي تم اختبارها. وقد تم توثيق البيئة الحسابية، وخصائص مجموعة البيانات، وإجراءات المعالجة المسبقة، وتكوين النموذج، والتحليلات الإحصائية، وإعدادات القابلية للتفسير المطلوبة لإعادة التكرار المستقل وفقاً لقائمة مراجعة قابلية التكرار الموضحة في الجدول 7. لم يتم إجراء تقييم من قبل خبراء سريريين لمخرجات الذكاء الاصطناعي القابل للتفسير (XAI) في مثال التحقق التطبيقي في هذا العمل.

بشكل عام، أدى تطبيق البروتوكول إلى إنتاج مجموعة بيانات رعاية صحية موحدة مناسبة لتطوير نماذج الذكاء الاصطناعي، ونموذج مُحسَّن باستخدام إعدادات مُحددة مسبقاً للمعلمات الفائقة. وقد أتاح سير العمل هذا تقييماً منهجياً للأداء التنبؤي، وتوليد تفسيرات للنموذج باستخدام تقنيات الذكاء الاصطناعي القابل للتفسير (XAI) المناسبة، بالإضافة إلى التقييم الإحصائي لمتانة النموذج وقابلية تكراره. وقد أثبتت النتائج مجتمعةً إمكانية تنفيذ وقابلية تكرار سير عمل XAI المقترح في ظل الظروف التجريبية التي تم تقييمها في مثال التحقق التطبيقي.

figure-results-1
الشكل 1: سير العمل الأساسي المكون من تسع مراحل لتطوير نماذج ذكاء اصطناعي قابلة للتكرار والتفسير في مجال الرعاية الصحية. يتكون سير العمل من (1) تحديد مهمة التنبؤ في الرعاية الصحية، (2) تهيئة البيئة الحوسبية، (3) الحصول على مجموعة البيانات والتحقق من صحتها، (4) المعالجة المسبقة للبيانات، (5) تقسيم مجموعة البيانات، (6) تدريب النموذج التنبؤي، (7) تقييم الأداء التنبؤي، (8) تحليل القابلية للتفسير، و (9) التحقق الإحصائي وتقييم القابلية للتكرار. يُعتبر التحقق الخارجي وتقييم الخبراء السريريين امتدادات اختيارية للبروتوكول ولا يتم تضمينهما في سير العمل الأساسي المكون من تسع مراحل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-2
الشكل 2: سير عمل إعداد ومعالجة مسبقة لمجموعة بيانات الرعاية الصحية. (أ) اكتساب بيانات الرعاية الصحية من السجلات السريرية، والتصوير الطبي، والإشارات الفسيولوجية، ومصادر البيانات متعددة الوسائط. (ب) تكامل البيانات والمعالجة المسبقة، بما في ذلك التعامل مع القيم المفقودة، والتطبيع، وإزالة الضجيج، والتعزيز. (ج) تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب، والتحقق، والاختبار. (د) تقييم الجودة الذي يوضح توزيع الفئات، وتطبيع الميزات، ومخرجات المعالجة المسبقة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 3: سير العمل التجريبي لتحضير مجموعة بيانات سكري الهنود البيما ومعالجتها مسبقاً وتقسيمها وتقييم جودتها. يتضمن سير العمل الحصول على مجموعة البيانات، وتقييم جودة البيانات، ومعالجة القيم غير الصالحة والمفقودة، وتوحيد الميزات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار المستقل، والتحقق النهائي من الجودة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 4: منحنيات تعلم التدريب والتحقق التجريبية للنموذج المقترح باستخدام مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset). (أ) فقدان التدريب والتحقق عبر فترة التدريب الكاملة. (ب) دقة التدريب والتحقق عبر فترة التدريب الكاملة. (ج) عرض مكبّر للفقدان خلال الدورات من 50 إلى 100. (د) عرض مكبّر للدقة خلال الدورات من 50 إلى 100. تم الحصول على أفضل أداء تحقق عند الدورة 78، حيث بلغ فقدان التحقق 0.142 ودقة التحقق 94.6%. تم تفعيل التوقف المبكر عند الدورة 88 باستخدام فترة صبر (patience) قدرها 10 دورات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-5
الشكل 5: التقييم التجريبي لأداء التنبؤ لإطار عمل XAI المقترح باستخدام مجموعة اختبار مستقلة (n = 154). (أ) منحنى خصائص تشغيل المستقبل (ROC) الذي يوضح أداء التمييز لنموذج XAI المقترح والنماذج المرجعية. (ب) منحنيات الدقة والاسترجاع (PR) التي توضح أداء الدقة والاسترجاع لنموذج XAI المقترح والنماذج المرجعية. (ج) مصفوفة الارتباك لنموذج XAI المقترح على مجموعة الاختبار المستقلة، مع الدقة والحساسية (الاسترجاع) والخصوصية المقابلة. (د) مقارنة بين الدقة، والضبط، والاسترجاع، والخصوصية، ودرجة F1-score، ومعامل ارتباط Matthews (MCC)، والمساحة تحت منحنى ROC (AUC)، ومتوسط الدقة (AP) عبر النماذج التي تم تقييمها. جميع النتائج الكمية الموضحة في هذا الشكل تعود إلى تجربة التحقق من مجموعة بيانات Pima Indians Diabetes. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-6
الشكل 6: مخرجات القابلية للتفسير الناتجة عن تنبؤات مجموعة اختبار مستقلة للنموذج المقترح المدرب على مجموعة بيانات Pima Indians Diabetes. (A) مخطط ملخص SHAP العام الذي يوضح توزيع مساهمات الميزات عبر مجموعة الاختبار. (B) مخطط أهمية الميزات SHAP استناداً إلى متوسط قيم SHAP المطلقة. (C) مخطط SHAP الشلالي الخاص بمريض معين يوضح مساهمات الميزات الفردية في احتمالية الإصابة بالسكري المتوقعة. (D) تفسير LIME المحلي الذي يوضح مساهمات الميزات للمريض رقم 125 في مجموعة الاختبار. (E) مخطط اعتماد SHAP الذي يوضح العلاقة بين قيم الجلوكوز ومساهماتها في SHAP. (F) تفسير مضاد للواقع خاص بمريض معين يوضح الحد الأدنى من التغييرات في الميزات المرتبطة بتغيير في تنبؤ النموذج. الاختصارات: SHAP = Shapley Additive exPlanations؛ LIME = Local Interpretable Model-agnostic Explanations. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-7
الشكل 7: التحقق الإحصائي التجريبي وتحليل قابلية التكرار للنموذج المقترح باستخدام مجموعة بيانات السكري لدى الهنود البيما (Pima Indians Diabetes Dataset). (أ) أداء التحقق المتبادل خماسي الطيات (Five-fold cross-validation) على مجموعة التدريب. (ب) فترات الثقة بنسبة 95% بطريقة bootstrap لأداء مجموعة الاختبار المستقلة. (ج) المقارنات الإحصائية مع النماذج المرجعية، بما في ذلك الاختبار الإحصائي، وإحصائية الاختبار، والقيمة الاحتمالية (p-value)، والدلالة الإحصائية. (د) اتساق الأداء عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة. استُخدم اختبار McNemar لدقة التصنيف المقترنة، واختبار DeLong لمنحنى ROC-AUC المرتبط، واختبار bootstrap المقترن مع 1,000 إعادة أخذ عينات لمقارنة مقياس F1-score. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

المرحلةنشاط البروتوكولالمخرجات المتوقعةحالة التنفيذ
1اختيار والتحقق من صحة مجموعة بيانات الرعاية الصحيةمجموعة بيانات تم التحقق منها، وهدف التنبؤ، وتوزيع الفئات، ومعلومات جودة البياناتتم التنفيذ
2تهيئة البيئة الحسابيةالأجهزة والبرمجيات والمكتبات والإصدارات والتكوين الحسابي التي تم التحقق منهاتم التنفيذ
3المعالجة المسبقة ومراقبة جودة بيانات الرعاية الصحيةمجموعة بيانات منقحة ومحولة وموحدةتم التنفيذ
4تقسيم مجموعة البياناتمجموعات بيانات مستقلة للتدريب والتحقق والاختبارتم التنفيذ
5تطوير وتحسين نموذج التنبؤ/الذكاء الاصطناعي القابل للتفسير (XAI)بنية النموذج النهائية والمعاملات الفائقةتم التنفيذ
6تدريب النموذج وحفظهالنموذج المدرب، ونقطة التحقق، وتكوين التدريب، والسجلاتتم التنفيذ
7تقييم الأداء التنبؤي والحسابيمقاييس أداء مجموعة الاختبار ومقارنات الأداءتم التنفيذ
8توليد وتقييم مخرجات قابلية التفسيرمخرجات SHAP/LIME ومخرجات التفسير المناسبةتم التنفيذ
9إجراء التحقق الإحصائي وتقييم قابلية التكرارفترات الثقة، والاختبارات الإحصائية، ونتائج التشغيل المتكرر، ومقاييس قابلية التكرارتم التنفيذ

الجدول 1: ملخص لسير عمل البروتوكول الأساسي المكون من تسع مراحل والمطبق في عملية التحقق العملية باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما. يميز الجدول بين المراحل التسع المنفذة في المثال العملي لمجموعة بيانات مرض السكري لدى الهنود البيما وبين التحقق الخارجي وتقييم الخبراء السريريين، واللذين تم الإبقاء عليهما كمكونات اختيارية في البروتوكول العام.

مجموعة البياناتمصدر البياناتالتطبيق السريرينمط البياناتالمشاركون/السجلاتالعيناتالفئاتتوزيع الفئاتتدريب/تحقق/اختبارالدور في الدراسة الحاليةحالة التحققرابط المصدر
مجموعة بيانات مرض السكري لدى هنود بِيمامستودع جامعة كاليفورنيا إيرواين لتعلم الآلةالتنبؤ بمرض السكريجدول سريري٧٦٨ سجلاً7682500 غير مصابين بداء السكري؛ 268 مصابين بداء السكري60% / 20% / 20%مجموعة بيانات التحقق التجريبي الأوليةتم التنفيذ – استكمال سير العمل الأساسي المكون من تسع مراحلhttps://archive.ics.uci.edu/dataset/34/pima+indians+diabetes
TCGA-BRCAمركز البيانات الجينومية (GDC) التابع للمعهد الوطني للسرطان (NCI)، مشروع أطلس جينوم السرطان لسرطان الثدي (TCGA-BRCA)تصنيف سرطان الثديالسريري + علم الأمراض النسيجي١,٠٩٨ حالةتعتمد على مجموعة البيانات وفقاً لنوع البياناتمعتمد على نقطة النهايةلا يوجد توزيع فئوي موحد على نطاق مجموعة البيانات بأكملهاغير قابل للتطبيق - لم يتم إجراء تقسيم تجريبيمثال على قابلية تطبيق البروتوكول فقطلم يُستخدم للتحقق التجريبيhttps://portal.gdc.cancer.gov/projects/TCGA-BRCA
TCGA-UCECمركز البيانات الجينومية المشترك (GDC) التابع للمعهد الوطني للسرطان (NCI)، مشروع أطلس جينوم السرطان (TCGA) لسرطان بطانة الرحم (UCEC)تصنيف سرطان بطانة الرحمالسريرية + التشريح المرضي النسيجيمجموعة المشروع؛ يعتمد الحجم على نوع البيانات وعوامل التصفية المختارةتعتمد مجموعة البيانات على نوع البياناتمعتمد على نقطة النهايةلا يوجد توزيع فئوي موحد على مستوى مجموعة البيانات بأكملهاغير قابل للتطبيق - لم يتم إجراء تقسيم تجريبيمثال على قابلية تطبيق البروتوكول فقطغير مُستخدم للتحقق التجريبيhttps://portal.gdc.cancer.gov/projects/TCGA-UCEC
MIMIC-IIIPhysioNet، قاعدة البيانات السريرية MIMIC-III الإصدار 1.4التنبؤ بالنتائج السريريةالسلاسل الزمنية السريرية٤٦,٥٢٠ مريضاً٥٨,٩٧٦ حالة دخول إلى وحدة العناية المركزةيعتمد على المهمةلا يوجد توزيع فئوي موحد على مستوى قاعدة البيانات بأكملهاغير قابل للتطبيق – لم يتم إجراء تقسيم تجريبيمثال على قابلية تطبيق البروتوكول فقطغير مُستخدم للتحقق التجريبيhttps://physionet.org/content/mimiciii/1.4/
ISIC 2019تحدي التعاون الدولي لتصوير الجلد (ISIC)تصنيف الآفات الجلديةصور التنظير الجلديغير قابل للتطبيق – مجموعة بيانات صور٢٥,٣٣١ صورة تدريبية8 فئات تدريبيةAKIEC 867؛ BCC 3,323؛ BKL 2,624؛ DF 239؛ MEL 4,522؛ NV 12,875؛ VASC 253؛ SCC 628غير قابل للتطبيق - لم يتم إجراء تقسيم تجريبيمثال على قابلية تطبيق البروتوكول فقطغير مُستخدم للتحقق التجريبيhttps://challenge.isic-archive.com/landing/2019/
HAM10000Harvard Dataverse / أرشيف ISICتصنيف الآفات الجلديةالصور الجلدية التشخيصية7,470 آفة فريدة١٠,٠١٥ صورة7AKIEC 327؛ BCC 514؛ BKL 1,099؛ DF 115؛ MEL 1,113؛ NV 6,705؛ VASC 142غير ينطبق – لم يتم إجراء تقسيم تجريبيمثال على قابلية تطبيق البروتوكول فقطلم يُستخدم للتحقق التجريبيتوصيف وتحديد الخصائص المورفولوجية والوظيفية لشبكة الأوعية الدموية في النماذج المعتمدة على الخلايا الجذعية البشرية المستحثة متعددة القدرات (hiPSC) باستخدام التصوير المقطعي المحوسب بدقة ميكرونية (micro-CT) والتلوين المناعي الكيميائي النسيجي (IHC)
OhioT1DMمجموعة بيانات OhioT1DM، الموزعة علنًا لأغراض البحثمراقبة/التنبؤ بمرض السكريالسلاسل الزمنية السريرية١٢ مشاركاً٢٤ ملف XML موزعة عبر بيانات التدريب والتطوير والاختبارالتنبؤ المستمر بـمستوى الغلوكوز؛ وليست مهمة تصنيف ثابتةغير قابل للتطبيقملفات التدريب والتطوير والاختبار المحددة بواسطة مجموعة البيانات؛ لم يتم إجراء تقسيم تجريبي هنامثال على قابلية تطبيق البروتوكول فقطلم يُستخدم للتحقق التجريبي**توصيف الخصائص المورفولوجية والوظيفية والمناعية للخلايا الجذعية الميزنكيمية المشتقة من النخاع العظمي في الأغنام** **الملخص** تُظهر الخلايا الجذعية الميزنكيمية (MSCs) قدرة على التمايز إلى سلالات خلوية متعددة، مما يجعلها واعدة في تطبيقات الطب التجديدي. تهدف هذه الدراسة إلى عزل وتوصيف الخلايا الجذعية الميزنكيمية المشتقة من النخاع العظمي (BMSCs) في الأغنام (*Ovis aries*) من حيث المورفولوجيا، والقدرة على التمايز، والتعبير عن المؤشرات المناعية، وذلك لضمان فعاليتها في الاستخدامات العلاجية المستقبلية. تم عزل الخلايا من النخاع العظمي لعظم الفخذ في أغنام صحية، وتم استنباتها في وسط نمو مناسب. أظهرت الخلايا المستخلصة شكلاً مغزلياً نموذجياً والتصاقاً بسطح زراعة الخلايا. تم التحقق من القدرة على التمايز من خلال تحفيز الخلايا للتمايز إلى خلايا عظمية (osteoblasts)، وخلايا غضروفية (chondrocytes)، وخلايا دهنية (adipocytes)، حيث تم تأكيد ذلك باستخدام صبغات Alizarin Red S، و Alcian Blue، و Oil Red O على التوالي. أما من الناحية المناعية، فقد تم تحليل التعبير عن البروتينات السطحية باستخدام تقنية التدفق الخلوي (flow cytometry)، حيث أظهرت الخلايا تعبيراً إيجابياً للمؤشرات CD90 و CD105 و CD73، بينما كانت سلبية للمؤشرات CD45 و CD34. تشير هذه النتائج إلى أن الخلايا المعزولة تمتلك الخصائص الجوهرية للخلايا الجذعية الميزنكيمية، مما يجعلها نموذجاً مناسباً للدراسات المتعلقة بتجديد الأنسجة في الأغنام. **الكلمات المفتاحية:** الخلايا الجذعية الميزنكيمية، النخاع العظمي، الأغنام، التمايز الخلوي، الواسمات المناعية، الطب التجديدي.
BraTS 2021RSNA-ASNR-MICCAI BraTS 2021؛ CBICA/جامعة بنسلفانياتقسيم/تصنيف أورام الدماغالتصوير بالرنين المغناطيسي٢٠٤٠ حالة في مجموعة التحدي1,251 حالة تدريبية مشروحة؛ أربعة أنماط تصوير بالرنين المغناطيسي لكل حالةمعتمد على المهمةلا يوجد توزيع فئوي موحد على نطاق مجموعة البيانات بأكملهامجموعات محددة بناءً على التحدي؛ لم يتم إجراء تقسيم تجريبي هنامثال على قابلية تطبيق البروتوكول فقطلم يُستخدم للتحقق التجريبيhttps://www.med.upenn.edu/cbica/brats2021/

الجدول 2: خصائص مجموعة بيانات الرعاية الصحية وقابلية تطبيق البروتوكول المقترح. يلخص الجدول مصادر البيانات، والتطبيقات السريرية، والوسائط، وخصائص العينات، وتوزيعات الفئات، واستراتيجيات تقسيم مجموعة البيانات، وحالة التحقق، ومعلومات المصدر لمجموعات بيانات الرعاية الصحية التي تم النظر فيها في البروتوكول. وتعمل مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) كمثال عملي أساسي للتحقق من صحة البروتوكول.

بند التكوينإعدادات التحقق من الصحة الفعلية المُطبقةالحالة / التفسير
مجموعة البياناتPima Indians Diabetes Datasetمجموعة بيانات التحقق التجريبي الفعلية
الخوارزمية / النموذجنموذج تنبؤي جدولي للتصنيف الثنائي لمرض السكرياستخدم اسم البنية الدقيق من سجل التجربة إذا كان موثقًا بشكل منفصل
معدل التعلم0.001إعداد تجريبي
المحسن (Optimizer)Adamإعداد تجريبي
حجم الدفعة (Batch Size)32إعداد تجريبي
الحد الأقصى للعصور (Epochs)100إعداد تجريبي
دالة الخسارةCross-Entropyإعداد تجريبي
دالة التنشيطReLUإعداد تجريبي
الإسقاط (Dropout)0.5إعداد تجريبي
اضمحلال الوزن (Weight Decay)1e-4إعداد تجريبي
تطبيع الدفعات (Batch Normalization)مُمكّنإعداد تجريبي
تعزيز البيانات / موازنة الفئاتمُمكّنحدد SMOTE فقط إذا تم تطبيقه بالفعل في التشغيل المذكور
استراتيجية التحققالتحقق المتقاطع خماسي الطيات (5-fold cross-validation)إعداد تجريبي
التوقف المبكرالصبر = 10 عصور (epochs)إعداد تجريبي
البذرة العشوائية42استخدم تكوين البذرة الدقيق المسجل للتجربة
التشغيلات المكررة10 تشغيلات مستقلة باستخدام بذور عشوائية مختلفةتحليل قابلية إعادة الإنتاج التجريبي
حجم الصورة المدخلةغير ينطبقمجموعة بيانات Pima جدولية
أبعاد الميزات512يُستخدم فقط إذا كان هذا هو تمثيل الميزات النهائي المطبق
قابلية التفسيرSHAP + LIME؛ التفسير المضاد للواقع موضح في الشكل 6تحليل الذكاء الاصطناعي القابل للتفسير (XAI) الفعلي المذكور
مقاييس التقييمالدقة (Accuracy)، الدقة التحديدية (precision)، الاستدعاء (recall)، النوعية (specificity)، مقياس F1-score، معامل ارتباط ماتيوس (MCC)، المساحة تحت منحنى خصائص التشغيل (AUC-ROC)، متوسط الدقة (AP)مقاييس التقييم التجريبية المذكورة
الأجهزةNVIDIA GPUاستبدل بـ موديل GPU الدقيق إذا كان مسجلاً
البرمجيات / إطار العملPython 3.11; Scikit-learn; مكونات إطار العمل المستخدمة في التنفيذاستخدم إصدارات الحزم الدقيقة إذا كانت مسجلة

الجدول 3: البيئة الحسابية، وبنية النموذج، وتكوين المعلمات الفائقة المستخدمة في تنفيذ البروتوكول. يحدد الجدول المنصة الحسابية، وبيئة البرمجيات، وبنية النموذج، وتكوين المدخلات، ومعلمات التحسين، وإعدادات التنظيم، ومعلمات قابلية التكرار المستخدمة لتنفيذ سير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح.

المَعلَمالمواصفات أو النتيجة النموذجية
المُحسِّنAdam
معدل التعلم0.001
حجم الدفعة32
الحد الأقصى لعدد الحلقات (epochs)100
صبر التوقف المبكر10 epochs
أفضل حلقة78
حلقة التوقف المبكر88
أفضل فقدان للتحقق0.142
أفضل دقة تحقق94.6%
مخرجات التدريبانخفض فقدان التدريب والتحقق ثم تقاربا
مخرجات التحققزادت دقة التدريب والتحقق ثم استقرت
نتيجة التحسينتم تحقيق أفضل أداء للنموذج عند الحلقة 78
التحكم في الإفراط في التخصيص (Overfitting)منع التوقف المبكر أي تحسين إضافي بعد أفضل حلقة مختارة

الجدول 4: مواصفات تدريب النموذج ونتائج التحسين. يلخص الجدول المُحسن، ومعدل التعلم، وحجم الدفعة، والحد الأقصى لمرات التدريب (epochs)، وأداء التحقق، وتقارب التدريب، ونتيجة التحسين، واستراتيجية التحكم في الإفراط في التخصيص (overfitting) المستخدمة أثناء تطوير النموذج.

نموذجالدقة (%)الدقة (%)الاستدعاء (%)النوعية (%)مقياس F1 (%)MCCالمساحة تحت المنحنى (منحنى خصائص تشغيل المستقبل)البروتياز A (PR)
نموذج الذكاء الاصطناعي القابل للتفسير (XAI) المقترح93.594.592.494.693.40.870.960.94
التعلم العميق (الشبكات العصبونية الالتفافية)89.189.888.19088.90.780.920.9
الغابة العشوائية84.38583.285.784.10.670.860.81
آلة متجه الدعم (SVM)78.679.377.18078.20.540.790.72
الخط المرجعي (الفئة الغالبة)62.162.1100076.600.50.5

الجدول 5: مقارنة أداء التنبؤ للنماذج التي تم تقييمها. يقارن الجدول نموذج XAI المقترح مع النماذج المرجعية التي تم تقييمها باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (Matthews correlation coefficient)، والمساحة تحت منحنى خصائص التشغيل للمستقبل (area under the receiver operating characteristic curve)، ومتوسط الضبط (average precision).

تحليل التحقق من الصلاحيةمقارنة / مقياسالاختبار الإحصائيإحصائية الاختبارpالقيمة الاحتمالية (p-value)النتيجة التجريبية / فاصل ثقة 95%
التحقق المتقاطع خماسي الطياتالدقةوصفي (متوسط ± الانحراف المعياري (SD)93.01 ± 0.48%
التحقق المتقاطع خماسي الطياتالمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)وصفي (المتوسط ± انحراف معياري)0.954 ± 0.007
التحقق المتقاطع خماسي الطياتالدقةوصفي (متوسط ± انحراف معياري (SD)92.42 ± 0.87%
التحقق المتقاطع خماسي الطياتالاسترجاعوصفية (المتوسط ± الانحراف المعياري (SD)93.02 ± 0.45%
التحقق المتقاطع خماسي الطياتمقياس F1وصفي (المتوسط ± انحراف معياري)92.72 ± 0.62%
فاصل ثقة بوتستراب بنسبة 95%الدقةإعادة التعيين العشوائي (1,000 عينة معاد سحبها)0.935 [0.897, 0.973]
فترة ثقة تعميمية بنسبة 95%الدقةإعادة أخذ العينات بطريقة بوتستراب (1,000 عينة مكررة)0.930 [0.890, 0.970]
فاصل ثقة بوتستراب بنسبة 95%استرجاعطريقة بوتستراب (1,000 عينة مُعادة السحب)0.922 [0.880, 0.963]
فاصل ثقة بوتستراب بنسبة 95%مقياس F1 (F1-score)إعادة التعيين العشوائي (١,٠٠٠ عينة مكررة)0.926 [0.887, 0.965]
فاصل ثقة التمهيد بنسبة 95%المساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC)إعادة التعيين العشوائي (1,000 عينة مكررة)0.958 [0.931, 0.984]
النموذج المقترح مقابل الشبكة العصبونية التلافيفية (CNN)الدقة (%)اختبار ماكنيمار9.320.0023جوهري (α = 0.05)
النموذج المقترح مقابل الشبكة العصبية التلافيفية (CNN)المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)اختبار ديلونج (DeLong's test)3.870.0001جوهري (α = 0.05)
النموذج المقترح مقابل الشبكة العصبونية التلافيفية (CNN)مقياس F1 (F1-score)بوتستراب مزدوج (1,000 عينة مُعاد سحبها)2.810.0044كبير (α = 0.05)
النموذج المقترح مقابل الغابة العشوائيةالدقة (%)اختبار مكنيمار14.270.0002جوهري (α = 0.05)
النموذج المقترح مقابل الغابة العشوائيةالمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)اختبار ديلونج (DeLong's test)5.86<0.0001هام (α = 0.05)
النموذج المقترح مقابل الغابة العشوائيةمقياس F1تمهيد بوتستراب المزدوج (1,000 إعادة أخذ عينات)4.030.0003جوهري (α = 0.05)
النموذج المقترح مقابل آلة المتجهات الداعمة (SVM)الدقة (%)اختبار مكنمار16.08<0.0001جوهري (α = 0.05)
النموذج المقترح مقابل آلة المتجهات الداعمة (SVM)المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)اختبار ديلونج (DeLong's test)6.95<0.0001جوهري (α = 0.05)
النموذج المقترح مقابل آلة ناقلات الدعم (SVM)درجة F1تمهيد بوتستراب مقترن (1,000 إعادة أخذ عينات)4.62<0.0001جوهري (α = 0.05)
إمكانية تكرار النتائج عند التشغيل المتكرر (10 عمليات تشغيل مستقلة)المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)وصفي (متوسط ± الانحراف المعياري (SD)0.957 ± 0.008
قابلية تكرار التشغيلات المكررة (10 تشغيلات مستقلة)الدقة (%)وصفي (متوسط ± الانحراف المعياري)93.24 ± 0.74%
إمكانية تكرار التشغيل المتكرر (10 تشغيلات مستقلة)مقياس F1 (%)وصفية (المتوسط ± الانحراف المعياري (SD)92.35 ± 0.92%

الجدول 6: نتائج التحقق الإحصائي وقابلية التكرار التي تم الحصول عليها من التنفيذ التجريبي باستخدام مجموعة بيانات Pima Indians Diabetes. يلخص الجدول أداء التحقق المتقاطع خماسي الطيات، وفترات الثقة 95% القائمة على طريقة bootstrap، والمقارنات الإحصائية للنموذج المقترح مع النماذج المرجعية، وقابلية التكرار عند التشغيل المتكرر عبر 10 بذور عشوائية مستقلة. لم يتم إجراء التحقق الخارجي أو تقييم الخبراء السريريين في عملية التحقق الحالية.

لا.بند قائمة التحققالوثائق المطلوبةالتسجيل / التحقق الموصى به
1البيئة البرمجيةنظام التشغيل، ولغة البرمجة، وبيئة البرمجياتسجل الإصدارات الدقيقة لنظام التشغيل ولغة البرمجة.
2إصدارات البرمجيات والمكتباتإصدارات مكتبات وحزم البرمجيات الرئيسيةسجّل أسماء وإصدارات الحزم والمكتبات بدقة.
3مواصفات الأجهزةمواصفات وحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسوميات (GPU)، وذاكرة الوصول العشوائي (RAM)، وسعة التخزين، والمسرعاتسجّل الأجهزة الحاسوبية المستخدمة.
4تحديد مجموعة البياناتاسم مجموعة البيانات، والمصدر، والإصدار، ومعلومات الوصولسجّل مصدر/إصدار مجموعة البيانات وتاريخ الوصول بدقة حيثما ينطبق ذلك.
5خصائص مجموعة البياناتحجم العينة وتوزيع الفئاتسجل إجمالي العينات وتوزيع الفئات لكل تقسيم.
6تقسيم مجموعة البياناتاستراتيجية التدريب والتحقق ومجموعة الاختبار المستقلةتوثيق نسب/أعداد تقسيم البيانات والتقسيم الطبقي.
7منع تسرب البياناتالإجراء المستخدم لمنع تسريب المعلوماتفصل المستندات/العينات وتقدير معاملات المعالجة المسبقة المخصصة للتدريب فقط.
8معايير المعالجة المسبقةإعدادات التنظيف، ومعالجة القيم المفقودة، والتطبيع، والترميز، والتحويلسجل جميع عمليات المعالجة المسبقة وقيم المعاملات.
9تعزيز البياناتطرق التعزيز وإعدادات المعاملات، عند الاقتضاءتوثيق الطرق، والاحتمالات، ونطاقات المعلمات.
10بنية النموذجبنية النموذج النهائية وإعداداتهقم بتوثيق نوع النموذج، والطبقات/المكونات، والأبعاد، ودوال التنشيط.
11المعلمات الفائقةالمعلمات الفائقة للتدريب والتحسينسجل معدل التعلم، وحجم الدفعة، والمحسن، وعدد العصور، والتوقف المبكر، والمعلمات التي تم ضبطها.
12بذور عشوائيةبذور عشوائية مستخدمة للتنفيذ القابل للتكرارسجّل البذور المستخدمة في التقسيم، والتهيئة الأولية، وعمليات التشغيل المتكررة.
13تكوين التدريبإجراء التدريب واستراتيجية اختيار النموذجالتحقق من صحة المستندات، ونقاط الفحص، ومعايير اختيار النموذج.
14مقاييس التقييممقاييس التقييم الإحصائية والتنبؤية المحددة مسبقاًسجل جميع مقاييس الأداء المُبلغ عنها.
15فترات الثقةفترات عدم اليقين لمقاييس الأداءوثّق إجراء تقدير فترات الثقة (CI) وعينات إعادة سحب البوتستراب (bootstrap resamples) حيثما كان ذلك مناسباً.
16الاختبارات الإحصائيةالإجراءات الإحصائية لمقارنة النماذجتوثيق الاختبار، والإحصائية، والقيمة الاحتمالية (p-value)، وعتبة الدلالة، والافتراضات.
17تحليل التشغيل المتكررتنفيذات مستقلة باستخدام بذور عشوائية مختلفةسجّل عدد التشغيلات والمتوسط ± الانحراف المعياري للمقاييس الرئيسية.
18تكوين القابلية للتفسيرطرق القابلية للتفسير وإعدادات المعاملاتوثّق SHAP أو LIME أو Grad-CAM أو الانتباه (attention) أو الحالات المضادة (counterfactual) أو الإعدادات المعمول بها.
19تقييم القابلية للتفسيرالتقييم الموضوعي لموثوقية التفسير وفائدتهتوثيق الدقة، والاستقرار، وعدم الدقة، والتوطين، والتقييم الخبير حيثما ينطبق ذلك.
20الشوائب الاصطناعية للنموذجأوزان النموذج المدربة وملفات التهيئةأرشفة النموذج المدرب النهائي، والبنية/التكوين، ومعلومات الاختيار.
21مدى توفر الكود البرمجيالكود المطلوب للمعالجة المسبقة، والتدريب، والتقييم، وتوليد التفسيراتمستودع السجلات أو معلومات الوصول المقيد إلى الكود، حيثما كان ذلك مناسباً.
22توثيق التنفيذالأوامر، والنصوص البرمجية، وملفات التكوين، والتعليماتسجّل الأوامر والتكوينات اللازمة لإعادة إنتاج سير العمل.
23توثيق المخرجاتالتنبؤات، ونتائج التقييم، والأشكال، ومخرجات الشرحأرشفة المخرجات الناتجة وربطها بالتجربة/الدورة المقابلة.
24التحقق من قابلية التكرارالتحقق من الاتساق عبر عمليات التنفيذ المستقلةقارن نتائج التشغيلات المكررة وأبلغ عن مقاييس التباين المحددة مسبقاً.

الجدول 7: قائمة مراجعة القابلية للتكرار لإعادة التنفيذ المستقل لسير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح. تحدد قائمة المراجعة المتطلبات الحسابية، ومجموعات البيانات، والمعالجة المسبقة، وتطوير النموذج، والتقييم، والتحقق الإحصائي، والقابلية للتفسير، ومتطلبات التوثيق اللازمة لإعادة إنتاج سير العمل التجريبي.

المناقشة

تُظهر النتائج فائدة البروتوكول المقترح كمسار عمل معياري وقابل للتكرار لتطوير أنظمة الذكاء الاصطناعي القابل للتفسير (XAI) وتقييمها عبر مجموعات بيانات متنوعة في مجال الرعاية الصحية. وكما هو موضح في الجدول ٢ و الشكل 3أدى المعالجة المسبقة المنهجية إلى إنتاج بيانات موحدة وتحسين جودة البيانات من خلال معالجة القيم المفقودة، وتطبيع البيانات، وقياس الميزات، وتقسيم مجموعة البيانات. وتُعد خطوات المعالجة المسبقة هذه بالغة الأهمية لأن التباين في إعداد البيانات قد يؤدي إلى حدوث انحياز، وتقليل الأداء التنبؤي، وتقويض موثوقية تحليلات القابلية للتفسير. وبناءً على ذلك، يجب تطبيق إجراءات معالجة مسبقة متسقة عبر مجموعات بيانات التدريب والتحقق والاختبار لتعزيز قابلية التكرار ومنع تسرب البيانات.19,20.

تظهر نتائج تدريب النموذج في الشكل 4 و جدول 4 إظهار سلوك تعلم ثابت ومتسق. ويشير الانخفاض المتزامن في خسارتي التدريب والتحقق، إلى جانب الزيادة في دقة التنبؤ، إلى تقارب النموذج بشكل مناسب دون حدوث فرط تخصيص جوهري. كما تساهم عمليات تحسين المعاملات الفائقة، والتوقف المبكر، والإنتاج العشوائي (dropout)، والتنظيم في ضمان تدريب مستقر وقابل للتكرار للنموذج. وقد يشير عدم الاستقرار في منحنيات التعلم إلى معدل تعلم غير مناسب، أو عدم كفاية بيانات التدريب، أو تعقيد مفرط في النموذج. لذا، يجب مراقبة تقارب النموذج طوال فترة التدريب لتحديد هذه المشكلات المحتملة ومعالجتها.

يوضح الجدول 5 والشكل 5 أداء التنبؤ باستخدام مقاييس تقييم متعددة، بما في ذلك الدقة (accuracy)، والدقة المحددة (precision)، والاستدعاء (recall)، والنوعية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (Matthews correlation coefficient)، والمساحة تحت منحنى خصائص التشغيل للمستقبل (ROC). وتوفر منحنيات ROC ومنحنيات الدقة والاستدعاء مقاييس للأداء التمييزي، بينما توضح مصفوفة الارتباك توزيع التصنيفات الصحيحة والخاطئة عبر الفئات. ويُعد التقييم باستخدام مقاييس أداء متعددة أمراً بالغ الأهمية بشكل خاص في مجموعات البيانات الطبية غير المتوازنة، لأن الدقة الإجمالية وحدها قد لا تعبر بدقة عن أداء النموذج.

الشكل 6 يوضح نتائج القابلية للتفسير الناتجة عن مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset)، ويبرز الأدوار التكاملية لطرق القابلية للتفسير المطبقة في عملية التحقق العملية. يحدد تحليل SHAP الشامل المساهمة العامة والأهمية النسبية لميزات الإدخال في تنبؤات النموذج، بينما توفر مخططات SHAP الشلالية (waterfall) ومخططات الاعتماد تفسيرات على مستوى المريض والميزة لسلوك النموذج. وتوفر أداة LIME تفسيراً محلياً إضافياً من خلال تحديد الميزات التي تساهم في تنبؤ فردي ضمن مجموعة الاختبار. علاوة على ذلك، يوضح التفسير المضاد للواقع (counterfactual explanation) الخاص بالمريض الحد الأدنى من التغييرات في الميزات المرتبطة بتغيير النتيجة المتوقعة. وتوفر هذه النهج معاً رؤى عالمية ومحلية متكاملة حول سلوك النموذج، مما يعزز شفافية وقابلية تفسير النموذج التنبؤي الجدولي. أما تقنيات Grad-CAM، وتصور الانتباه (attention visualization)، ورسم خرائط البروز (saliency mapping)، والتدرجات المتكاملة (Integrated Gradients)، فلم يتم تطبيقها في التحقق العملي لمجموعة بيانات البيما، وتم الإبقاء عليها فقط كخيارات تعتمد على نوع البيانات ضمن البروتوكول العام.

يُظهر التحقق الإحصائي (الجدول 6 والشكل 7) وتقييمات قابلية التكرار استقرار أداء التنبؤ عبر مختلف عمليات التشغيل التجريبية. ويوفر الجمع بين التحقق المتقاطع، وتقدير فواصل الثقة، واختبار الفرضيات، وتقييم قابلية التكرار في التشغيلات المتكررة إطاراً منهجياً لتقييم متانة النموذج. ويُعد هذا التحقق مهماً بشكل خاص في تطبيقات الرعاية الصحية لأن قابلية التكرار عبر التجارب المستقلة تقدم دليلاً على موثوقية نماذج الذكاء الاصطناعي وقابليتها للتعميم قبل تنفيذها في البيئات السريرية21,23.

تعد عدة خطوات بالغة الأهمية للتنفيذ الناجح لهذا البروتوكول. قم بإجراء تنظيف البيانات قبل استخراج الميزات وتدريب النموذج لتقليل الانحياز المحتمل الناتج عن البيانات غير المكتملة أو غير المتسقة أو الخاطئة. قم بإجراء تحسين المعاملات الفائقة باستخدام بيانات التدريب والتحقق فقط، والحفاظ على استقلالية مجموعة بيانات الاختبار طوال عملية تطوير النموذج وتحسينه. قم بتوثيق حالات مولد الأعداد العشوائية، وإصدارات البرامج، وتكوينات الأجهزة، وإعدادات المعالجة المسبقة بوضوح لتسهيل إعادة الإنتاج عبر المنصات الحوسبية المختلفة. بالإضافة إلى ذلك، اختر طرق القابلية للتفسير بناءً على النموذج التنبؤي ونمط بيانات الرعاية الصحية للحصول على تفسيرات قابلة للتفسير وذات صلة سريرياً20,29,30.

يحتوي هذا البروتوكول على عدة قيود؛ حيث تعتمد دقة وموثوقية تنبؤات النموذج وتفسيراته بشكل كبير على توفر مجموعات بيانات رعاية صحية كبيرة وممثلة وعالية الجودة. وقد يؤثر نقص تمثيل فئات معينة من المرضى، وأخطاء القياس، والمتغيرات المفقودة، وعدم التجانس بين مصادر البيانات سلبًا على كل من أداء التنبؤ واستقرار تفسيرات النموذج. علاوة على ذلك، يمكن لأساليب القابلية للتفسير الحالية توصيف سلوك النموذج، ولكنها لا تثبت بالضرورة وجود آليات سببية. لذا، يجب تفسير مخرجات الذكاء الاصطناعي القابل للتفسير (XAI) بالتزامن مع الخبرة السريرية ذات الصلة.

بشكل عام، يوفر هذا البروتوكول نهجاً معيارياً لتطوير النماذج القابلة للتكرار وتقييمها وتحليل قابليتها للتفسير عبر مختلف مجالات الرعاية الصحية. ومن خلال دمج المعالجة المسبقة المعيارية، وتحسين المعاملات الفائقة، والتقييم باستخدام مقاييس أداء متعددة، ونهج التفسير التكميلية، والتحقق الإحصائي، يوفر سير العمل إطاراً شفافاً وقابلاً للتتبع لأبحاث الذكاء الاصطناعي في الرعاية الصحية.

وتشير النتائج كذلك إلى أن تطوير نماذج ذكاء اصطناعي شفافة ومتسقة يمكن تحقيقه من خلال الدمج بين المعالجة المسبقة المنهجية للبيانات، وإجراءات تطوير النماذج الموحدة، والتقييم الشامل للأداء، وطرق التفسير المتعددة، والتحقق الإحصائي الدقيق. ويمكن تطويع هذا البروتوكول ليتناسب مع قواعد البيانات السريرية، والصور الطبية، والإشارات الفسيولوجية، وبيانات الرعاية الصحية متعددة الوسائط، مع الحفاظ على إطار عمل يضمن إمكانية تكرار التجارب عبر البيئات الحوسبية المختلفة. ومن خلال التنفيذ الموحد، وتقنيات التفسير المتكاملة، وتقييم قابلية التكرار، يوفر هذا البروتوكول إطاراً لتطوير نماذج ذكاء اصطناعي قابلة للتفسير وجديرة بالثقة، وقد يعمل كأساس منهجي للأبحاث الطبية الحيوية المستقبلية وعمليات التحقق السريرية والخارجية اللاحقة.

الإفصاحات

يصرح المؤلفون بأنه ليس لديهم أي مصالح مالية متضاربة، أو علاقات تجارية، أو علاقات شخصية من شأنها أن تؤثر على العمل الوارد في هذه الدراسة. ولا يوجد لدى المؤلفين أي تضارب في المصالح للإفصاح عنه.

شكر وتقدير

يقر المؤلفون بالدعم المؤسسي المقدم من مؤسساتهم التابعة خلال تطوير والتحقق التجريبي من بروتوكول الذكاء الاصطناعي القابل للتفسير (XAI) في الرعاية الصحية. كما يقر المؤلفون بالمرافق الحسابية وموارد البرمجيات المستخدمة لإجراء التحليلات التجريبية. لم يتلق هذا البحث أي تمويل خارجي. ويقر المؤلفون باستخدام Python 3.11 وMatplotlib 3.9 وSciPy 1.13 للتحليل الحسابي، وتصور البيانات، وإنشاء الأشكال المعروضة في هذه الدراسة.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
كابتوم (Captum)ميتا إيه آي (Meta AI)أحدث إصدار مستقرقابلية التفسير في PyTorch
مجموعة أدوات CUDANVIDIA12.2تسريع وحدة معالجة الرسوميات
cuDNNNVIDIA٩.xالبنية الخلفية للتعلم العميق
جيت (Git)نظام Git لإدارة مصدر الكود (SCM)أحدث إصدار مستقرالتحكم في الإصدارات
GitHubGitHub Inc.منصة إلكترونيةمستودع الشفرة المصدرية
خرائط تفعيل الفئة الموجهة بالتدرج (Grad-CAM)جاكوبجيلأحدث إصدارتصوير الشبكات العصبية التلافيفية (CNN) بصرياً
دفتر ملاحظات جوبيتر (Jupyter Notebook)مشروع جوبيتر (Project Jupyter)أحدث إصدار مستقرالتطوير التفاعلي
LightGBMمايكروسوفت4.xتعزيز التدرج
LIMEمجتمع LIME0.2.0القابلية للتفسير المحلي
مات بلوت ليب (Matplotlib)مُطوِّرو Matplotlib3.9التصور المرئي
مايكروسوفت إكسل (Microsoft Excel)مايكروسوفتمايكروسوفت 365 (Microsoft 365)تنظيم البيانات
NumPyمطورو NumPy1.26الحوسبة العددية
وحدة معالجة الرسوميات NVIDIA RTX 4090NVIDIAذاكرة فيديو عشوائية (VRAM) بسعة 24 جيجابايتتدريب النموذج
OpenCVمنظمة OpenCV4.10المعالجة المسبقة للصور
بانداز (Pandas)فريق تطوير Pandas2.2المعالجة المسبقة للبيانات
بيلو (PIL)مكتبة بايثون للتصوير (Python Imaging Library)10.xمعالجة الصور
Plotlyتقنيات بلوتلي (Plotly Technologies)٥.Xالتصور التفاعلي
بايثونمؤسسة برمجيات بايثون (Python Software Foundation)3.11بيئة البرمجة
PyTorchمؤسسة PyTorch2.3التعلم العميق
Scikit-learnمطورو Scikit-learn1.5تعلم الآلة
SciPyمطورو SciPy1.13الحوسبة العلمية
سيبورن (Seaborn)مطورو Seaborn0.13المخططات الإحصائية
قيم شابلي الإضافية (SHAP)مجتمع SHAP0.46القابلية للتفسير الشاملة
SimpleITKتحالف إنسايت للبرمجيات (Insight Software Consortium)٢.سمعالجة الصور الطبية
Statsmodelsمطورو Statsmodels0.14التحليل الإحصائي
ذاكرة الوصول العشوائي للنظامأي شركة مصنعة32 جيجابايت أو أكثرالذاكرة
تنسر بورد (TensorBoard)جوجل2.15مراقبة التدريب
TensorFlowجوجل2.15التعلم العميق
أوبونتو لينكس / ويندوز 11كانونيكال / مايكروسوفت22.04 LTS / 11نظام التشغيل
Visual Studio CodeMicrosoftأحدث إصدار مستقرتطوير البرمجيات
XGBoostمطورو XGBoost2.1تعزيز التدرج

المراجع

  1. Acosta JN, Falcone GJ, Rajpurkar P, Topol EJ. Multimodal biomedical AI. Nat Med. 2022;28(9):1773-1784.
  2. Tang AS, et al. Harnessing EHR data for health research. Nat Med. 2024;30(7):1847-1855.
  3. Zhang A, Xing L, Zou J, Wu JC. Shifting machine learning for healthcare from development to deployment and from models to data. Nat Biomed Eng. 2022;6(11):1330-1345.
  4. Bera K, et al. Predicting cancer outcomes with radiomics and artificial intelligence in radiology. Nat Rev Clin Oncol. 2022;19(2):132-146.
  5. Wenderott K, Krups J, Zaruchas F, Weigl M. Effects of artificial intelligence implementation on efficiency in medical imaging—a systematic literature review and meta-analysis. NPJ Digit Med. 2024;7(1):265.
  6. Kaissis GA, Makowski MR, Rückert D, Braren RF. Secure, privacy-preserving and federated machine learning in medical imaging. Nat Mach Intell. 2020;2(6):305-311.
  7. He J, et al. The practical implementation of artificial intelligence technologies in medicine. Nat Med. 2019;25(1):30-36.
  8. Antoniadi AM, et al. Current challenges and future opportunities for XAI in machine learning-based clinical decision support systems: A systematic review. Appl Sci (Basel). 2021;11(11):5088.
  9. Samek W, et al. Explaining deep neural networks and beyond: A review of methods and applications. Proc IEEE. 2021;109(3):247-278.
  10. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. WIREs Data Min Knowl Discov. 2019;9(4).
  11. Markus AF, Kors JA, Rijnbeek PR. The role of explainability in creating trustworthy artificial intelligence for health care: A comprehensive survey of the terminology, design choices, and evaluation strategies. Nat Biomed Eng. 2021;5(9):996-1011.
  12. Arrieta AB, et al. Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  13. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization [conference paper]. Presented at: IEEE International Conference on Computer Vision (ICCV); Venice, Italy; 2017:618-626. https://openaccess.thecvf.com/content_iccv_2017/html/Selvaraju_Grad-CAM_Visual_Explanations_ICCV_2017_paper.html
  14. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(12):572-584.
  15. Sundararajan M, Taly A, Yan Q. Axiomatic attribution for deep networks [conference paper]. Presented at: 34th International Conference on Machine Learning; Sydney, Australia; 2017;70:3319-3328. https://proceedings.mlr.press/v70/sundararajan17a.html
  16. Ribeiro MT, Singh S, Guestrin C. “Why should I trust you?”: Explaining the predictions of any classifier [conference paper]. Presented at: 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; San Francisco, CA; 2016:1135-1144.
  17. Desai S, Ramaswamy HG. Ablation-CAM: Visual explanations for deep convolutional network via gradient-free localization [conference paper]. Presented at: IEEE/CVF Winter Conference on Applications of Computer Vision (WACV); 2020:983-991.
  18. Belle V, Papantonis I. Principles and practice of explainable machine learning. Front Big Data. 2021;4:688969.
  19. Vilone G, Longo L. Notions of explainability and evaluation approaches for explainable artificial intelligence. Inf Fusion. 2021;76:89-106.
  20. Ali S, et al. Explainable artificial intelligence (XAI): What we know and what is left to attain trustworthy artificial intelligence. Inf Fusion. 2023;99:101805.
  21. Gundersen OE, Kjensmo S. State of the art: Reproducibility in artificial intelligence [conference paper]. Presented at: Thirty-Second AAAI Conference on Artificial Intelligence; New Orleans, LA; 2018:1644-1651. https://ojs.aaai.org/index.php/AAAI/article/view/11503
  22. Hutson M. Artificial intelligence faces reproducibility crisis. Science. 2018;359(6377):725-726.
  23. Pineau J, et al. Improving reproducibility in machine learning research: A report from the NeurIPS 2019 reproducibility program. J Mach Learn Res. 2021;22(164):1-20.
  24. U.S. Food and Drug Administration, Health Canada, Medicines and Healthcare products Regulatory Agency. Good Machine Learning Practice for Medical Device Development: Guiding Principles. 2021.
  25. Liu X, et al. Reporting guidelines for clinical trial reports for interventions involving artificial intelligence: The CONSORT-AI extension. Nat Med. 2020;26(9):1364-1374.
  26. Mongan J, Moy L, Kahn CE Jr. Checklist for Artificial Intelligence in Medical Imaging (CLAIM): A guide for authors and reviewers. Radiol Artif Intell. 2020;2(2).
  27. Peng RD. Reproducible research in computational science. Science. 2011;334(6060):1226-1227.
  28. Collins GS, et al. Protocol for development of the TRIPOD-AI and PROBAST-AI reporting and risk-of-bias tools for studies developing, validating, or updating prediction models based on artificial intelligence. BMJ Open. 2021;11.
  29. Kapoor S, Narayanan A. Leakage and the reproducibility crisis in machine-learning-based science. Patterns. 2023;4(9):100804.
  30. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-1340.

إعادة الطباعة والأذونات

الوسوم

الذكاء الاصطناعي القابل للتفسيرنماذج الذكاء الاصطناعي في الرعاية الصحيةقابلية تفسير النماذجبروتوكول قابل للتكرارالأداء التنبئيهندسة الميزاتالتحقق الإحصائيتفسيرات SHAPتفسيرات LIMEالتفسيرات المضادة للواقع