تم تنفيذ إطار عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح باستخدام مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) كنموذج لمجموعة بيانات الرعاية الصحية. وقد استُخدمت مجموعة بيانات سكري الهنود البيما كالمجموعة الوحيدة للتحقق التجريبي؛ حيث تم توليد جميع النتائج التنبؤية، ونتائج القابلية للتفسير، والنتائج الإحصائية، ونتائج إمكانية التكرار المذكورة من هذه المجموعة. ولم يتم تقييم TCGA-BRCA وTCGA-UCEC وMIMIC-III وISIC 2019 وHAM10000 وOhioT1DM وBraTS 2021 تجريبياً، بل أُدرجت فقط كأمثلة توضح قابلية تطبيق البروتوكول العام عبر أنماط مختلفة من بيانات الرعاية الصحية. استُخدمت مجموعة البيانات الكاملة بعد إزالة السجلات غير الصالحة والمكررة، وأُجريت عمليات المعالجة المسبقة المحددة قبل تطوير النموذج. كما قُسمت مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار باستخدام استراتيجية تقسيم طبقية محددة مسبقاً، مع الحفاظ على استقلالية العينات عبر المجموعات الثلاث لتقليل احتمالية تسرب البيانات.
تم تكوين النموذج التنبئي باستخدام البنية والمعلمات الفائقة المحددة مسبقاً. وقد تم تدريب النموذج باستخدام محسن Adam مع معدل تعلم وحجم دفعة محددين مسبقاً لمدة تصل إلى 100 حقبة تدريبية (epochs). كما طُبق التوقف المبكر بناءً على خسارة التحقق، وتم الاحتفاظ بالنموذج الذي حقق أفضل أداء في التحقق. كما تم تحديد بذور عشوائية لتقسيم مجموعة البيانات، وتهيئة النموذج، والتجارب المتكررة لتعزيز إمكانية إعادة الإنتاج.
تم تقييم النموذج المدرب على مجموعة اختبار مستقلة باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والنوعية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، والمتوسط الدقيق (AP). كما تمت مقارنة النموذج المقترح مع النماذج المرجعية المحددة مسبقاً باستخدام إجراءات معالجة أولية، وتقسيمات بيانات، وبروتوكولات تقييم متطابقة. وقد تم توليد منحنيات خصائص تشغيل المستقبل (ROC)، ومنحنيات الضبط والاستدعاء، ومصفوفة الارتباك من تنبؤات مجموعة الاختبار المستقلة.
تم إجراء التحقق المتقاطع خماسي الطيات على بيانات التدريب لتقييم استقرار الأداء. كما تم تقدير فترات ثقة بنسبة 95% لمقاييس الأداء الرئيسية، وأُجريت مقارنات إحصائية محددة مسبقاً بين النموذج المقترح والنماذج المرجعية.
أدى التحقق المتبادل خماسي الطيات إلى دقة بلغت 93.01 ± 0.48%، ومساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC) بلغت 0.954 ± 0.007، ودقة تنبؤ (precision) بلغت 92.42 ± 0.87%، وحساسية (recall) بلغت 93.02 ± 0.45%، ومقياس F1-score بلغ 92.72 ± 0.62%. وكانت فترات الثقة بنسبة 95% بطريقة bootstrap المقدرة من 1,000 إعادة أخذ عينات هي 0.897–0.973 للدقة، و 0.890–0.970 لدقة التنبؤ، و 0.880–0.963 للحساسية، و 0.887–0.965 لمقياس F1-score، و 0.931–0.984 لـ AUC-ROC. أُجريت المقارنات الإحصائية مع النماذج المرجعية للشبكة العصبية التلافيفية (CNN)، والغابة العشوائية (Random Forest)، وآلة المتجهات الداعمة (SVM) باستخدام اختبار McNemar للدقة، واختبار DeLong لـ AUC-ROC، واختبار bootstrap المزدوج مع 1,000 إعادة أخذ عينات لمقياس F1-score.
تكررت إجراءات التدريب والتقييم الكاملة عبر 10 تشغيلات مستقلة باستخدام بذور عشوائية مختلفة. وقد أسفرت التشغيلات المتكررة عن قيمة AUC-ROC بلغت 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، ودرجة F1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبياً عبر عمليات التنفيذ المتكررة. وتم تلخيص مقاييس الأداء التي تم الحصول عليها عبر عمليات التنفيذ المتكررة باستخدام المتوسط والانحراف المعياري. كما تم فحص التباين بين التشغيلات لتحديد ما إذا كان أداء التنبؤ ظل مستقراً تحت التنفيذ المتكرر.
لم يتم إجراء التحقق الخارجي في هذا المثال العملي لعدم استخدام مجموعة بيانات خارجية مستقلة. وبناءً على ذلك، فإن جميع النتائج التنبؤية والإحصائية ونتائج إعادة الإنتاجية الواردة تم الحصول عليها من مجموعة بيانات Pima Indians Diabetes Dataset باستخدام تقسيمات التدريب والتحقق والاختبار المستقل المحددة مسبقاً. وقد تم الإبقاء على التحقق الخارجي في البروتوكول كإجراء اختياري للتطبيقات التي تتوفر فيها مجموعة بيانات مستقلة من مؤسسة أو مجتمع أو منطقة جغرافية أو فترة زمنية مختلفة.
تم إنشاء تفسيرات للنماذج باستخدام تقنيات القابلية للتفسير المطبقة على مجموعة بيانات Pima Indians Diabetes الجدولية، بما في ذلك SHAP وLIME. كما تم تقييم أهمية الميزات العالمية، وإنشاء تفسيرات محلية خاصة بكل مريض باستخدام عينات اختبار محجوزة. وقد سُجلت مخرجات التفسير جنبًا إلى جنب مع تنبؤات النموذج وقيم الميزات المقابلة لتسهيل عملية إعادة الإنتاج والتفسير اللاحق.
من أجل الوضوح، اشتمل المثال العملي الحالي على مراحل سير العمل التسع الأساسية المحددة في الجدول 1. وقد تم الإبقاء على التحقق الخارجي وتقييم الخبراء السريريين كنموذجين اختياريين للتحقق من البروتوكول العام. لم يتم إجراء التحقق الخارجي نظراً لعدم استخدام أي مجموعة بيانات خارجية مستقلة، كما لم يتم إجراء تقييم الخبراء السريريين لعدم إدراج لجنة رسمية لتقييم الخبراء في هذا المثال العملي. وبناءً على ذلك، لا تُعتبر هذه النماذج الاختيارية جزءاً من سير العمل التجريبي المكون من تسع مراحل، ولا يتم تقديمها كـنتائج تجريبية.
أدت إجراءات المعالجة المسبقة وتقسيم مجموعة البيانات إلى إنتاج مجموعة بيانات موحدة مناسبة لتطوير النموذج. حيث تم حذف السجلات المكررة وغير المتسقة، ومعالجة القيم المفقودة وفقاً للاستراتيجية المحددة مسبقاً، وتوحيد الميزات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار. وتلخص الجدول 2 خصائص مجموعة البيانات الناتجة وإجراءات المعالجة المسبقة. ويوضح الشكل 2 سير عمل تحضير ومعالجة مجموعة بيانات الرعاية الصحية العامة، بينما يظهر في الشكل 3 سير عمل التحضير التجريبي والمعالجة المسبقة والتقسيم وتقييم الجودة المطبق خصيصاً على مجموعة بيانات سكري الهنود من قبيلة بيما (Pima Indians Diabetes Dataset). كما يلخص الجدول 3 البيئة الحسابية النهائية، وبنية النموذج، وتكوين المعلمات الفائقة (hyperparameters) المستخدمة في استخراج النتائج المذكورة.
أدى تنفيذ القسمين 3 و4 إلى الحصول على مجموعة بيانات رعاية صحية موحدة ومناسبة لتطوير النموذج. حيث قامت إجراءات المعالجة المسبقة بإزالة السجلات المكررة وغير المتسقة، وتعويض القيم المفقودة، وتوحيد الميزات الرقمية، وتشفير المتغيرات الفئوية حيثما كان ذلك قابلاً للتطبيق، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار. ووفرت البيانات الناتجة المدخلات الموحدة المطلوبة لتطوير النموذج لاحقاً.
بعد استكمال القسمين 5 و6، أظهر النموذج الذي تم تكوينه تقارباً مستقراً أثناء التدريب. وأظهرت منحنيات التعلم انخفاضاً متزامناً في خسائر التدريب والتحقق، وزيادة في دقة التدريب والتحقق. وقد أدى تحسين المعلمات الفائقة إلى تحسين تعميم النموذج، مع عدم وجود دليل على حدوث فرط تخصيص جوهري. ولدعم قابلية إعادة الإنتاج، تمت أرشفة النموذج المُحسَّن جنباً إلى جنب مع البنية النهائية، وإعدادات المعلمات الفائقة، وإصدارات البرمجيات، والبذور العشوائية، وأوزان النموذج المدربة. وتلخص فيما يلي مواصفات تدريب النموذج ونتائج التحسين في جدول 4، وتظهر منحنيات تعلم التدريب والتحقق المقابلة في الشكل 4.
قيّم القسم 7 الأداء التنبؤي للنموذج باستخدام مقاييس أداء معيارية. وشملت مقاييس التصنيف التي تم تقييمها كلاً من الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والنوعية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، والدقة المتوسطة (AP). وتمت مقارنة النموذج المقترح مع النماذج المرجعية المحددة مسبقاً باستخدام نفس تقسيمات مجموعة البيانات، وإجراءات المعالجة المسبقة، وبروتوكول التقييم. تظهر مقارنة الأداء التنبؤي في الجدول 5، بينما تظهر منحنيات ROC، ومنحنيات الضبط والاستدعاء، ومصفوفة الارتباك، ومقاييس الأداء المقارنة في الشكل 5.
عقب القسم 8، تم إنشاء تفسيرات شاملة ومحلية لتنبؤات النموذج لتقييم مدى قابليته للتفسير. تم توليد تفسيرات النموذج باستخدام SHAP وLIME لمجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) الجدولية، كما تم إنشاء تفسير مضاد للواقع خاص بمريض معين لتوضيح التغيير في التنبؤ. استُخدم SHAP لإنشاء تصورات لأهمية الميزات الشاملة، ومخططات الشلال الخاصة بالمريض، والاعتماد المتبادل للميزات، بينما استُخدم LIME لإنشاء تفسيرات محلية من عينات الاختبار المستبعدة. وتظهر مخرجات القابلية للتفسير المقابلة في الشكل 6.
قيمت المرحلة النهائية من البروتوكول الموثوقية الإحصائية وقابلية تكرار سير العمل. تم تكرار سير العمل كاملاً عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة مع الحفاظ على نفس استراتيجية تقسيم مجموعة البيانات، ومعلمات المعالجة المسبقة، وبنية النموذج، والمعلمات الفائقة، وبيئة البرمجيات، وإجراءات التقييم. أسفرت عمليات التشغيل المكررة عن AUC-ROC بلغت 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، وF1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبياً عبر عمليات التنفيذ المكررة.
لم يتم تقييم استقرار التفسير كمياً في عمل التحقق الحالي. ورغم توليد تفسيرات SHAP و LIME لمجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset)، إلا أنه لم يتم إجراء تحليل منفصل لارتباط الرتب بين التشغيلات أو تحليل تداخل الميزات. وبناءً على ذلك، لم يتم تقديم أي مقاييس عددية للتفسير، أو الاستقرار، أو اتفاق العزو. وقد تم الإبقاء على التقييم الكمي لاستقرار التفسير في البروتوكول العام كإجراء اختياري لإعادة الإنتاجية في التطبيقات التي تتوفر فيها مخرجات تفسيرية متكررة.
تم تقييم المقارنات الإحصائية باستخدام عتبة دلالة محددة مسبقاً وهي p < 0.05. واستُخدمت الاختبارات الإحصائية ثنائية الجانب حيثما كان ذلك مناسباً، كما تم تسجيل إحصائيات الاختبار المقابلة، وقيم p، وفترات الثقة 95% لتقدير الدلالة الإحصائية وعدم اليقين في فروق الأداء الملحوظة. وتتلخص نتائج التحقق الإحصائي التجريبي وقابلية التكرار، بما في ذلك أداء التحقق المتقاطع، وفترات الثقة، والمقارنات الإحصائية، وتباين التشغيلات المتكررة، في الجدول 6. كما تم توضيح تحليلات الاختبار الإحصائي وقابلية التكرار المقابلة في الشكل 7.
قدمت هذه النتائج دليلاً تجريبياً على الاستقرار التنبؤي وقابلية التكرار في ظل الظروف الحسابية ومجموعة البيانات التي تم اختبارها. وقد تم توثيق البيئة الحسابية، وخصائص مجموعة البيانات، وإجراءات المعالجة المسبقة، وتكوين النموذج، والتحليلات الإحصائية، وإعدادات القابلية للتفسير اللازمة للتكرار المستقل وفقاً لقائمة مراجعة قابلية التكرار الواردة في الجدول 7لم يتم إجراء تقييم من قبل خبراء سريريين لمخرجات الذكاء الاصطناعي القابل للتفسير (XAI) التي تم إنتاجها في مثال التحقق التطبيقي الخاص بهذا العمل.
بشكل عام، أدى تطبيق البروتوكول إلى إنتاج مجموعة بيانات رعاية صحية موحدة مناسبة لتطوير نماذج الذكاء الاصطناعي، ونموذج مُحسّن باستخدام إعدادات مسبقة للمعلمات الفائقة. وقد مكّن سير العمل من التقييم المنهجي للأداء التنبؤي، وتوليد تفسيرات للنموذج باستخدام تقنيات الذكاء الاصطناعي القابل للتفسير (XAI) المناسبة، والتقييم الإحصائي لمتانة النموذج وقابلية تكراره. ومعاً، أظهرت النتائج إمكانية تنفيذ وتكرار سير عمل XAI المقترح في ظل الظروف التجريبية التي تم تقييمها في مثال التحقق التطبيقي.

الشكل 1: سير العمل الأساسي المكون من تسع مراحل لتطوير نماذج ذكاء اصطناعي قابلة للتكرار والتفسير في مجال الرعاية الصحية. يتكون سير العمل من (1) تحديد مهمة التنبؤ في الرعاية الصحية، (2) تهيئة البيئة الحسابية، (3) الحصول على مجموعة البيانات والتحقق من صحتها، (4) المعالجة المسبقة للبيانات، (5) تقسيم مجموعة البيانات، (6) تدريب النموذج التنبؤي، (7) تقييم الأداء التنبؤي، (8) تحليل القابلية للتفسير، و(9) التحقق الإحصائي وتقييم القابلية للتكرار. ويتم التعامل مع التحقق الخارجي وتقييم الخبراء السريريين كإضافات اختيارية للبروتوكول وليست مدرجة في سير العمل الأساسي المكون من تسع مراحل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: سير عمل إعداد والمعالجة المسبقة لمجموعة بيانات الرعاية الصحية. (A) اكتساب بيانات الرعاية الصحية من السجلات السريرية، والتصوير الطبي، والإشارات الفسيولوجية، ومصادر البيانات متعددة الوسائط. (B) تكامل البيانات والمعالجة المسبقة، بما في ذلك التعامل مع القيم المفقودة، والتطبيع، وإزالة الضوضاء، والتعزيز. (C) تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب، والتحقق، والاختبار. (D) تقييم الجودة الذي يوضح توزيع الفئات، وتطبيع الميزات، ومخرجات المعالجة المسبقة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: سير العمل التجريبي لتحضير ومعالجة مسبقة وتقسيم وتقييم جودة مجموعة بيانات Pima Indians Diabetes. يتضمن سير العمل الحصول على مجموعة البيانات، وتقييم جودة البيانات، والتعامل مع القيم غير الصالحة والمفقودة، وتوحيد السمات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار المستقل، والتحقق النهائي من الجودة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: منحنيات تعلم التدريب والتحقق التجريبية للنموذج المقترح باستخدام مجموعة بيانات بِيما للهنود لمرض السكري (Pima Indians Diabetes Dataset). (A) خسارة التدريب والتحقق على مدار فترة التدريب الكاملة. (B) دقة التدريب والتحقق طوال فترة التدريب الكاملة. (كربون) عرض مكبّر للفقد خلال الحقبات 50-100. (د) عرض مكبّر للدقة خلال العصور (epochs) من 50 إلى 100. تم الحصول على أفضل أداء للتحقق عند العصر 78، حيث بلغت خسارة التحقق 0.142 ودقة التحقق 94.6%. تم تفعيل التوقف المبكر عند العصر 88 باستخدام فترة صبر (patience) قدرها 10 عصور. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: التقييم التجريبي للأداء التنبؤي لإطار عمل XAI المقترح باستخدام مجموعة الاختبار المستقلة (n = 154). (A) منحنى خصائص التشغيل للمستقبل (ROC) الذي يوضح أداء التمييز لنموذج XAI المقترح والنماذج المرجعية. (B) منحنيات الدقة والاستدعاء (PR) التي توضح أداء الدقة والاستدعاء لنموذج XAI المقترح والنماذج المرجعية. (C) مصفوفة الارتباك لنموذج XAI المقترح على مجموعة الاختبار المستقلة، مع الدقة والحساسية (الاستدعاء) والنوعية المقابلة. (D) مقارنة الدقة، والدقة التنبؤية، والاستدعاء، والنوعية، ودرجة F1، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت المنحنى (AUC) لـ ROC، ومتوسط الدقة (AP) عبر النماذج التي تم تقييمها. جميع النتائج الكمية الموضحة في هذا الشكل تعود إلى تجربة التحقق من مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: مخرجات القابلية للتفسير الناتجة عن تنبؤات مجموعة الاختبار المستقلة للنموذج المقترح المدرب على مجموعة بيانات Pima Indians Diabetes. (A) مخطط ملخص SHAP العالمي الذي يوضح توزيع مساهمات الميزات عبر مجموعة الاختبار. (B) مخطط أهمية الميزات SHAP بناءً على متوسط قيم SHAP المطلقة. (C) مخطط SHAP الشلالي الخاص بالمريض والذي يوضح مساهمات الميزات الفردية في احتمالية الإصابة بمرض السكري المتنبأ بها. (D) تفسير LIME المحلي الذي يوضح مساهمات الميزات للمريض رقم #125 في مجموعة الاختبار. (E) مخطط اعتماد SHAP الذي يوضح العلاقة بين قيم الجلوكوز ومساهماتها في SHAP. (F) تفسير مضاد للواقع خاص بالمريض يوضح الحد الأدنى من تغييرات الميزات المرتبطة بتغيير في تنبؤ النموذج. الاختصارات: SHAP = Shapley Additive exPlanations؛ LIME = Local Interpretable Model-agnostic Explanations. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

شكل 7: التحقق الإحصائي التجريبي وتحليل إمكانية التكرار للنموذج المقترح باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما. (Aأداء التحقق المتقاطع خماسي الطيات على مجموعة التدريب.B(فترات ثقة البوتستراب بنسبة 95% لأداء مجموعة اختبار مستقلة).جـمقارنات إحصائية مع النماذج المرجعية، بما في ذلك الاختبار الإحصائي، وإحصائية الاختبار، والقيمة الاحتمالية (p-value)، والدلالة الإحصائية.داتساق الأداء عبر 10 تجارب مستقلة باستخدام بذور عشوائية مختلفة. استُخدم اختبار McNemar لدقة التصنيف المقترنة، واختبار DeLong لمساحة منحنى خصائص التشغيل للمستقبل (ROC-AUC) المترابطة، واختبار bootstrap المقترن مع 1,000 إعادة سحب لمقارنة درجة F1-score. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| مرحلة | نشاط البروتوكول | المخرجات المتوقعة | حالة التنفيذ |
| 1 | اختيار مجموعة بيانات الرعاية الصحية والتحقق من صحتها | مجموعة البيانات التي تم التحقق منها، وهدف التنبؤ، وتوزيع الفئات، ومعلومات جودة البيانات | تَمَّ تنفيذُه |
| 2 | تكوين البيئة الحسابية | تم التحقق من الأجهزة والبرامج والمكتبات والإصدارات والتكوين الحسابي | أُجريت |
| 3 | المعالجة المسبقة وضبط جودة بيانات الرعاية الصحية | مجموعة بيانات منظفة ومحولة وموحدة | تَم تنفيذها |
| 4 | تقسيم مجموعة البيانات | مجموعات بيانات مستقلة للتدريب والتحقق والاختبار | نُفِّذت |
| 5 | تطوير وتحسين النموذج التنبئي/نموذج الذكاء الاصطناعي القابل للتفسير (XAI) | بنية النموذج والبارامترات الفائقة النهائية | أُجريت |
| 6 | تدريب النموذج وحفظه | النموذج المدرب، ونقطة التحقق، وتكوين التدريب، والسجلات | أُجريت |
| 7 | تقييم الأداء التنبؤي والحسابي | مقاييس أداء مجموعة الاختبار ومقارنات الأداء | تَمَّ تنفيذها |
| 8 | توليد وتقييم مخرجات القابلية للتفسير | مخرجات SHAP/LIME والتوضيحات القابلة للتطبيق | أُجريت |
| 9 | إجراء التحقق الإحصائي وتقييم قابلية التكرار | فترات الثقة، والاختبارات الإحصائية، ونتائج التشغيلات المكررة، ومقاييس القابلية للتكرار | تَمَّ تنفيذها |
الجدول 1: ملخص لسير عمل البروتوكول الأساسي المكون من تسع مراحل والمطبق في عملية التحقق من الصحة باستخدام مجموعة بيانات سكري الهنود البيما. يميّز الجدول بين المراحل التسع المنفذة في المثال التطبيقي لمجموعة بيانات سكري الهنود البيما وبين التحقق الخارجي وتقييم الخبراء السريريين، واللذين يتم الاحتفاظ بهما كمكونات اختيارية في البروتوكول العام.
| مجموعة البيانات | مصدر البيانات | التطبيق السريري | نمط البيانات | المبحوثون/السجلات | العينات | الفئات | توزيع الفئات | التدريب/التحقق/الاختبار | الدور في الدراسة الحالية | حالة التحقق | رابط المصدر |
| Pima Indians Diabetes Dataset | UCI Machine Learning Repository | التنبؤ بمرض السكري | بيانات سريرية جدولية | 768 سجلاً | 768 | 2 | 500 غير مصاب بالسكري؛ 268 مصاب بالسكري | 60% / 20% / 20% | مجموعة بيانات التحقق التجريبية الأساسية | أُجري - سير عمل أساسي كامل من تسع مراحل | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | NCI Genomic Data Commons (GDC), TCGA-BRCA project | تصنيف سرطان الثدي | بيانات سريرية + علم الأمراض النسيجي | 1,098 حالة | يعتمد على مجموعة البيانات حسب نوع البيانات | يعتمد على نقطة النهاية | لا يوجد توزيع فئات موحد على مستوى مجموعة البيانات | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | NCI Genomic Data Commons (GDC), TCGA-UCEC project | تصنيف سرطان بطانة الرحم | بيانات سريرية + علم الأمراض النسيجي | مجموعة المشروع؛ يعتمد الحجم على نوع البيانات والمرشحات المختارة | يعتمد على مجموعة البيانات حسب نوع البيانات | يعتمد على نقطة النهاية | لا يوجد توزيع فئات موحد على مستوى مجموعة البيانات | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet, MIMIC-III Clinical Database v1.4 | التنبؤ بالنتائج السريرية | سلاسل زمنية سريرية | 46,520 مريضاً | 58,976 حالة دخول إلى وحدة العناية المركزة | يعتمد على المهمة | لا يوجد توزيع فئات موحد على مستوى قاعدة البيانات | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | International Skin Imaging Collaboration (ISIC) Challenge | تصنيف الآفات الجلدية | صور تنظير جلدي | غير قابل للتطبيق – مجموعة بيانات صور | 25,331 صورة تدريبية | 8 فئات تدريبية | AKIEC 867; BCC 3,323; BKL 2,624; DF 239; MEL 4,522; NV 12,875; VASC 253; SCC 628 | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / ISIC Archive | تصنيف الآفات الجلدية | صور تنظير جلدي | 7,470 آفة فريدة | 10,015 صورة | 7 | AKIEC 327; BCC 514; BKL 1,099; DF 115; MEL 1,113; NV 6,705; VASC 142 | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://doi.org/10.7910/DVN/DBW86T |
| OhioT1DM | OhioT1DM dataset, publicly distributed for research | مراقبة/التنبؤ بمرض السكري | سلاسل زمنية سريرية | 12 مشاركاً | 24 ملف XML موزعة بين بيانات التدريب/التطوير والاختبار | التنبؤ بمستويات الجلوكوز المستمرة؛ ليست مهمة تصنيف ثابتة | غير قابل للتطبيق | ملفات التدريب/التطوير والاختبار محددة مسبقاً في مجموعة البيانات؛ لم يتم إجراء تقسيم تجريبي هنا | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://pmc.ncbi.nlm.nih.gov/articles/PMC7881904/ |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021; CBICA/University of Pennsylvania | تقسيم/تصنيف أورام الدماغ | MRI | 2,040 حالة في مجموعة التحدي | 1,251 حالة تدريبية مشروحة؛ أربعة أنماط MRI لكل حالة | يعتمد على المهمة | لا يوجد توزيع فئات موحد على مستوى مجموعة البيانات | مجموعات محددة من قبل التحدي؛ لم يتم إجراء تقسيم تجريبي هنا | مثال على قابلية تطبيق البروتوكول فقط | لم تُستخدم للتحقق التجريبي | https://www.med.upenn.edu/cbica/brats2021/ |
الجدول 2: خصائص مجموعات بيانات الرعاية الصحية ومدى قابلية تطبيق البروتوكول المقترح. يلخص الجدول مصادر البيانات، والتطبيقات السريرية، والأنماط، وخصائص العينات، وتوزيعات الفئات، واستراتيجيات تقسيم مجموعات البيانات، وحالة التحقق، ومعلومات المصدر لمجموعات بيانات الرعاية الصحية التي تم النظر فيها في البروتوكول. وتعمل مجموعة بيانات Pima Indians Diabetes كنموذج عملي أساسي للتحقق من صحة البروتوكول.
| بند التكوين | بيئة التحقق من الصلاحية الفعلية المطبقة | الحالة / التفسير |
| مجموعة البيانات | مجموعة بيانات مرض السكري لدى هنود بيما | مجموعة بيانات التحقق التجريبي الفعلي |
| الخوارزمية / النموذج | نموذج تنبؤي جدولي للتصنيف الثنائي لمرض السكري | استخدم اسم البنية الدقيقة كما ورد في سجل التجربة إذا كان موثقاً بشكل منفصل |
| معدل التعلم | 0.001 | الإعداد التجريبي |
| المُحسِّن | آدم | الإعداد التجريبي |
| حجم الدفعة | 32 | الإعداد التجريبي |
| الحد الأقصى للعصور التدريبية | 100 | الإعداد التجريبي |
| دالة الخسارة | الإنتروبيا التقاطعية | الإعداد التجريبي |
| دالة التنشيط | وحدة خطية مستقيمة (ReLU) | الإعداد التجريبي |
| التسرب (Dropout) | 0.5 | الإعداد التجريبي |
| اضمحلال الوزن | 1e-4 | الإعداد التجريبي |
| تسوية الدفعة | مُفعّل | الإعداد التجريبي |
| تعزيز البيانات / موازنة الفئات | مُمكّن | حدد تقنية SMOTE فقط إذا كانت قد طُبقت بالفعل في التشغيل المُبلغ عنه |
| استراتيجية التحقق من الصلاحية | التحقق المتقاطع خماسي الطيات | الإعداد التجريبي |
| التوقف المبكر | فترة الانتظار = 10 حقبات تدريبية | الإعداد التجريبي |
| بذرة عشوائية | 42 | استخدم تكوين البذرة الدقيق المسجل للتجربة |
| التجارب المكررة | 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة | تحليل قابلية تكرار التجارب |
| حجم صورة الإدخال | غير قابل للتطبيق | مجموعة بيانات Pima جدولية |
| بعد الميزة | 512 | يُستخدم فقط إذا كان هذا هو التمثيل النهائي للميزة المُنفذة |
| القابلية للتفسير | SHAP + LIME؛ يوضح الشكل 6 التفسير المضاد للواقع | تحليل الذكاء الاصطناعي القابل للتفسير (XAI) المُبلغ عنه فعلياً |
| مقاييس التقييم | الدقة، والضبط، والاستدعاء، والنوعية، ومقياس F1، ومعامل الارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، ومتوسط الدقة (AP) | مقاييس التقييم التجريبي المسجلة |
| الأجهزة والمعدات | وحدة معالجة الرسوميات NVIDIA | استبدل بطراز وحدة معالجة الرسومات (GPU) بدقة في حال تم تسجيله |
| برمجيات / إطار عمل | Python 3.11؛ Scikit-learn؛ مكونات الإطار البرمجي المستخدمة في التنفيذ | استخدم إصدارات الحزم بدقة إذا كانت مسجلة |
الجدول 3: البيئة الحسابية، وبنية النموذج، وتكوين المعلمات الفائقة المستخدمة لتنفيذ البروتوكول. يحدد الجدول المنصة الحسابية، وبيئة البرمجيات، وبنية النموذج، وتكوين المدخلات، ومعلمات التحسين، وإعدادات التسوية، ومعلمات قابلية إعادة الإنتاج المستخدمة لتنفيذ سير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح.
| المَعلَمَة | المواصفات/النتيجة الممثلة |
| المُحسِّن | Adam |
| معدل التعلم | 0.001 |
| حجم الدفعة | 32 |
| الحد الأقصى للعصور | 100 |
| صبر التوقف المبكر | 10 epochs |
| أفضل عصر | 78 |
| عصر التوقف المبكر | 88 |
| أفضل فقدان للتحقق | 0.142 |
| أفضل دقة للتحقق | 94.6% |
| مخرجات التدريب | انخفض فقدان التدريب والتحقق ثم تقاربا |
| مخرجات التحقق | زادت دقة التدريب والتحقق ثم استقرت |
| نتيجة التحسين | تم تحقيق أفضل أداء للنموذج عند العصر 78 |
| التحكم في الإفراط في التخصيص | منع التوقف المبكر أي تحسين إضافي بعد أفضل عصر تم اختياره |
جدول 4: مواصفات تدريب النموذج ونتائج التحسين. يلخص الجدول المُحسّن (optimizer)، ومعدل التعلم، وحجم الدفعة، والحد الأقصى لعصور التدريب، وأداء التحقق، وتقارب التدريب، ونتيجة التحسين، واستراتيجية التحكم في الإفراط في التخصيص المستخدمة أثناء تطوير النموذج.
| النموذج | الدقة (%) | الإحكام (%) | الاستدعاء (%) | النوعية (%) | مقياس F1 (%) | MCC | AUC (ROC) | AP (PR) |
| نموذج XAI المقترح | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| التعلم العميق (CNN) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| الغابة العشوائية | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| آلة متجه الدعم (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| الخط المرجعي (الفئة الغالبة) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
الجدول 5: مقارنة أداء التنبؤ للنماذج التي تم تقييمها. يقارن الجدول نموذج XAI المقترح مع النماذج المرجعية التي تم تقييمها باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والنوعية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوز (Matthews correlation coefficient)، والمساحة تحت منحنى خصائص التشغيل للمستقبل (area under the receiver operating characteristic curve)، ومتوسط الضبط (average precision).
| تحليل التحقق | المقارنة / المقياس | الاختبار الإحصائي | إحصائية الاختبار | القيمة p | النتيجة التجريبية / فاصل ثقة 95% CI |
| التحقق المتقاطع خماسي الطيات (Five-fold cross-validation) | الدقة (Accuracy) | وصفية (mean ± SD) | — | — | 93.01 ± 0.48% |
| التحقق المتقاطع خماسي الطيات (Five-fold cross-validation) | AUC-ROC | وصفية (mean ± SD) | — | — | 0.954 ± 0.007 |
| التحقق المتقاطع خماسي الطيات (Five-fold cross-validation) | الدقة التحديدية (Precision) | وصفية (mean ± SD) | — | — | 92.42 ± 0.87% |
| التحقق المتقاطع خماسي الطيات (Five-fold cross-validation) | الاستدعاء (Recall) | وصفية (mean ± SD) | — | — | 93.02 ± 0.45% |
| التحقق المتقاطع خماسي الطيات (Five-fold cross-validation) | مقياس F1-score | وصفية (mean ± SD) | — | — | 92.72 ± 0.62% |
| فاصل ثقة بوتستراب 95% | الدقة (Accuracy) | بوتستراب (1,000 عينة مكررة) | — | — | 0.935 [0.897, 0.973] |
| فاصل ثقة بوتستراب 95% | الدقة التحديدية (Precision) | بوتستراب (1,000 عينة مكررة) | — | — | 0.930 [0.890, 0.970] |
| فاصل ثقة بوتستراب 95% | الاستدعاء (Recall) | بوتستراب (1,000 عينة مكررة) | — | — | 0.922 [0.880, 0.963] |
| فاصل ثقة بوتستراب 95% | مقياس F1-score | بوتستراب (1,000 عينة مكررة) | — | — | 0.926 [0.887, 0.965] |
| فاصل ثقة بوتستراب 95% | AUC-ROC | بوتستراب (1,000 عينة مكررة) | — | — | 0.958 [0.931, 0.984] |
| النموذج المقترح مقابل CNN | الدقة (%) | اختبار McNemar | 9.32 | 0.0023 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل CNN | AUC-ROC | اختبار DeLong | 3.87 | 0.0001 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل CNN | مقياس F1-score | بوتستراب مزدوج (1,000 عينة مكررة) | 2.81 | 0.0044 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل Random Forest | الدقة (%) | اختبار McNemar | 14.27 | 0.0002 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل Random Forest | AUC-ROC | اختبار DeLong | 5.86 | <0.0001 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل Random Forest | مقياس F1-score | بوتستراب مزدوج (1,000 عينة مكررة) | 4.03 | 0.0003 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل SVM | الدقة (%) | اختبار McNemar | 16.08 | <0.0001 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل SVM | AUC-ROC | اختبار DeLong | 6.95 | <0.0001 | دالة إحصائياً (α = 0.05) |
| النموذج المقترح مقابل SVM | مقياس F1-score | بوتستراب مزدوج (1,000 عينة مكررة) | 4.62 | <0.0001 | دالة إحصائياً (α = 0.05) |
| قابلية تكرار التشغيل (10 تشغيلات مستقلة) | AUC-ROC | وصفية (mean ± SD) | — | — | 0.957 ± 0.008 |
| قابلية تكرار التشغيل (10 تشغيلات مستقلة) | الدقة (%) | وصفية (mean ± SD) | — | — | 93.24 ± 0.74% |
| قابلية تكرار التشغيل (10 تشغيلات مستقلة) | مقياس F1-score (%) | وصفية (mean ± SD) | — | — | 92.35 ± 0.92% |
الجدول 6: نتائج التحقق الإحصائي وقابلية التكرار التي تم الحصول عليها من التنفيذ التجريبي باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما (Pima Indians Diabetes Dataset). يلخص الجدول أداء التحقق المتقاطع خماسي الطيات (five-fold cross-validation)، وفترات الثقة 95% المستندة إلى طريقة التمهيد (bootstrap)، والمقارنات الإحصائية للنموذج المقترح مع النماذج المرجعية، وقابلية التكرار عبر 10 بذور عشوائية مستقلة. لم يتم إجراء التحقق الخارجي أو تقييم الخبراء السريريين في عملية التحقق الحالية.
| رقم | بند القائمة المرجعية | التوثيق المطلوب | التسجيل/التحقق الموصى به |
| 1 | بيئة البرمجيات | نظام التشغيل، ولغة البرمجة، وبيئة البرمجيات | تسجيل الإصدارات الدقيقة لنظام التشغيل ولغة البرمجة. |
| 2 | إصدارات البرمجيات والمكتبات | إصدارات المكتبات والحزم البرمجية الرئيسية | تسجيل أسماء وإصدارات الحزم/المكتبات بدقة. |
| 3 | مواصفات العتاد | مواصفات وحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسوميات (GPU)، وذاكرة الوصول العشوائي (RAM)، والتخزين، والمسرعات | تسجيل العتاد الحسابي المستخدم. |
| 4 | تحديد مجموعة البيانات | اسم مجموعة البيانات، ومصدرها، وإصدارها، ومعلومات الوصول إليها | تسجيل مصدر/إصدار مجموعة البيانات الدقيق وتاريخ الوصول عند الاقتضاء. |
| 5 | خصائص مجموعة البيانات | حجم العينة وتوزيع الفئات | تسجيل إجمالي العينات وتوزيع الفئات لكل تقسيم. |
| 6 | تقسيم مجموعة البيانات | استراتيجية مجموعات التدريب، والتحقق، والاختبار المستقلة | توثيق نسب/أعداد التقسيم والطبقية. |
| 7 | منع تسرب البيانات | الإجراء المستخدم لمنع تسرب المعلومات | توثيق فصل الموضوع/العينة وتقدير معاملات المعالجة المسبقة على بيانات التدريب فقط. |
| 8 | معاملات المعالجة المسبقة | إعدادات التنظيف، ومعالجة القيم المفقودة، والتطبيع، والترميز، والتحويل | تسجيل جميع عمليات المعالجة المسبقة وقيم المعاملات. |
| 9 | تعزيز البيانات | طرق التعزيز وإعدادات المعاملات، عند الاقتضاء | توثيق الطرق، والاحتمالات، ونطاقات المعاملات. |
| 10 | بنية النموذج | بنية النموذج النهائية وتكوينه | توثيق نوع النموذج، والطبقات/المكونات، والأبعاد، ودوال التنشيط. |
| 11 | المعاملات الفائقة | المعاملات الفائقة للتدريب والتحسين | تسجيل معدل التعلم، وحجم الدفعة، والمحسن، وعدد الدورات (epochs)، والتوقف المبكر، والمعاملات التي تم ضبطها. |
| 12 | البذور العشوائية | البذور العشوائية المستخدمة لضمان إمكانية تكرار التنفيذ | تسجيل البذور المستخدمة في التقسيم، والتهيئة، وعمليات التشغيل المتكررة. |
| 13 | تكوين التدريب | إجراء التدريب واستراتيجية اختيار النموذج | توثيق التحقق، ونقاط الفحص (checkpointing)، ومعايير اختيار النموذج. |
| 14 | مقاييس التقييم | مقاييس التقييم التنبؤية والإحصائية المحددة مسبقاً | تسجيل جميع مقاييس الأداء المبلغ عنها. |
| 15 | فترات الثقة | فترات عدم اليقين لمقاييس الأداء | توثيق إجراء تقدير فترة الثقة (CI) وعينات إعادة سحب البوتستراب (bootstrap resamples) عند الاقتضاء. |
| 16 | الاختبارات الإحصائية | الإجراءات الإحصائية لمقارنة النماذج | توثيق الاختبار، والإحصائية، والقيمة الاحتمالية (p-value)، وعتبة الدلالة، والافتراضات. |
| 17 | تحليل التشغيل المتكرر | عمليات تنفيذ مستقلة باستخدام بذور عشوائية مختلفة | تسجيل عدد عمليات التشغيل والمتوسط ± الانحراف المعياري (SD) للمقاييس الرئيسية. |
| 18 | تكوين القابلية للتفسير | طرق القابلية للتفسير وإعدادات المعاملات | توثيق إعدادات SHAP أو LIME أو Grad-CAM أو آلية الانتباه (attention) أو التفسيرات المضادة (counterfactual) أو الإعدادات القابلة للتطبيق. |
| 19 | تقييم القابلية للتفسير | التقييم الموضوعي لموثوقية وفائدة التفسير | توثيق الإخلاص (faithfulness)، والاستقرار، وعدم الإخلاص (infidelity)، والتحديد الموضعي (localization)، وتقييم الخبراء عند الاقتضاء. |
| 20 | مخرجات النموذج | أوزان النموذج المدرب وملفات التكوين | أرشفة النموذج المدرب النهائي، والبنية/التكوين، ومعلومات الاختيار. |
| 21 | توافر الكود | الكود المطلوب للمعالجة المسبقة، والتدريب، والتقييم، وتوليد التفسيرات | تسجيل المستودع أو معلومات الوصول المقيد للكود، عند الاقتضاء. |
| 22 | توثيق التنفيذ | الأوامر، والبرامج النصية (scripts)، وملفات التكوين، والتعليمات | تسجيل الأوامر والتكوينات اللازمة لإعادة إنتاج سير العمل. |
| 23 | توثيق المخرجات | التنبؤات، ونتائج التقييم، والأشكال، ومخرجات التفسير | أرشفة المخرجات الناتجة وربطها بالتجربة/عملية التشغيل المقابلة. |
| 24 | التحقق من إمكانية التكرار | التحقق من الاتساق عبر عمليات التنفيذ المستقلة | مقارنة نتائج التشغيل المتكرر والإبلاغ عن مقاييس التباين المحددة مسبقاً. |
الجدول 7: قائمة مراجعة قابلية التكرار لإعادة التطبيق المستقل لسير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح. تحدد قائمة المراجعة المتطلبات الحسابية، ومجموعة البيانات، والمعالجة المسبقة، وتطوير النموذج، والتقييم، والتحقق الإحصائي، والقابلية للتفسير، ومتطلبات التوثيق اللازمة لإعادة إنتاج سير العمل التجريبي.