تم تنفيذ إطار عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) كمجموعة بيانات تمثيلية للرعاية الصحية. وقد استُخدمت مجموعة بيانات مرض السكري لدى الهنود البيما كالمجموعة الوحيدة للتحقق التجريبي، حيث تم توليد جميع النتائج التنبؤية، والنتائج المتعلقة بقابلية التفسير، والنتائج الإحصائية، ونتائج إعادة الإنتاجية من هذه المجموعة. أما المجموعات TCGA-BRCA وTCGA-UCEC وMIMIC-III وISIC 2019 وHAM10000 وOhioT1DM وBraTS 2021 فلم يتم تقييمها تجريبياً، وأُدرجت فقط كأمثلة توضح قابلية تطبيق البروتوكول العام عبر أنماط بيانات الرعاية الصحية المختلفة. وقد استُخدمت مجموعة البيانات الكاملة بعد إزالة السجلات غير الصالحة والمكررة، وإجراء عمليات المعالجة المسبقة المحددة قبل تطوير النموذج. كما قُسمت مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار باستخدام استراتيجية تقسيم طبقية محددة مسبقاً، مع الحفاظ على استقلال العينات عبر المجموعات الفرعية الثلاث لتقليل احتمالية تسرب البيانات.
تم تكوين النموذج التنبؤي باستخدام البنية والمعلمات الفائقة المحددة مسبقاً. وقد تم تدريب النموذج باستخدام مُحسِّن Adam مع معدل تعلم وحجم دفعة محددين مسبقاً لمدة تصل إلى 100 دورة تدريبية (epochs). كما طُبق نظام التوقف المبكر بناءً على خسارة التحقق، وتم الاحتفاظ بالنموذج المقابل لأفضل أداء تحقق. وبغرض تحسين إمكانية إعادة الإنتاج، تم تحديد بذور عشوائية لتقسيم مجموعة البيانات، وتهيئ النموذج، والتجارب المكررة.
تم تقييم النموذج المدرب على مجموعة اختبار مستقلة باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1 (F1-score)، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، والمتوسط الدقيق (AP). تمت مقارنة النموذج المقترح مع نماذج أساسية محددة مسبقاً باستخدام إجراءات معالجة مسبقة، وتقسيمات بيانات، وبروتوكولات تقييم متطابقة. كما تم إنشاء منحنيات خصائص تشغيل المستقبل (ROC)، ومنحنيات الضبط والاستدعاء، ومصفوفة ارتباك بناءً على تنبؤات مجموعة الاختبار المستقلة.
تم إجراء تحقق تقاطعي خماسي الطيات على بيانات التدريب لتقييم استقرار الأداء. كما تم تقدير فترات ثقة بنسبة 95% لمقاييس الأداء الرئيسية، وأجريت مقارنات إحصائية محددة مسبقاً بين النموذج المقترح والنماذج المرجعية.
أنتج التحقق المتقاطع خماسي الطيات دقة بلغت 93.01 ± 0.48%، ومنحنى خصائص عامل التشغيل للمستقبل (AUC-ROC) بمقدار 0.954 ± 0.007، ودقة تنبؤ (precision) بلغت 92.42 ± 0.87%، واسترجاعاً (recall) بنسبة 93.02 ± 0.45%، ومقياس F1-score بنسبة 92.72 ± 0.62%. وكانت فواصل الثقة بطريقة bootstrap بنسبة 95% المقدرة من 1,000 عينة متكررة هي 0.897–0.973 للدقة، و0.890–0.970 لدقة التنبؤ، و0.880–0.963 للاسترجاع، و0.887–0.965 لمقياس F1-score، و0.931–0.984 لـ AUC-ROC. أُجريت المقارنات الإحصائية مع النماذج المرجعية للشبكات العصبية التلافيفية (CNN)، والغابة العشوائية (Random Forest)، وآلات ناقل الدعم (SVM) باستخدام اختبار McNemar للدقة، واختبار DeLong لـ AUC-ROC، واختبار bootstrap المزدوج مع 1,000 عينة متكررة لمقياس F1-score.
تم تكرار إجراء التدريب والتقييم الكامل عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة. وأسفرت عمليات التشغيل المكررة عن AUC-ROC بلغت 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، ودرجة F1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبياً عبر عمليات التنفيذ المكررة. وتم تلخيص مقاييس الأداء التي تم الحصول عليها عبر عمليات التنفيذ المكررة باستخدام المتوسط والانحراف المعياري. كما تم فحص التباين عبر عمليات التشغيل لتحديد ما إذا كان أداء التنبؤ ظل مستقراً تحت التنفيذ المكرر.
لم يتم إجراء التحقق الخارجي في هذا المثال العملي نظراً لعدم استخدام مجموعة بيانات خارجية مستقلة. وبناءً على ذلك، فإن جميع النتائج التنبؤية والإحصائية ونتائج قابلية التكرار المذكورة تم الحصول عليها من مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) باستخدام أقسام التدريب والتحقق والاختبار المستقل المحددة مسبقاً. وقد تم الإبقاء على التحقق الخارجي في البروتوكول كإجراء اختياري للتطبيقات التي تتوفر فيها مجموعة بيانات مستقلة من مؤسسة أو مجموعة سكانية أو منطقة جغرافية أو فترة زمنية مختلفة.
تم إنشاء تفسيرات النماذج باستخدام تقنيات القابلية للتفسير القابلة للتطبيق على مجموعة بيانات السكري لدى الهنود البيما (Pima Indians Diabetes Dataset) الجدولية، بما في ذلك SHAP وLIME. تم تقييم أهمية الميزات العالمية، كما تم إنشاء تفسيرات محلية خاصة بكل مريض باستخدام عينات الاختبار المستبعدة. وقد سُجلت مخرجات التفسير جنباً إلى جنب مع تنبؤات النموذج وقيم الميزات المقابلة لها لتسهيل إعادة الإنتاج والتفسير اللاحق.
لأغراض الوضوح، اشتمل المثال العملي الحالي على المراحل التسع الأساسية لسير العمل المحددة في الجدول 1. وقد تم الإبقاء على التحقق الخارجي وتقييم الخبراء السريريين كـوحدات تحقق اختيارية ضمن البروتوكول العام. لم يتم إجراء التحقق الخارجي لعدم استخدام أي مجموعة بيانات خارجية مستقلة، كما لم يتم إجراء تقييم الخبراء السريريين لعدم إشراك لجنة رسمية لتقييم الخبراء في هذا المثال العملي الحالي. وبناءً على ذلك، لا تُعتبر هذه الوحدات الاختيارية جزءًا من سير العمل التجريبي المكون من تسع مراحل، ولا يتم الإبلاغ عنها كـنتائج تجريبية.
أنتجت إجراءات المعالجة المسبقة وتقسيم مجموعة البيانات مجموعة بيانات موحدة مناسبة لتطوير النموذج. حيث تمت إزالة السجلات المكررة وغير المتسقة، ومعالجة القيم المفقودة وفقاً للاستراتيجية المحددة مسبقاً، وتوحيد الميزات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية مستقلة للتدريب والتحقق والاختبار. وتلخص Table 2 خصائص مجموعة البيانات الناتجة وإجراءات المعالجة المسبقة. ويوضح Figure 2 سير عمل تحضير ومعالجة مجموعة بيانات الرعاية الصحية العامة، بينما يوضح Figure 3 سير عمل التحضير التجريبي والمعالجة المسبقة والتقسيم وتقييم الجودة المطبق خصيصاً على Pima Indians Diabetes Dataset. كما تلخص Table 3 البيئة الحسابية النهائية وبنية النموذج وتكوين المعلمات الفائقة المستخدمة لإنتاج النتائج المسجلة.
أدى تنفيذ القسمين 3 و4 إلى الحصول على مجموعة بيانات رعاية صحية موحدة ومناسبة لتطوير النموذج. وقد عملت إجراءات المعالجة المسبقة على إزالة السجلات المكررة وغير المتسقة، واستكمال القيم المفقودة، وتوحيد الميزات العددية، وتشفير المتغيرات الفئوية حيثما كان ذلك مناسباً، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار. وفرت البيانات الناتجة المدخلات الموحدة المطلوبة لتطوير النموذج لاحقاً.
بعد الانتهاء من القسمين 5 و6، أظهر النموذج الذي تم تكوينه تقارباً مستقراً أثناء التدريب. وقد أظهرت منحنيات التعلم انخفاضاً متزامناً في خسائر التدريب والتحقق، وزيادة في دقة التدريب والتحقق. كما أدى تحسين المعلمات الفائقة إلى تحسين تعميم النموذج، دون وجود دليل على حدوث فرط تخصيص جوهري. ولدعم قابلية التكرار، تم أرشفة النموذج المحسن جنباً إلى جنب مع البنية النهائية، وإعدادات المعلمات الفائقة، وإصدارات البرامج، والبذور العشوائية، وأوزان النموذج المدرب. وتلخص الجدول 4 مواصفات تدريب النموذج ونتائج التحسين، بينما تُعرض منحنيات تعلم التدريب والتحقق المقابلة في الشكل 4.
قيم القسم 7 الأداء التنبئي للنموذج باستخدام مقاييس أداء معيارية. وشملت مقاييس التصنيف التي تم تقييمها كلًا من الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، ومتوسط الدقة (AP). وتمت مقارنة النموذج المقترح بنماذج الأساس المحددة مسبقًا باستخدام نفس تقسيمات مجموعة البيانات، وإجراءات المعالجة المسبقة، وبروتوكول التقييم. ويظهر مقارنة الأداء التنبئي في الجدول 5، بينما تظهر منحنيات ROC، ومنحنيات الضبط والاستدعاء، ومصفوفة الارتباك، ومقاييس الأداء المقارنة في الشكل 5.
بعد القسم 8، تم إنشاء تفسيرات شاملة ومحلية لتنبؤات النموذج لتقييم مدى قابليته للتفسير. تم إنشاء تفسيرات النموذج باستخدام SHAP و LIME لمجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) الجدولية، كما تم تقديم تفسير مضاد للواقع خاص بمريض معين لتوضيح التغيير في التنبؤ. استُخدم SHAP لإنشاء تصورات لأهمية الميزات الشاملة، ومخططات الشلال الخاصة بكل مريض، وتصورات الاعتماد على الميزات، بينما استُخدم LIME لإنشاء تفسيرات محلية من عينات الاختبار المستبقاة. وتظهر مخرجات القابلية للتفسير المقابلة في الشكل 6.
قيمت المرحلة النهائية من البروتوكول الموثوقية الإحصائية وقابلية تكرار سير العمل. حيث تم تكرار سير العمل الكامل عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة، مع الحفاظ على نفس استراتيجية تقسيم مجموعة البيانات، ومعاملات المعالجة المسبقة، وبنية النموذج، والمعاملات الفائقة، وبيئة البرمجيات، وإجراءات التقييم. وقد أسفرت عمليات التشغيل المكررة عن AUC-ROC بقيمة 0.957 ± 0.008، ودقة بلغت 93.24 ± 0.74%، وF1-score بلغت 92.35 ± 0.92%، مما يشير إلى تباين منخفض نسبيًا عبر عمليات التنفيذ المكررة.
لم يتم تقييم استقرار التفسيرات كمياً في عملية التحقق الحالية. وبالرغم من توليد تفسيرات SHAP وLIME لمجموعة بيانات Pima Indians Diabetes، إلا أنه لم يتم إجراء تحليل منفصل لارتباط الرتب بين التشغيلات أو تحليل تداخل الميزات. وبناءً على ذلك، لم يتم تسجيل أي مقاييس عددية للتفسير أو الاستقرار أو اتفاقية الإسناد. وقد تم الإبقاء على التقييم الكمي لاستقرار التفسير في البروتوكول العام كإجراء اختياري لإعادة الإنتاجية في التطبيقات التي تتوفر فيها مخرجات تفسيرية متكررة.
تم تقييم المقارنات الإحصائية باستخدام عتبة دلالة محددة مسبقًا بقيمة p < 0.05. استُخدمت الاختبارات الإحصائية ثنائية الطرف حيثما كان ذلك مناسبًا، وتم تسجيل إحصائيات الاختبار المقابلة، وقيم p، وفترات الثقة 95% لتحديد الدلالة الإحصائية ومدى عدم اليقين في فروق الأداء الملحوظة. وتلخص الجدول 6 نتائج التحقق الإحصائي التجريبي وقابلية التكرار، بما في ذلك أداء التحقق المتقاطع، وفترات الثقة، والمقارنات الإحصائية، وتباين التشغيل المتكرر. كما تظهر التحليلات المقابلة للاختبارات الإحصائية وقابلية التكرار في الشكل 7.
قدمت هذه النتائج دليلاً تجريبياً على الاستقرار التنبؤي وقابلية التكرار في ظل الظروف الحسابية ومجموعة البيانات التي تم اختبارها. وقد تم توثيق البيئة الحسابية، وخصائص مجموعة البيانات، وإجراءات المعالجة المسبقة، وتكوين النموذج، والتحليلات الإحصائية، وإعدادات القابلية للتفسير المطلوبة لإعادة التكرار المستقل وفقاً لقائمة مراجعة قابلية التكرار الموضحة في الجدول 7. لم يتم إجراء تقييم من قبل خبراء سريريين لمخرجات الذكاء الاصطناعي القابل للتفسير (XAI) في مثال التحقق التطبيقي في هذا العمل.
بشكل عام، أدى تطبيق البروتوكول إلى إنتاج مجموعة بيانات رعاية صحية موحدة مناسبة لتطوير نماذج الذكاء الاصطناعي، ونموذج مُحسَّن باستخدام إعدادات مُحددة مسبقاً للمعلمات الفائقة. وقد أتاح سير العمل هذا تقييماً منهجياً للأداء التنبؤي، وتوليد تفسيرات للنموذج باستخدام تقنيات الذكاء الاصطناعي القابل للتفسير (XAI) المناسبة، بالإضافة إلى التقييم الإحصائي لمتانة النموذج وقابلية تكراره. وقد أثبتت النتائج مجتمعةً إمكانية تنفيذ وقابلية تكرار سير عمل XAI المقترح في ظل الظروف التجريبية التي تم تقييمها في مثال التحقق التطبيقي.

الشكل 1: سير العمل الأساسي المكون من تسع مراحل لتطوير نماذج ذكاء اصطناعي قابلة للتكرار والتفسير في مجال الرعاية الصحية. يتكون سير العمل من (1) تحديد مهمة التنبؤ في الرعاية الصحية، (2) تهيئة البيئة الحوسبية، (3) الحصول على مجموعة البيانات والتحقق من صحتها، (4) المعالجة المسبقة للبيانات، (5) تقسيم مجموعة البيانات، (6) تدريب النموذج التنبؤي، (7) تقييم الأداء التنبؤي، (8) تحليل القابلية للتفسير، و (9) التحقق الإحصائي وتقييم القابلية للتكرار. يُعتبر التحقق الخارجي وتقييم الخبراء السريريين امتدادات اختيارية للبروتوكول ولا يتم تضمينهما في سير العمل الأساسي المكون من تسع مراحل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: سير عمل إعداد ومعالجة مسبقة لمجموعة بيانات الرعاية الصحية. (أ) اكتساب بيانات الرعاية الصحية من السجلات السريرية، والتصوير الطبي، والإشارات الفسيولوجية، ومصادر البيانات متعددة الوسائط. (ب) تكامل البيانات والمعالجة المسبقة، بما في ذلك التعامل مع القيم المفقودة، والتطبيع، وإزالة الضجيج، والتعزيز. (ج) تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب، والتحقق، والاختبار. (د) تقييم الجودة الذي يوضح توزيع الفئات، وتطبيع الميزات، ومخرجات المعالجة المسبقة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: سير العمل التجريبي لتحضير مجموعة بيانات سكري الهنود البيما ومعالجتها مسبقاً وتقسيمها وتقييم جودتها. يتضمن سير العمل الحصول على مجموعة البيانات، وتقييم جودة البيانات، ومعالجة القيم غير الصالحة والمفقودة، وتوحيد الميزات العددية، وتقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار المستقل، والتحقق النهائي من الجودة قبل تطوير النموذج. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: منحنيات تعلم التدريب والتحقق التجريبية للنموذج المقترح باستخدام مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset). (أ) فقدان التدريب والتحقق عبر فترة التدريب الكاملة. (ب) دقة التدريب والتحقق عبر فترة التدريب الكاملة. (ج) عرض مكبّر للفقدان خلال الدورات من 50 إلى 100. (د) عرض مكبّر للدقة خلال الدورات من 50 إلى 100. تم الحصول على أفضل أداء تحقق عند الدورة 78، حيث بلغ فقدان التحقق 0.142 ودقة التحقق 94.6%. تم تفعيل التوقف المبكر عند الدورة 88 باستخدام فترة صبر (patience) قدرها 10 دورات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: التقييم التجريبي لأداء التنبؤ لإطار عمل XAI المقترح باستخدام مجموعة اختبار مستقلة (n = 154). (أ) منحنى خصائص تشغيل المستقبل (ROC) الذي يوضح أداء التمييز لنموذج XAI المقترح والنماذج المرجعية. (ب) منحنيات الدقة والاسترجاع (PR) التي توضح أداء الدقة والاسترجاع لنموذج XAI المقترح والنماذج المرجعية. (ج) مصفوفة الارتباك لنموذج XAI المقترح على مجموعة الاختبار المستقلة، مع الدقة والحساسية (الاسترجاع) والخصوصية المقابلة. (د) مقارنة بين الدقة، والضبط، والاسترجاع، والخصوصية، ودرجة F1-score، ومعامل ارتباط Matthews (MCC)، والمساحة تحت منحنى ROC (AUC)، ومتوسط الدقة (AP) عبر النماذج التي تم تقييمها. جميع النتائج الكمية الموضحة في هذا الشكل تعود إلى تجربة التحقق من مجموعة بيانات Pima Indians Diabetes. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: مخرجات القابلية للتفسير الناتجة عن تنبؤات مجموعة اختبار مستقلة للنموذج المقترح المدرب على مجموعة بيانات Pima Indians Diabetes. (A) مخطط ملخص SHAP العام الذي يوضح توزيع مساهمات الميزات عبر مجموعة الاختبار. (B) مخطط أهمية الميزات SHAP استناداً إلى متوسط قيم SHAP المطلقة. (C) مخطط SHAP الشلالي الخاص بمريض معين يوضح مساهمات الميزات الفردية في احتمالية الإصابة بالسكري المتوقعة. (D) تفسير LIME المحلي الذي يوضح مساهمات الميزات للمريض رقم 125 في مجموعة الاختبار. (E) مخطط اعتماد SHAP الذي يوضح العلاقة بين قيم الجلوكوز ومساهماتها في SHAP. (F) تفسير مضاد للواقع خاص بمريض معين يوضح الحد الأدنى من التغييرات في الميزات المرتبطة بتغيير في تنبؤ النموذج. الاختصارات: SHAP = Shapley Additive exPlanations؛ LIME = Local Interpretable Model-agnostic Explanations. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7: التحقق الإحصائي التجريبي وتحليل قابلية التكرار للنموذج المقترح باستخدام مجموعة بيانات السكري لدى الهنود البيما (Pima Indians Diabetes Dataset). (أ) أداء التحقق المتبادل خماسي الطيات (Five-fold cross-validation) على مجموعة التدريب. (ب) فترات الثقة بنسبة 95% بطريقة bootstrap لأداء مجموعة الاختبار المستقلة. (ج) المقارنات الإحصائية مع النماذج المرجعية، بما في ذلك الاختبار الإحصائي، وإحصائية الاختبار، والقيمة الاحتمالية (p-value)، والدلالة الإحصائية. (د) اتساق الأداء عبر 10 عمليات تشغيل مستقلة باستخدام بذور عشوائية مختلفة. استُخدم اختبار McNemar لدقة التصنيف المقترنة، واختبار DeLong لمنحنى ROC-AUC المرتبط، واختبار bootstrap المقترن مع 1,000 إعادة أخذ عينات لمقارنة مقياس F1-score. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| المرحلة | نشاط البروتوكول | المخرجات المتوقعة | حالة التنفيذ |
| 1 | اختيار والتحقق من صحة مجموعة بيانات الرعاية الصحية | مجموعة بيانات تم التحقق منها، وهدف التنبؤ، وتوزيع الفئات، ومعلومات جودة البيانات | تم التنفيذ |
| 2 | تهيئة البيئة الحسابية | الأجهزة والبرمجيات والمكتبات والإصدارات والتكوين الحسابي التي تم التحقق منها | تم التنفيذ |
| 3 | المعالجة المسبقة ومراقبة جودة بيانات الرعاية الصحية | مجموعة بيانات منقحة ومحولة وموحدة | تم التنفيذ |
| 4 | تقسيم مجموعة البيانات | مجموعات بيانات مستقلة للتدريب والتحقق والاختبار | تم التنفيذ |
| 5 | تطوير وتحسين نموذج التنبؤ/الذكاء الاصطناعي القابل للتفسير (XAI) | بنية النموذج النهائية والمعاملات الفائقة | تم التنفيذ |
| 6 | تدريب النموذج وحفظه | النموذج المدرب، ونقطة التحقق، وتكوين التدريب، والسجلات | تم التنفيذ |
| 7 | تقييم الأداء التنبؤي والحسابي | مقاييس أداء مجموعة الاختبار ومقارنات الأداء | تم التنفيذ |
| 8 | توليد وتقييم مخرجات قابلية التفسير | مخرجات SHAP/LIME ومخرجات التفسير المناسبة | تم التنفيذ |
| 9 | إجراء التحقق الإحصائي وتقييم قابلية التكرار | فترات الثقة، والاختبارات الإحصائية، ونتائج التشغيل المتكرر، ومقاييس قابلية التكرار | تم التنفيذ |
الجدول 1: ملخص لسير عمل البروتوكول الأساسي المكون من تسع مراحل والمطبق في عملية التحقق العملية باستخدام مجموعة بيانات مرض السكري لدى الهنود البيما. يميز الجدول بين المراحل التسع المنفذة في المثال العملي لمجموعة بيانات مرض السكري لدى الهنود البيما وبين التحقق الخارجي وتقييم الخبراء السريريين، واللذين تم الإبقاء عليهما كمكونات اختيارية في البروتوكول العام.
| مجموعة البيانات | مصدر البيانات | التطبيق السريري | نمط البيانات | المشاركون/السجلات | العينات | الفئات | توزيع الفئات | تدريب/تحقق/اختبار | الدور في الدراسة الحالية | حالة التحقق | رابط المصدر |
| مجموعة بيانات مرض السكري لدى هنود بِيما | مستودع جامعة كاليفورنيا إيرواين لتعلم الآلة | التنبؤ بمرض السكري | جدول سريري | ٧٦٨ سجلاً | 768 | 2 | 500 غير مصابين بداء السكري؛ 268 مصابين بداء السكري | 60% / 20% / 20% | مجموعة بيانات التحقق التجريبي الأولية | تم التنفيذ – استكمال سير العمل الأساسي المكون من تسع مراحل | https://archive.ics.uci.edu/dataset/34/pima+indians+diabetes |
| TCGA-BRCA | مركز البيانات الجينومية (GDC) التابع للمعهد الوطني للسرطان (NCI)، مشروع أطلس جينوم السرطان لسرطان الثدي (TCGA-BRCA) | تصنيف سرطان الثدي | السريري + علم الأمراض النسيجي | ١,٠٩٨ حالة | تعتمد على مجموعة البيانات وفقاً لنوع البيانات | معتمد على نقطة النهاية | لا يوجد توزيع فئوي موحد على نطاق مجموعة البيانات بأكملها | غير قابل للتطبيق - لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم يُستخدم للتحقق التجريبي | https://portal.gdc.cancer.gov/projects/TCGA-BRCA |
| TCGA-UCEC | مركز البيانات الجينومية المشترك (GDC) التابع للمعهد الوطني للسرطان (NCI)، مشروع أطلس جينوم السرطان (TCGA) لسرطان بطانة الرحم (UCEC) | تصنيف سرطان بطانة الرحم | السريرية + التشريح المرضي النسيجي | مجموعة المشروع؛ يعتمد الحجم على نوع البيانات وعوامل التصفية المختارة | تعتمد مجموعة البيانات على نوع البيانات | معتمد على نقطة النهاية | لا يوجد توزيع فئوي موحد على مستوى مجموعة البيانات بأكملها | غير قابل للتطبيق - لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | غير مُستخدم للتحقق التجريبي | https://portal.gdc.cancer.gov/projects/TCGA-UCEC |
| MIMIC-III | PhysioNet، قاعدة البيانات السريرية MIMIC-III الإصدار 1.4 | التنبؤ بالنتائج السريرية | السلاسل الزمنية السريرية | ٤٦,٥٢٠ مريضاً | ٥٨,٩٧٦ حالة دخول إلى وحدة العناية المركزة | يعتمد على المهمة | لا يوجد توزيع فئوي موحد على مستوى قاعدة البيانات بأكملها | غير قابل للتطبيق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | غير مُستخدم للتحقق التجريبي | https://physionet.org/content/mimiciii/1.4/ |
| ISIC 2019 | تحدي التعاون الدولي لتصوير الجلد (ISIC) | تصنيف الآفات الجلدية | صور التنظير الجلدي | غير قابل للتطبيق – مجموعة بيانات صور | ٢٥,٣٣١ صورة تدريبية | 8 فئات تدريبية | AKIEC 867؛ BCC 3,323؛ BKL 2,624؛ DF 239؛ MEL 4,522؛ NV 12,875؛ VASC 253؛ SCC 628 | غير قابل للتطبيق - لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | غير مُستخدم للتحقق التجريبي | https://challenge.isic-archive.com/landing/2019/ |
| HAM10000 | Harvard Dataverse / أرشيف ISIC | تصنيف الآفات الجلدية | الصور الجلدية التشخيصية | 7,470 آفة فريدة | ١٠,٠١٥ صورة | 7 | AKIEC 327؛ BCC 514؛ BKL 1,099؛ DF 115؛ MEL 1,113؛ NV 6,705؛ VASC 142 | غير ينطبق – لم يتم إجراء تقسيم تجريبي | مثال على قابلية تطبيق البروتوكول فقط | لم يُستخدم للتحقق التجريبي | توصيف وتحديد الخصائص المورفولوجية والوظيفية لشبكة الأوعية الدموية في النماذج المعتمدة على الخلايا الجذعية البشرية المستحثة متعددة القدرات (hiPSC) باستخدام التصوير المقطعي المحوسب بدقة ميكرونية (micro-CT) والتلوين المناعي الكيميائي النسيجي (IHC) |
| OhioT1DM | مجموعة بيانات OhioT1DM، الموزعة علنًا لأغراض البحث | مراقبة/التنبؤ بمرض السكري | السلاسل الزمنية السريرية | ١٢ مشاركاً | ٢٤ ملف XML موزعة عبر بيانات التدريب والتطوير والاختبار | التنبؤ المستمر بـمستوى الغلوكوز؛ وليست مهمة تصنيف ثابتة | غير قابل للتطبيق | ملفات التدريب والتطوير والاختبار المحددة بواسطة مجموعة البيانات؛ لم يتم إجراء تقسيم تجريبي هنا | مثال على قابلية تطبيق البروتوكول فقط | لم يُستخدم للتحقق التجريبي | **توصيف الخصائص المورفولوجية والوظيفية والمناعية للخلايا الجذعية الميزنكيمية المشتقة من النخاع العظمي في الأغنام**
**الملخص**
تُظهر الخلايا الجذعية الميزنكيمية (MSCs) قدرة على التمايز إلى سلالات خلوية متعددة، مما يجعلها واعدة في تطبيقات الطب التجديدي. تهدف هذه الدراسة إلى عزل وتوصيف الخلايا الجذعية الميزنكيمية المشتقة من النخاع العظمي (BMSCs) في الأغنام (*Ovis aries*) من حيث المورفولوجيا، والقدرة على التمايز، والتعبير عن المؤشرات المناعية، وذلك لضمان فعاليتها في الاستخدامات العلاجية المستقبلية.
تم عزل الخلايا من النخاع العظمي لعظم الفخذ في أغنام صحية، وتم استنباتها في وسط نمو مناسب. أظهرت الخلايا المستخلصة شكلاً مغزلياً نموذجياً والتصاقاً بسطح زراعة الخلايا. تم التحقق من القدرة على التمايز من خلال تحفيز الخلايا للتمايز إلى خلايا عظمية (osteoblasts)، وخلايا غضروفية (chondrocytes)، وخلايا دهنية (adipocytes)، حيث تم تأكيد ذلك باستخدام صبغات Alizarin Red S، و Alcian Blue، و Oil Red O على التوالي. أما من الناحية المناعية، فقد تم تحليل التعبير عن البروتينات السطحية باستخدام تقنية التدفق الخلوي (flow cytometry)، حيث أظهرت الخلايا تعبيراً إيجابياً للمؤشرات CD90 و CD105 و CD73، بينما كانت سلبية للمؤشرات CD45 و CD34. تشير هذه النتائج إلى أن الخلايا المعزولة تمتلك الخصائص الجوهرية للخلايا الجذعية الميزنكيمية، مما يجعلها نموذجاً مناسباً للدراسات المتعلقة بتجديد الأنسجة في الأغنام.
**الكلمات المفتاحية:** الخلايا الجذعية الميزنكيمية، النخاع العظمي، الأغنام، التمايز الخلوي، الواسمات المناعية، الطب التجديدي. |
| BraTS 2021 | RSNA-ASNR-MICCAI BraTS 2021؛ CBICA/جامعة بنسلفانيا | تقسيم/تصنيف أورام الدماغ | التصوير بالرنين المغناطيسي | ٢٠٤٠ حالة في مجموعة التحدي | 1,251 حالة تدريبية مشروحة؛ أربعة أنماط تصوير بالرنين المغناطيسي لكل حالة | معتمد على المهمة | لا يوجد توزيع فئوي موحد على نطاق مجموعة البيانات بأكملها | مجموعات محددة بناءً على التحدي؛ لم يتم إجراء تقسيم تجريبي هنا | مثال على قابلية تطبيق البروتوكول فقط | لم يُستخدم للتحقق التجريبي | https://www.med.upenn.edu/cbica/brats2021/ |
الجدول 2: خصائص مجموعة بيانات الرعاية الصحية وقابلية تطبيق البروتوكول المقترح. يلخص الجدول مصادر البيانات، والتطبيقات السريرية، والوسائط، وخصائص العينات، وتوزيعات الفئات، واستراتيجيات تقسيم مجموعة البيانات، وحالة التحقق، ومعلومات المصدر لمجموعات بيانات الرعاية الصحية التي تم النظر فيها في البروتوكول. وتعمل مجموعة بيانات سكري الهنود البيما (Pima Indians Diabetes Dataset) كمثال عملي أساسي للتحقق من صحة البروتوكول.
| بند التكوين | إعدادات التحقق من الصحة الفعلية المُطبقة | الحالة / التفسير |
| مجموعة البيانات | Pima Indians Diabetes Dataset | مجموعة بيانات التحقق التجريبي الفعلية |
| الخوارزمية / النموذج | نموذج تنبؤي جدولي للتصنيف الثنائي لمرض السكري | استخدم اسم البنية الدقيق من سجل التجربة إذا كان موثقًا بشكل منفصل |
| معدل التعلم | 0.001 | إعداد تجريبي |
| المحسن (Optimizer) | Adam | إعداد تجريبي |
| حجم الدفعة (Batch Size) | 32 | إعداد تجريبي |
| الحد الأقصى للعصور (Epochs) | 100 | إعداد تجريبي |
| دالة الخسارة | Cross-Entropy | إعداد تجريبي |
| دالة التنشيط | ReLU | إعداد تجريبي |
| الإسقاط (Dropout) | 0.5 | إعداد تجريبي |
| اضمحلال الوزن (Weight Decay) | 1e-4 | إعداد تجريبي |
| تطبيع الدفعات (Batch Normalization) | مُمكّن | إعداد تجريبي |
| تعزيز البيانات / موازنة الفئات | مُمكّن | حدد SMOTE فقط إذا تم تطبيقه بالفعل في التشغيل المذكور |
| استراتيجية التحقق | التحقق المتقاطع خماسي الطيات (5-fold cross-validation) | إعداد تجريبي |
| التوقف المبكر | الصبر = 10 عصور (epochs) | إعداد تجريبي |
| البذرة العشوائية | 42 | استخدم تكوين البذرة الدقيق المسجل للتجربة |
| التشغيلات المكررة | 10 تشغيلات مستقلة باستخدام بذور عشوائية مختلفة | تحليل قابلية إعادة الإنتاج التجريبي |
| حجم الصورة المدخلة | غير ينطبق | مجموعة بيانات Pima جدولية |
| أبعاد الميزات | 512 | يُستخدم فقط إذا كان هذا هو تمثيل الميزات النهائي المطبق |
| قابلية التفسير | SHAP + LIME؛ التفسير المضاد للواقع موضح في الشكل 6 | تحليل الذكاء الاصطناعي القابل للتفسير (XAI) الفعلي المذكور |
| مقاييس التقييم | الدقة (Accuracy)، الدقة التحديدية (precision)، الاستدعاء (recall)، النوعية (specificity)، مقياس F1-score، معامل ارتباط ماتيوس (MCC)، المساحة تحت منحنى خصائص التشغيل (AUC-ROC)، متوسط الدقة (AP) | مقاييس التقييم التجريبية المذكورة |
| الأجهزة | NVIDIA GPU | استبدل بـ موديل GPU الدقيق إذا كان مسجلاً |
| البرمجيات / إطار العمل | Python 3.11; Scikit-learn; مكونات إطار العمل المستخدمة في التنفيذ | استخدم إصدارات الحزم الدقيقة إذا كانت مسجلة |
الجدول 3: البيئة الحسابية، وبنية النموذج، وتكوين المعلمات الفائقة المستخدمة في تنفيذ البروتوكول. يحدد الجدول المنصة الحسابية، وبيئة البرمجيات، وبنية النموذج، وتكوين المدخلات، ومعلمات التحسين، وإعدادات التنظيم، ومعلمات قابلية التكرار المستخدمة لتنفيذ سير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح.
| المَعلَم | المواصفات أو النتيجة النموذجية |
| المُحسِّن | Adam |
| معدل التعلم | 0.001 |
| حجم الدفعة | 32 |
| الحد الأقصى لعدد الحلقات (epochs) | 100 |
| صبر التوقف المبكر | 10 epochs |
| أفضل حلقة | 78 |
| حلقة التوقف المبكر | 88 |
| أفضل فقدان للتحقق | 0.142 |
| أفضل دقة تحقق | 94.6% |
| مخرجات التدريب | انخفض فقدان التدريب والتحقق ثم تقاربا |
| مخرجات التحقق | زادت دقة التدريب والتحقق ثم استقرت |
| نتيجة التحسين | تم تحقيق أفضل أداء للنموذج عند الحلقة 78 |
| التحكم في الإفراط في التخصيص (Overfitting) | منع التوقف المبكر أي تحسين إضافي بعد أفضل حلقة مختارة |
الجدول 4: مواصفات تدريب النموذج ونتائج التحسين. يلخص الجدول المُحسن، ومعدل التعلم، وحجم الدفعة، والحد الأقصى لمرات التدريب (epochs)، وأداء التحقق، وتقارب التدريب، ونتيجة التحسين، واستراتيجية التحكم في الإفراط في التخصيص (overfitting) المستخدمة أثناء تطوير النموذج.
| نموذج | الدقة (%) | الدقة (%) | الاستدعاء (%) | النوعية (%) | مقياس F1 (%) | MCC | المساحة تحت المنحنى (منحنى خصائص تشغيل المستقبل) | البروتياز A (PR) |
| نموذج الذكاء الاصطناعي القابل للتفسير (XAI) المقترح | 93.5 | 94.5 | 92.4 | 94.6 | 93.4 | 0.87 | 0.96 | 0.94 |
| التعلم العميق (الشبكات العصبونية الالتفافية) | 89.1 | 89.8 | 88.1 | 90 | 88.9 | 0.78 | 0.92 | 0.9 |
| الغابة العشوائية | 84.3 | 85 | 83.2 | 85.7 | 84.1 | 0.67 | 0.86 | 0.81 |
| آلة متجه الدعم (SVM) | 78.6 | 79.3 | 77.1 | 80 | 78.2 | 0.54 | 0.79 | 0.72 |
| الخط المرجعي (الفئة الغالبة) | 62.1 | 62.1 | 100 | 0 | 76.6 | 0 | 0.5 | 0.5 |
الجدول 5: مقارنة أداء التنبؤ للنماذج التي تم تقييمها. يقارن الجدول نموذج XAI المقترح مع النماذج المرجعية التي تم تقييمها باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، والخصوصية (specificity)، ومقياس F1-score، ومعامل ارتباط ماتيوس (Matthews correlation coefficient)، والمساحة تحت منحنى خصائص التشغيل للمستقبل (area under the receiver operating characteristic curve)، ومتوسط الضبط (average precision).
| تحليل التحقق من الصلاحية | مقارنة / مقياس | الاختبار الإحصائي | إحصائية الاختبار | pالقيمة الاحتمالية (p-value) | النتيجة التجريبية / فاصل ثقة 95% |
| التحقق المتقاطع خماسي الطيات | الدقة | وصفي (متوسط ± الانحراف المعياري (SD) | — | — | 93.01 ± 0.48% |
| التحقق المتقاطع خماسي الطيات | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) | وصفي (المتوسط ± انحراف معياري) | — | — | 0.954 ± 0.007 |
| التحقق المتقاطع خماسي الطيات | الدقة | وصفي (متوسط ± انحراف معياري (SD) | — | — | 92.42 ± 0.87% |
| التحقق المتقاطع خماسي الطيات | الاسترجاع | وصفية (المتوسط ± الانحراف المعياري (SD) | — | — | 93.02 ± 0.45% |
| التحقق المتقاطع خماسي الطيات | مقياس F1 | وصفي (المتوسط ± انحراف معياري) | — | — | 92.72 ± 0.62% |
| فاصل ثقة بوتستراب بنسبة 95% | الدقة | إعادة التعيين العشوائي (1,000 عينة معاد سحبها) | — | — | 0.935 [0.897, 0.973] |
| فترة ثقة تعميمية بنسبة 95% | الدقة | إعادة أخذ العينات بطريقة بوتستراب (1,000 عينة مكررة) | — | — | 0.930 [0.890, 0.970] |
| فاصل ثقة بوتستراب بنسبة 95% | استرجاع | طريقة بوتستراب (1,000 عينة مُعادة السحب) | — | — | 0.922 [0.880, 0.963] |
| فاصل ثقة بوتستراب بنسبة 95% | مقياس F1 (F1-score) | إعادة التعيين العشوائي (١,٠٠٠ عينة مكررة) | — | — | 0.926 [0.887, 0.965] |
| فاصل ثقة التمهيد بنسبة 95% | المساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC) | إعادة التعيين العشوائي (1,000 عينة مكررة) | — | — | 0.958 [0.931, 0.984] |
| النموذج المقترح مقابل الشبكة العصبونية التلافيفية (CNN) | الدقة (%) | اختبار ماكنيمار | 9.32 | 0.0023 | جوهري (α = 0.05) |
| النموذج المقترح مقابل الشبكة العصبية التلافيفية (CNN) | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) | اختبار ديلونج (DeLong's test) | 3.87 | 0.0001 | جوهري (α = 0.05) |
| النموذج المقترح مقابل الشبكة العصبونية التلافيفية (CNN) | مقياس F1 (F1-score) | بوتستراب مزدوج (1,000 عينة مُعاد سحبها) | 2.81 | 0.0044 | كبير (α = 0.05) |
| النموذج المقترح مقابل الغابة العشوائية | الدقة (%) | اختبار مكنيمار | 14.27 | 0.0002 | جوهري (α = 0.05) |
| النموذج المقترح مقابل الغابة العشوائية | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) | اختبار ديلونج (DeLong's test) | 5.86 | <0.0001 | هام (α = 0.05) |
| النموذج المقترح مقابل الغابة العشوائية | مقياس F1 | تمهيد بوتستراب المزدوج (1,000 إعادة أخذ عينات) | 4.03 | 0.0003 | جوهري (α = 0.05) |
| النموذج المقترح مقابل آلة المتجهات الداعمة (SVM) | الدقة (%) | اختبار مكنمار | 16.08 | <0.0001 | جوهري (α = 0.05) |
| النموذج المقترح مقابل آلة المتجهات الداعمة (SVM) | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) | اختبار ديلونج (DeLong's test) | 6.95 | <0.0001 | جوهري (α = 0.05) |
| النموذج المقترح مقابل آلة ناقلات الدعم (SVM) | درجة F1 | تمهيد بوتستراب مقترن (1,000 إعادة أخذ عينات) | 4.62 | <0.0001 | جوهري (α = 0.05) |
| إمكانية تكرار النتائج عند التشغيل المتكرر (10 عمليات تشغيل مستقلة) | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) | وصفي (متوسط ± الانحراف المعياري (SD) | — | — | 0.957 ± 0.008 |
| قابلية تكرار التشغيلات المكررة (10 تشغيلات مستقلة) | الدقة (%) | وصفي (متوسط ± الانحراف المعياري) | — | — | 93.24 ± 0.74% |
| إمكانية تكرار التشغيل المتكرر (10 تشغيلات مستقلة) | مقياس F1 (%) | وصفية (المتوسط ± الانحراف المعياري (SD) | — | — | 92.35 ± 0.92% |
الجدول 6: نتائج التحقق الإحصائي وقابلية التكرار التي تم الحصول عليها من التنفيذ التجريبي باستخدام مجموعة بيانات Pima Indians Diabetes. يلخص الجدول أداء التحقق المتقاطع خماسي الطيات، وفترات الثقة 95% القائمة على طريقة bootstrap، والمقارنات الإحصائية للنموذج المقترح مع النماذج المرجعية، وقابلية التكرار عند التشغيل المتكرر عبر 10 بذور عشوائية مستقلة. لم يتم إجراء التحقق الخارجي أو تقييم الخبراء السريريين في عملية التحقق الحالية.
| لا. | بند قائمة التحقق | الوثائق المطلوبة | التسجيل / التحقق الموصى به |
| 1 | البيئة البرمجية | نظام التشغيل، ولغة البرمجة، وبيئة البرمجيات | سجل الإصدارات الدقيقة لنظام التشغيل ولغة البرمجة. |
| 2 | إصدارات البرمجيات والمكتبات | إصدارات مكتبات وحزم البرمجيات الرئيسية | سجّل أسماء وإصدارات الحزم والمكتبات بدقة. |
| 3 | مواصفات الأجهزة | مواصفات وحدة المعالجة المركزية (CPU)، ووحدة معالجة الرسوميات (GPU)، وذاكرة الوصول العشوائي (RAM)، وسعة التخزين، والمسرعات | سجّل الأجهزة الحاسوبية المستخدمة. |
| 4 | تحديد مجموعة البيانات | اسم مجموعة البيانات، والمصدر، والإصدار، ومعلومات الوصول | سجّل مصدر/إصدار مجموعة البيانات وتاريخ الوصول بدقة حيثما ينطبق ذلك. |
| 5 | خصائص مجموعة البيانات | حجم العينة وتوزيع الفئات | سجل إجمالي العينات وتوزيع الفئات لكل تقسيم. |
| 6 | تقسيم مجموعة البيانات | استراتيجية التدريب والتحقق ومجموعة الاختبار المستقلة | توثيق نسب/أعداد تقسيم البيانات والتقسيم الطبقي. |
| 7 | منع تسرب البيانات | الإجراء المستخدم لمنع تسريب المعلومات | فصل المستندات/العينات وتقدير معاملات المعالجة المسبقة المخصصة للتدريب فقط. |
| 8 | معايير المعالجة المسبقة | إعدادات التنظيف، ومعالجة القيم المفقودة، والتطبيع، والترميز، والتحويل | سجل جميع عمليات المعالجة المسبقة وقيم المعاملات. |
| 9 | تعزيز البيانات | طرق التعزيز وإعدادات المعاملات، عند الاقتضاء | توثيق الطرق، والاحتمالات، ونطاقات المعلمات. |
| 10 | بنية النموذج | بنية النموذج النهائية وإعداداته | قم بتوثيق نوع النموذج، والطبقات/المكونات، والأبعاد، ودوال التنشيط. |
| 11 | المعلمات الفائقة | المعلمات الفائقة للتدريب والتحسين | سجل معدل التعلم، وحجم الدفعة، والمحسن، وعدد العصور، والتوقف المبكر، والمعلمات التي تم ضبطها. |
| 12 | بذور عشوائية | بذور عشوائية مستخدمة للتنفيذ القابل للتكرار | سجّل البذور المستخدمة في التقسيم، والتهيئة الأولية، وعمليات التشغيل المتكررة. |
| 13 | تكوين التدريب | إجراء التدريب واستراتيجية اختيار النموذج | التحقق من صحة المستندات، ونقاط الفحص، ومعايير اختيار النموذج. |
| 14 | مقاييس التقييم | مقاييس التقييم الإحصائية والتنبؤية المحددة مسبقاً | سجل جميع مقاييس الأداء المُبلغ عنها. |
| 15 | فترات الثقة | فترات عدم اليقين لمقاييس الأداء | وثّق إجراء تقدير فترات الثقة (CI) وعينات إعادة سحب البوتستراب (bootstrap resamples) حيثما كان ذلك مناسباً. |
| 16 | الاختبارات الإحصائية | الإجراءات الإحصائية لمقارنة النماذج | توثيق الاختبار، والإحصائية، والقيمة الاحتمالية (p-value)، وعتبة الدلالة، والافتراضات. |
| 17 | تحليل التشغيل المتكرر | تنفيذات مستقلة باستخدام بذور عشوائية مختلفة | سجّل عدد التشغيلات والمتوسط ± الانحراف المعياري للمقاييس الرئيسية. |
| 18 | تكوين القابلية للتفسير | طرق القابلية للتفسير وإعدادات المعاملات | وثّق SHAP أو LIME أو Grad-CAM أو الانتباه (attention) أو الحالات المضادة (counterfactual) أو الإعدادات المعمول بها. |
| 19 | تقييم القابلية للتفسير | التقييم الموضوعي لموثوقية التفسير وفائدته | توثيق الدقة، والاستقرار، وعدم الدقة، والتوطين، والتقييم الخبير حيثما ينطبق ذلك. |
| 20 | الشوائب الاصطناعية للنموذج | أوزان النموذج المدربة وملفات التهيئة | أرشفة النموذج المدرب النهائي، والبنية/التكوين، ومعلومات الاختيار. |
| 21 | مدى توفر الكود البرمجي | الكود المطلوب للمعالجة المسبقة، والتدريب، والتقييم، وتوليد التفسيرات | مستودع السجلات أو معلومات الوصول المقيد إلى الكود، حيثما كان ذلك مناسباً. |
| 22 | توثيق التنفيذ | الأوامر، والنصوص البرمجية، وملفات التكوين، والتعليمات | سجّل الأوامر والتكوينات اللازمة لإعادة إنتاج سير العمل. |
| 23 | توثيق المخرجات | التنبؤات، ونتائج التقييم، والأشكال، ومخرجات الشرح | أرشفة المخرجات الناتجة وربطها بالتجربة/الدورة المقابلة. |
| 24 | التحقق من قابلية التكرار | التحقق من الاتساق عبر عمليات التنفيذ المستقلة | قارن نتائج التشغيلات المكررة وأبلغ عن مقاييس التباين المحددة مسبقاً. |
الجدول 7: قائمة مراجعة القابلية للتكرار لإعادة التنفيذ المستقل لسير عمل الذكاء الاصطناعي القابل للتفسير (XAI) المقترح. تحدد قائمة المراجعة المتطلبات الحسابية، ومجموعات البيانات، والمعالجة المسبقة، وتطوير النموذج، والتقييم، والتحقق الإحصائي، والقابلية للتفسير، ومتطلبات التوثيق اللازمة لإعادة إنتاج سير العمل التجريبي.