تم الحصول على جميع مجموعات البيانات المستخدمة في هذه الدراسة من مستودعات متاحة للجمهور ومجهولة الهوية بالكامل، بما في ذلك مستودع تعلم الآلة في UCI، وقاعدة بيانات PhysioNet MIMIC-III، ومجموعات بيانات أشعة الصدر التابعة للمعاهد الوطنية للصحة. لم يتم الوصول إلى أي معلومات مرضى معروفة. امتثلت الدراسة إلى إرشادات أخلاقيات البحث المؤسسي للتحليل الثانوي للبيانات غير المحددة المتاحة للجمهور. لم تكن هناك حاجة لموافقة مجلس مراجعة المؤسسات الرسمية لأن المشاركين البشريين لم يتم تجنيدهم مباشرة ولم يتم استخدام أي معلومات صحية محمية.
1. نظرة عامة على الأطر التجريبية
- تطوير خط أنابيب ذكاء اصطناعي (XAI) قابل للتكرار وقابل للتفسير لتحليلات الرعاية الصحية الشفافة. نظم سير العمل في طبقة البيانات، طبقة المعالجة المسبقة، طبقة النمذجة، طبقة التفسير، طبقة التقييم، وطبقة التصور.
- دمج هذه الوحدات في سير عمل موحد قادر على معالجة البيانات السريرية المنظمة، والسجلات الصحية الإلكترونية، ومجموعات بيانات التصوير الطبي.
- تأكد من أن كل وحدة تساهم في قابلية التكرار، وقابلية التفسير، وقابلية التوسع، والتنفيذ التجريبي الموحد.
- صمم البنية المعيارية لدعم تدفق البيانات المستمر وضمان أن تساهم كل مرحلة من مراحل خط الأنابيب في قابلية التكرار والتفسير والتوسع طوال سير العمل التجريبي.
2. البيئة الحاسوبية وتكوين النظام
- تثبيت التبعيات البرمجية المطلوبة قبل تنفيذ سير العمل عن طريق فتح طرفية سطر الأوامر وتشغيل الأمر التالي:
PIP install numpy pandas scikit-Learn tensorflow Shap Lime OpenCV-Python Matplotlib Seaborn
- تحقق من نجاح تثبيت جميع حزم البرمجيات وتأكد من التوافق مع إصدارات البرمجيات المدرجة في جدول المواد قبل المضي قدما في معالجة البيانات وتطوير النماذج.
- استخدم بايثون 3.11 كبيئة برمجة أساسية. قم بتثبيت وتكوين NumPy 1.26 وPandas 2.1 لمعالجة البيانات ومهام هندسة الميزات. قم بتثبيت Scikit-Learn 1.5 لتطوير وتقييم نماذج التعلم الآلي.
- تثبيت TensorFlow 2.15 لتدريب نماذج التعلم العميق والاستنتاج. قم بتثبيت SHAP 0.46 و LIME 0.2.0 لتحليل القابلية للتفسير. قم بتثبيت OpenCV 4.10 لمهام معالجة الصور. قم بتثبيت Matplotlib 3.9 و Seaborn 0.13 لعرض البيانات وتقارير النتائج. يرجى الرجوع إلى جدول المواد للحصول على المواصفات الكاملة للبرمجيات وتفاصيل التنفيذ المطلوبة لإعادة الإنتاج.
- قم بتكوين بيئة الحوسبة باستخدام محطة عمل مزودة بمعالج متعدد الأنوية، وتسريع وحدة معالجة الرسوميات (GPU)، وموارد ذاكرة كافية لاستيعاب مجموعات بيانات الرعاية الصحية الكبيرة وأحمال التعلم العميق.
- قم بتعيين بذور عشوائية ثابتة لتقسيم البيانات، وتهيئة النموذج، وإجراءات التدريب لضمان قابلية التكرار عبر عمليات التجربة. تمكين آليات التسجيل لتسجيل عمليات المعالجة المسبقة للبيانات، وتكوينات النماذج، وإعدادات المعلمات الفائقة، وإجراءات التدريب، ونتائج التقييم طوال سير العمل.
- قم بتكوين هياكل النموذج، ومعلمات التحسين، ومعدلات التعلم، وأحجام الدفعات، وإعدادات التدريب، وقيم المعاملات الفائقة وفقا للمواصفات الملخصة في الجدول 1. الالتزام بهذه الإعدادات أثناء تجارب التكرار لضمان الاتساق مع النتائج المبلغ عنها.
- الناتج المتوقع - بيئة حسابية مكتملة التكوين وقابلة للتكرار تحتوي على جميع حزم البرمجيات المطلوبة، وموارد العتاد، وآليات التسجيل، وإعدادات تكوين النموذج المتاحة لمعالجة البيانات المسبقة اللاحقة، وتطوير النماذج، وتحليل قابلية التفسير، وإجراءات التقييم.
| المكون | المعلمة | القيمة | الوصف |
| الغابة العشوائية | n_estimators | 100 | عدد الأشجار |
| الغابة العشوائية | max_depth | لا شيء | عمق الشجرة |
| XGBoost | learning_rate | 0.01 | معدل التعلم |
| XGBoost | n_estimators | 100 | الطلقات المعززة |
| سي إن إن | العصور | 25 | فترات التدريب |
| سي إن إن | batch_size | 32 | حجم الدفعة |
| سي إن إن | المحسن | آدم | خوارزمية التحسين |
| MLP | hidden_layers | 2 | عدد الطبقات المخفية |
| MLP | التفعيل | ReLU | دالة التفعيل |
| عام | train_split | 70% | نسبة بيانات التدريب |
| عام | validation_split | 15% | نسبة التحقق |
| عام | test_split | 15% | نسبة الاختبار |
الجدول 1: تفاصيل التنفيذ وتكوين المعاملات الفائقة.
يلخص هذا الجدول البيئة الحاسوبية، ومكتبات البرمجيات، وتكوينات نماذج التعلم الآلي والتعلم العميق، وإعدادات التحسين، ومعدلات التعلم، وأحجام الدفعات، ومعلمات التدريب، وقيم المعلمات الفائقة المستخدمة طوال التقييم التجريبي لإطار الذكاء الاصطناعي المقترح القابل للتفسير.
3. إعداد مجموعات البيانات ومعالجتها المسبقة
- اختر مجموعات بيانات الرعاية الصحية المتاحة للجمهور لضمان الشفافية وقابلية تكرار سير العمل التجريبي.
- استخدم أربعة سيناريوهات صحية ممثلة للتحقق من صحة الإطار المقترح: (1) تشخيص سرطان الثدي باستخدام مجموعة بيانات سرطان الثدي في ويسكونسن، (2) التنبؤ بمخاطر السكري باستخدام مجموعة بيانات مرض السكري من Pima Indians، (3) التنبؤ بالنتائج السريرية باستخدام سجلات الصحة الإلكترونية MIMIC-III، و(4) تصنيف أمراض الصدر باستخدام مجموعة بيانات الأشعة السينية للصدر التابعة للمعاهد الوطنية للصحة. اختر هذه المجموعات لتقييم الإطار عبر السجلات السريرية المنظمة، والسجلات الصحية الإلكترونية الطولية، ووسائل التصوير الطبي الشائعة في أنظمة دعم اتخاذ القرار في الرعاية الصحية.
- استيراد كل مجموعة بيانات إلى بيئة بايثون وفصل السجلات إلى ميزات الإدخال والمتغيرات المستهدفة. تنظيم البيانات السريرية المنظمة لمهام التنبؤ بالأمراض، والسجلات الصحية الإلكترونية لتحليل النتائج الطولية، ومجموعات بيانات التصوير الطبي لمهام التصنيف التشخيصي. تحقق من سلامة كل مجموعة بيانات قبل المضي قدما في عمليات المعالجة المسبقة.
- تحديد ومعالجة القيم المفقودة باستخدام تقنيات الحساب المناسبة. توحيد الميزات العددية من خلال إجراءات تكبير الميزات وتطبيره لضمان قابلية المقارنة عبر المتغيرات.
- ترميز المتغيرات التصنيفية باستخدام طرق ترميز مناسبة بناء على خصائص مجموعة البيانات. قم باختيار الميزات باستخدام تحليل الارتباط ومقاييس أهمية الميزات القائمة على النموذج لتحديد المتغيرات الأكثر صلة وتقليل أبعاد البيانات.
- قم بتغيير حجم جميع الصور الطبية إلى 224 أو 224 بكسل قبل تدريب النماذج. تطبيع قيم شدة البكسلات وفقا لمتطلبات بنية التعلم العميق المختارة. تطبيق تقنيات تعزيز البيانات، بما في ذلك تدوير الصورة والعكس الأفقي، لتحسين تعميم النموذج وتقليل الإفراط في التركيب. تحقق من جودة الصورة وتأكد من اتساق أبعاد الصورة في جميع أنحاء مجموعة البيانات.
- قيم سلامة البيانات من خلال تقييم اكتمال مجموعة البيانات، والاتساق، وتوافق الميزات. تحقق من أن جميع السجلات تم تعيينها بشكل صحيح للفئات المستهدفة المقابلة. راجع خصائص مجموعة البيانات، بما في ذلك حجم العينة، وعدد الميزات، وطريقة البيانات، كما هو موضح في الجدول 2.
- تنفيذ إجراءات التحقق الخاصة بمجموعة البيانات لضمان الدقة المنهجية وقابلية التكرار. سجل حجم العينة، توزيع الفئات، استراتيجية تقسيم التحقق من القطار والاختبار، تدابير منع التسرب، إجراءات تحسين المعلمات الفائقة، تصميم التحقق المتبادل، وبروتوكول الاختبار الخارجي لكل مجموعة بيانات. لخص إجراءات التحقق هذه في الجدول 3.
- إجراء فحوصات مراقبة الجودة للمعالجة المسبقة من خلال تقييم التعامل مع القيم المفقودة، إزالة القيم الشاذة، تحجيم الميزات، الترميز التصنيفي، حفظ توزيع الفئات، وتقسيم مجموعات البيانات. تحقق من تطبيق عمليات المعالجة المسبقة بشكل متسق عبر جميع مجموعات البيانات.
- تأكد من عدم وجود تسرب كبير للبيانات أثناء تقسيم مجموعات البيانات. راجع نتائج التحقق من صحة المعالجة المبدئية المعروضة في الشكل 1 للتأكد من أن مجموعات البيانات الموحدة قد تم توليدها لتحليلات التعلم الآلي وقابلية التفسير لاحقا.
- المخرج المتوقع - توليد مجموعات بيانات نظيفة وموحدة مع قيم مفقودة معنونة بشكل مناسب، مميزات تصنيفية مشفرة، ميزات رقمية مطبعة، وسجلات مقسمة إلى مجموعات تدريب، والتحقق من الصحة، والاختبار. تأكد من أن خصائص مجموعات البيانات، وتوزيعات الفئات، وإجراءات التحقق تتوافق مع تلك المبلغ عنها في الجدول 2 والجدول 3، وتأكيد نجاح التحقق من صحة المعالجة المبدئية كما هو موضح في الشكل 1.
| مجموعة البيانات | النوع | عينات | الميزات | الهدف |
| سرطان الثدي | الجدول | 569 | 30 | حميدة/خبيثة |
| السكري | الجدول | 768 | 8 | نتيجة مرض السكري |
| MIMIC-III | السجلات الصحية الإلكترونية | ~60,000 | المتغيرات السريرية | الموت |
| أشعة الصدر | التصوير | ~112,000 | الصور | ملصقات الأمراض |
الجدول 2: خصائص مجموعة البيانات وحالات استخدام الرعاية الصحية.
يوفر هذا الجدول ملخصا لمجموعات بيانات الرعاية الصحية المستخدمة في الدراسة، بما في ذلك نوع مجموعة البيانات، وعدد العينات، وعدد الميزات، والمتغيرات المستهدفة، ومجال تطبيق الرعاية الصحية، وحالات الاستخدام السريري المرتبطة. تشمل مجموعات البيانات السجلات السريرية المنظمة، والسجلات الصحية الإلكترونية، وبيانات التصوير الطبي لإثبات تطبيق الإطار عبر سيناريوهات تحليلات الرعاية الصحية المتنوعة.
| مجموعة البيانات | حجم العينة | توزيع الفئة | استراتيجية الانقسام | منع التسرب | البحث عن المعاملات الفائقة | التحقق المتقاطع | اختبار خارجي |
| سرطان الثدي (جامعة كاليفورنيا في كاليفورنيا، ويسكونسن) | 569 | 357 بينيجن / 212 خبيث | 70/15/15 | المعالجة المسبقة للقطار فقط | البحث الشبكي | CV طبقي 5-طي | مجموعة الاستقلاليات المستقلة |
| مرض السكري لدى هنود بيما | 768 | 500 غير مصاب بالسكري / 268 مريض سكري | 70/15/15 | المعالجة المسبقة للقطار فقط | البحث الشبكي | CV طبقي 5-طي | مجموعة الاستقلاليات المستقلة |
| التمثيل الهرفي القابل للطيران الثلاثي | 5274 | مجموعات النتائج الطبقية | 70/15/15 على مستوى المريض | الانفصال على مستوى المريض | البحث العشوائي | سيرة ذاتية على مستوى المريض بخمسة طيات | مجموعة الاستقلاليات المستقلة |
| أشعة الصدر في المعاهد الوطنية للصحة | 112120 | الالتهاب الرئوي/الطبقات الطبيعية | 70/15/15 | فصل على مستوى الصورة | البحث العشوائي | CV طبقي 5-طي | مجموعة الاستقلاليات المستقلة |
الجدول 3: التحقق على مستوى مجموعة البيانات وتصميم التجارب.
يلخص هذا الجدول منهجية التحقق المستخدمة لكل مجموعة بيانات، بما في ذلك حجم العينة، توزيع الفئات، استراتيجية تقسيم التحقق من القطار والاختبار، إجراءات منع التسرب، طرق تحسين المعاملات الفائقة، تصميم التحقق المتبادل، وبروتوكولات الاختبار الخارجية. تم تنفيذ هذه التدابير لضمان الصرامة المنهجية، وقابلية التكرار، والتقييم غير المتحيز للنموذج.

الشكل 1: التحقق من خط أنابيب معالجة البيانات المسبقة.
نتائج التحقق من صحة العمليات الرئيسية للمعالجة المسبقة التي أجريت قبل تطوير النموذج. (أ) تحليل القيمة المفقودة عبر ميزات الرعاية الصحية الممثلة. (ب) توزيع متغير عددي قبل وبعد التعامل مع القيم الشاذة. (ج) التحقق من صحة التوسع باستخدام التوحيد القياسي. (د) التحقق من صحة الترميز التصنيفي. (ه) توزيع الفئة بعد المعالجة المسبقة. (و) التحقق من تقسيم بيانات التحقق من القطار والاختبار. تؤكد هذه النتائج نجاح المعالجة المبدئية وتحضير مجموعات البيانات للنمذجة التنبؤية وتحليل القابلية للتفسير. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
4. بنية النظام لإطار العمل القابل للتفسير للذكاء الاصطناعي
- تنظيم الإطار باستخدام بنية متعددة الطبقات لتسهيل المعالجة المعيارية، وتحسين شفافية سير العمل، ودعم التنفيذ القابل لإعادة الإنتاج. قم بتكوين طبقة البيانات لاستقبال وإدارة مجموعات بيانات الرعاية الصحية الخام. توجيه جميع مجموعات البيانات الواردة عبر طبقة البيانات قبل بدء عمليات المعالجة المسبقة.
- تنفيذ إجراءات تنظيف البيانات، والتحويل، والتطبيع، وهندسة الميزات، والترميز داخل طبقة المعالجة المسبقة. تأكد من اكتمال جميع عمليات المعالجة المسبقة قبل تطوير النموذج.
- تطوير نماذج تنبؤية داخل طبقة النمذجة باستخدام خوارزميات التعلم الآلي والتعلم العميق. استخدام نماذج تعزيز تدرج القطار، الغابة العشوائية، البيرسيبترون متعدد الطبقات (MLP)، ونماذج الشبكة العصبية الالفافية (CNN) باستخدام مجموعات البيانات المعالجة مسبقا وتكوينات المعاملات الفائقة المحسنة.
- تطبيق تقنيات التفسير داخل طبقة التفسير لتفسير توقعات النموذج. توليد تفسيرات نسبية للميزات باستخدام SHAP وLIME لمجموعات البيانات المنظمة. إنشاء خرائط حرارة Grad-CAM للنماذج القائمة على الصور لرؤية المناطق التي تساهم في توقعات النموذج.
- تقييم الأداء التنبؤي وقابلية التفسير ضمن طبقة التقييم. احسب الدقة، الدقة، الاستدعاء، درجة F1، ROC-AUC، الدقة، الاستقرار، ومقاييس التقييم التي تركز على الطبيب. سجل جميع مخرجات التقييم للتحليل والتقارير اللاحقة.
- توليد مخرجات بصرية قابلة للتفسير سريريا ضمن طبقة التصور. أنشئ مخططات مقارنة الأداء، وتصورات أهمية الميزات، ومخططات ملخصة ل SHAP، وتفسيرات LIME، وخرائط حرارة Grad-CAM، ولوحات تقارير موجهة للطباء. تخزين جميع المخرجات البصرية لإدراجها في التقرير التجريبي النهائي.
- راجع بنية الإطار الكاملة الموضحة في الشكل 2 قبل المضي قدما في تنفيذ سير العمل.
- الإنتاج المتوقع - توليد نماذج تعلم آلي وتعلم عميق مدربة بالكامل، بما في ذلك تعزيز التدرج، وRandom Forest، وCNN، ومعماريات MLP. تخزين تكوينات النماذج، والمعلمات الفائقة المحسنة، وسجلات التدريب، وملفات نقاط التحقق، ومخرجات القابلية للتفسير، وتشكيلات التصور لتقييم لاحق وتحليل قابلية التفسير.

الشكل 2: بنية النظام لإطار العمل القابل للتفسير للذكاء الاصطناعي لتحليلات الرعاية الصحية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
5. تنفيذ سير العمل
- الحصول على مجموعات بيانات الرعاية الصحية من المستودعات المتاحة للجمهور وتخزين مجموعات البيانات بصيغ منظمة مناسبة لتحليل التعلم الآلي والتعلم العميق. راجع سير العمل الكامل الموضح في الشكل 3 قبل بدء الإجراء التجريبي.
- قم بتنظيف البيانات ومعالجتها المبدئية وفقا للإجراءات الموضحة في القسم 3. تطبيع المتغيرات العددية باستخدام طرق القياس المناسبة. ترميز المتغيرات التصنيفية باستخدام تقنيات الترميز المناسبة. تحديد وحساب القيم المفقودة باستخدام استراتيجيات الحساب الخاصة بمجموعة البيانات. تحقق من جودة البيانات، وتوافق الميزات مع العلامات، واكتمال مجموعة البيانات قبل المضي قدما في تطوير النموذج.
- قسم كل مجموعة بيانات إلى مجموعات تدريب، وتحقق من الصحة، واختبارات لدعم تقييم النماذج غير المتحيز. الحفاظ على توزيعات الفئات أثناء تقسيم مجموعات البيانات وتنفيذ تدابير منع التسرب حيثما كان ذلك ينطبق. احتفظ بمجموعة الاختبار حصريا للتقييم النهائي للنموذج.
- تدريب نماذج التعلم الآلي على مجموعات بيانات منظمة باستخدام خوارزميات قائمة على المجموعات، بما في ذلك تعزيز التدرج والغابة العشوائية. تدريب نماذج التعلم العميق على مجموعات بيانات التصوير باستخدام هياكل الشبكة العصبية الالتفاوية (CNN) القادرة على تعلم ميزات الصور المكانية. قم بتحديث معلمات النموذج بشكل تكراري أثناء التدريب وراقب أداء التحقق بعد كل فترة تدريب. تطبيق الإيقاف المبكر عندما يتدهور أداء التحقق أو يفشل في التحسن وفقا لمعايير التوقف المحددة مسبقا.
- تحسين المعلمات الفائقة للنموذج باستخدام استراتيجيات البحث المنهجية، بما في ذلك البحث الشبكي والبحث العشوائي. ضبط معدل التعلم، وعدد المقدرات، وعمق الشجرة، وحجم الدفعة، وعدد الفترات الزمنية (epoch)، وغيرها من المعلمات الخاصة بالنموذج حسب أداء التحقق. اختر النموذج النهائي بناء على الأداء التنبؤي وقدرة التعميم عبر مجموعات بيانات التحقق.
- تطبيق طرق التفسير بعد إكمال تدريب النماذج. توليد تفسيرات عامة باستخدام تقنيات نسبة الميزات لتحديد المتغيرات التي تساهم بشكل أكبر في توقعات النموذج. توليد تفسيرات محلية لتحليل حالات التنبؤ الفردية وتقييم سلوك النموذج على مستوى العينة. إنشاء خرائط حرارة Grad-CAM لنماذج تصنيف الصور لتسليط الضوء على المناطق من الصورة التي تساهم في النتيجة المتوقعة. احتفظ بجميع مخرجات الشرح للتحليل والتقارير لاحقا.
- تقييم الأداء التنبؤي باستخدام الدقة، والدقة، والاستدعاء، ودرجة F1، ومساحة خصائص تشغيل المستقبل تحت المنحنى (ROC-AUC). تقييم جودة الشرح باستخدام مقاييس الدقة والثبات لتقييم موثوقية الشرح واتساقها. قارن أداء النموذج عبر مجموعات البيانات وطرق التفسير لتقييم متانة الإطار وقابلية التعميم.
- توليد مخرجات التصور والتقارير التحليلية لنقل النتائج بطريقة قابلة للتفسير سريريا. أنشئ جداول مقارنة الأداء، ومخططات أهمية الميزات، وتصورات ملخصات SHAP، ومخرجات تفسير LIME، وخرائط الحرارة التكميلية التجريدية، وغيرها من التصورات ذات الصلة السريرية. راجع جميع المخرجات البصرية لضمان الوضوح والاتساق قبل التقرير.
- توثيق جميع عمليات المعالجة المسبقة، وتكوينات النماذج، وإعدادات المعاملات الفائقة، وإجراءات الشرح، واستراتيجيات التحقق، ونتائج التقييم. حافظ على سجلات تجريبية مفصلة لتسهيل قابلية التكرار والتكرار المستقل لسير العمل. تحقق من اتساق النتائج عبر عمليات التجارب المتكررة وأرشفت جميع تشوهات سير العمل للرجوع إليها مستقبلا.
- الناتج المتوقع - أنشئ نموذج تنبؤي مدرب بالكامل مع معلمات فائقة محسنة، وأوزان النماذج المحفوظة، وسجلات التدريب، ومقاييس الأداء، ومخرجات قابلية الشرح، بما في ذلك تفسيرات SHAP، وتفسيرات LIME، وخرائط الحرارة Grad-CAM. تخزين جميع النماذج الأثرية، وتقارير التقييم، ومخرجات التصور لإجراء التحليل اللاحق وتقييم قابلية التكرار.

الشكل 3: سير العمل من البداية إلى النهاية لخط أنابيب الذكاء الاصطناعي القابل للشرح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
6. تقييم النماذج وتقييم قابلية التفسير
- تقييم أداء النموذج التنبؤي باستخدام مقاييس التصنيف القياسية، بما في ذلك الدقة، الدقة، الاستدعاء، درجة F1، ومساحة خصائص تشغيل المستقبل تحت المنحنى (ROC-AUC). احسب الدقة لقياس صحة التصنيف بشكل عام.
- احسب الدقة لتقييم نسبة التنبؤات الإيجابية التي تم تحديدها بشكل صحيح. احسب الاستدعاء لتقييم قدرة النموذج على تحديد الحالات الإيجابية. احسب درجة F1 لتحقيق توازن بين الدقة والاسترجاع. احسب ROC-AUC لتقييم الأداء التمييزي عبر عتبات التصنيف المختلفة.
- تطبيق هذه المقاييس التقييمية بشكل متسق عبر جميع مجموعات البيانات وبنى النماذج لتسهيل مقارنة الأداء الموضوعي. سجل جميع القيم القياسية وحفظ نتائج التقييم للتحليل والإحصاء اللاحق والتقارير.
- تقييم أداء قابلية التفسير باستخدام مقاييس الدقة والاستقرار. حساب الدقة لتحديد مدى دقة انعكاس التفسيرات المولدة لتوقعات النماذج وسلوك اتخاذ القرار.
- احسب الاستقرار من خلال مقارنة التفسيرات المولدة من عينات إدخال مماثلة وقياس اتساق مخرجات الشرح. تحقق من أن قيم الدقة والاستقرار تفي بمعايير الجودة المحددة مسبقا قبل تفسير تفسيرات النماذج.
- قارن أداء التفسير عبر مخرجات SHAP وLIME وGrad-CAM.
- الناتج المتوقع - توليد نتائج تقييم كمية، بما في ذلك الدقة، والدقة، والاسترجاع، ودرجة F1، وROC-AUC، والدقة، ومقاييس الاستقرار. إنتاج مخرجات وتصورات للتفسير مناسبة للتقارير العلمية، وتقييم قابلية التكرار، والتفسير السريري.
7. التقييم المرتكز على الإنسان
- استقطبوا 12 متخصصا في الرعاية الصحية يتكونون 6 أطباء، 3 أطباء أشعة، و3 محللي بيانات سريرية. اختر المشاركين الذين لديهم خبرة سابقة في اتخاذ القرار السريري، أو تفسير الصور الطبية، أو تحليلات الرعاية الصحية، أو مراجعة السجلات الصحية الإلكترونية. احصل على موافقة مستنيرة من جميع المشاركين قبل بدء إجراء التقييم.
- اختر عشوائيا 100 حالة من مجموعات بيانات الاختبار بعد الانتهاء من تدريب النماذج وتحليل قابلية التفسير. تولد شرطين للتقييم لكل حالة:
- مخرجات التنبؤ فقط و
- التنبؤ مصحوبا بمعلومات القابلية للتفسير. عشوائي ترتيب عرض الحالات وظروف التقييم لتقليل تحيز العرض وتأثيرات التعلم.
- أعد نماذج تقييم موحدة تحتوي على نتائج التنبؤ، ومخرجات الشرح، واستبيانات التقييم. عرض الحالات بشكل فردي على المشاركين باستخدام واجهة تقييم معتمدة على الحاسوب.
- وجه المشاركين لمراجعة كل حالة بشكل مستقل دون مناقشة الردود مع مقيمين آخرين. السماح للمشاركين بإكمال جميع التقييمات تحت ظروف تجريبية متطابقة.
- إدارة استبيان مكون من خمس نقاط على مقياس ليكرت مقتبس من دراسات مراجعة منشورة لتقييم الذكاء الاصطناعي. وجه المشاركين لتقييم الثقة، وقابلية التفسير، وسهولة الاستخدام لكل حالة تمت مراجعتها. سجل إجابات الاستبيان إلكترونيا وتحقق من إكمال جميع عناصر الاستبيان قبل الانتقال إلى التحليل الإحصائي.
- قياس المؤشرات الموضوعية للفائدة السريرية أثناء عملية التقييم. سجل اتفاق القرار من خلال مقارنة قرارات المشاركين مع تسميات المراجع المقابلة أو نتائج الحقيقة الواقعية. احسب اتفاق القرار كنسبة من قرارات المشاركين التي تطابق النتيجة المرجعية.
- سجل وقت المراجعة لكل حالة بقياس الفاصل بين عرض القضية وتقديم الرد النهائي. احسب متوسط وقت المراجعة بشكل منفصل لشروط التنبؤ فقط والتنبؤ مع التفسير.
- احسب متوسط درجات الثقة، وقابلية التفسير، وسهولة الاستخدام عبر جميع المشاركين وحالات التقييم. قارن الدرجات التي تم الحصول عليها تحت شروط التنبؤ فقط والتنبؤ مع التفسير.
- إجراء اختبارات t مزدوجة بعد الانتهاء من جميع تقييمات المشاركين لتحديد ما إذا كانت الفروق في الثقة، وقابلية التفسير، وسهولة الاستخدام، واتفاق القرار، ووقت المراجعة ذات دلالة إحصائية. استخدم عتبة دلالة p 0.05 لجميع المقارنات الإحصائية.
- احسب فلايس كابا بعد جمع ردود جميع المشاركين لتقييم توافق المقيمين. استخدم تقييمات المشاركين المجمعة لتحديد اتساق التقييمات بين المراجعين. تفسير قيم فلايس كابا وفقا لإرشادات الاتفاقية المعتمدة وتسجيل إحصائيات الاتفاقية الناتجة.
- تلخيص التركيبة السكانية للمشاركين، منهجية التقييم، تصميم الاستبيانات، إجراءات التحليل الإحصائي، مقاييس الأداء الموضوعية، ونتائج الاتفاق بين المقيمين في الجدول 4.
- راجع مخرجات النماذج تحت كل من شروط التقييم وقارن ردود المشاركين عبر الظروف. تحقق من أن التفسيرات تحسن الثقة وقابلية التفسير وسهولة الاستخدام دون التأثير سلبا على جودة القرار.
- تأكيد اتساق تقييمات المشاركين باستخدام إحصائية فلايس كابا المحسوبة. تسجيل جميع نتائج التقييم لإجراء التقارير اللاحقة وتقييم قابلية التكرار.
- النتائج المتوقعة - توليد درجات ثقة الطبيب، وتقييمات قابلية التفسير، وتقييمات قابلية الاستخدام، ومقاييس اتفاق القرار، وإحصائيات وقت المراجعة، ونتائج اختبار t الزوجية، وإحصائيات الاتفاق بين المقيمين. أنتج أدلة كمية تصف الفائدة السريرية، وقابلية التفسير، وموثوقية إطار الذكاء الاصطناعي القابل للتفسير.
| المعلمة | القيمة |
| الخبراء | 12 |
| الأطباء | 6 |
| أطباء الأشعة | 3 |
| محللو البيانات السريرية | 3 |
| القضايا التي تمت مراجعتها | 100 |
| تصميم التقييم | عشوائي (التنبؤ فقط مقابل التنبؤ + الشرح) |
| أداة المسح | مقياس ليكيرت ذو الخمس نقاط |
| تقييم الثقة | قابلية التفسير، الثقة، سهولة الاستخدام |
| اختبار إحصائي | اختبار t المزدوج (p 0.05) |
| موثوقية بين المقيمين | فلايس كابا |
| المقاييس الموضوعية | اتفاقية القرار، وقت المراجعة |
الجدول 4: بروتوكول التقييم المتمحور حول الإنسان وتصميم تقييم الطبيب.
يقدم هذا الجدول إطار تقييم الأطباء المستخدم لتقييم قابلية التفسير والموثوقية وقابلية استخدام نظام الذكاء الاصطناعي القابل للتفسير. يتم تلخيص المعلومات المتعلقة بتركيبة المشاركين السكانية، ومنهجية مراجعة الحالة، وتصميم الاستبيانات، وإجراءات التحليل الإحصائي، وتقييم موثوقية المقيمين بين المقيمين، ومقاييس التقييم الموضوعي.
8. تقييم التحقق والتكرار
- إجراء دراسات التحقق والاستئصال لتقييم متانة وموثوقية الإطار المقترح. حدد الميزات ذات الدرجات العالية الأهمية باستخدام طرق التفسير المختارة. إزالة الميزات المهمة تدريجيا وإعادة تدريب النماذج التنبؤية بعد كل خطوة إزالة ميزة.
- قيم أداء النموذج بعد كل تجربة استئصال باستخدام الدقة والدقة والاسترجاع ودرجة F1 ومقاييس ROC-AUC. مقارنة قيم الأداء الناتجة مع أداء النموذج الأساسي لتحديد مساهمة الميزات الفردية في النتائج التنبؤية.
- تقييم استقرار التفسير من خلال توليد تفسيرات لعينات إدخال مماثلة باستخدام SHAP وLIME وGrad-CAM. قارن مخرجات التفسير عبر التقييمات المتكررة وقياس الاتساق باستخدام مقاييس الاستقرار المحددة مسبقا. تحقق من أن التفسيرات تبقى مستقرة تحت تغيرات مدخلات طفيفة وتكرار عمليات التجريب.
- سجل جميع الإجراءات التجريبية طوال سير العمل. توثيق عمليات المعالجة المسبقة للبيانات، إجراءات تقسيم مجموعات البيانات، هياكل النماذج، إعدادات المعلمات الفائقة، تكوينات التدريب، طرق التفسير، استراتيجيات التحقق، ومقاييس التقييم. تخزين جميع معلمات التكوين والمخرجات التجريبية في صيغة منظمة لتسهيل قابلية التكرار والتحقق المستقل.
- راجع جميع السجلات التجريبية لضمان الاكتمال والاتساق. تحقق من إمكانية تكرار سير العمل باستخدام الإجراءات الموثقة، وملفات التكوين، ومواصفات البرمجيات. الحفاظ على هيكل سير عمل معياري لتسهيل تكييف البروتوكول للدراسات المستقبلية ودعم التحويل إلى بروتوكول تجريبي قائم على الفيديو يتوافق مع متطلبات منهجية JoVE.
9. موارد قابلية التكرار
- نفذ جميع التجارب باستخدام بذور عشوائية ثابتة لضمان نتائج قابلة للتكرار عبر التكرار. الحفاظ على شيفرة المصدر، وسكريبتات المعالجة المسبقة، وملفات التكوين، ومواصفات البيئة، ومعلمات النموذج، وسكريبتات التصور داخل مستودع متاح للجمهور.
- توفير تعليمات مفصلة لجمع مجموعات البيانات، والمعالجة المسبقة، وتنفيذ التجارب، وتدريب النماذج، وتوليد قابلية التفسير، وإجراءات التحقق، وإعادة توليد جميع الجداول والأرقام المبلغ عنها. أرشفة جميع مكونات سير العمل المطلوبة للتكرار المستقل، بما في ذلك مواصفات البرمجيات، وسير عمل المعالجة المسبقة، وملفات التكوين، وتعليمات الوصول إلى مجموعات البيانات، ونقاط التحقق من النماذج، وأصول التصور.
- لخص موارد البرمجيات، وسير العمل المسبق، وملفات التكوين، وتعليمات الوصول إلى مجموعات البيانات، وأصول التكرار المستخدمة في جميع أنحاء الإطار في الجدول 5.
- الناتج المتوقع - أنشئ حزمة تجريبية كاملة قابلة لإعادة الإنتاج تحتوي على سكريبتات المعالجة المسبقة، ملفات التكوين، نماذج مدربة، نقاط تفتيش النماذج، مخرجات القابلية للتفسير، تقارير التحقق، تشويهات التصور، مواصفات البرمجيات، والوثائق اللازمة للتكرار المستقل والتحقق من الإطار المقترح.
| المصدر | الوصف |
| الشيفرة المصدرية | سكريبتات تنفيذ بايثون لمعالجة البيانات مسبقا، تدريب النماذج، قابلية الشرح، والتقييم |
| ملف البيئة | requirements.txt تحتوي على تبعيات الحزم وإصداراتها |
| ملفات التكوين | إعدادات بنية النماذج، المعاملات الفائقة، وتكوينات التجارب |
| بذور عشوائية ثابتة | البذور = 42 المستخدمة في التجارب القابلة للتكرار |
| تعليمات الوصول إلى مجموعة البيانات | روابط وإجراءات للحصول على مجموعات بيانات الرعاية الصحية العامة |
| سكريبتات المعالجة المسبقة | سكريبتات لتنظيف البيانات، والتطبيع، والترميز، واختيار الميزات |
| سكريبتات توليد الأشكال | نصوص لإعادة توليد جميع أشكال المخطوطات |
| سكريبتات توليد الجداول | سكريبتات لإعادة إنتاج الجداول والمقاييس المبلغ عنها |
| أمثلة على المدخلات | مجموعات بيانات نموذجية وملفات الإدخال |
| أمثلة على المخرجات | نتائج التنبؤ، والتفسيرات، وتقارير التقييم |
الجدول 5: موارد قابلية التكرار والأصول التجريبية.
يلخص هذا الجدول الموارد المقدمة لدعم قابلية إعادة الإنتاج التجريبية، بما في ذلك الشيفرة المصدرية، وسكريبتات المعالجة المسبقة، وملفات التكوين، ومواصفات البيئة، وتعليمات الوصول إلى مجموعات البيانات، وإعدادات البذرة العشوائية الثابتة، وسكريبتات توليد الأشكال، وملفات الإدخال/الإخراج النموذجية المطلوبة لإعادة إنتاج النتائج المبلغ عنها.