يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة بحثية

بروتوكول قابل للتكرار لتطوير وتقييم أطر الذكاء الاصطناعي القابلة للتفسير في تحليلات الرعاية الصحية

93 مشاهدات

DOI:

10.3791/71999

يوليو 31, 2026

في هذه المقالة

ملخص

هنا، نقدم بروتوكولا قابلا للتكرار لتطوير وتقييم نماذج الذكاء الاصطناعي القابلة للتفسير لتحليلات الرعاية الصحية. يدمج سير العمل معالجة البيانات المسبقة، والنمذجة التنبؤية، وقابلية التفسير القائمة على SHAP وLIME وGrad-CAM، والتقييم الكمي، والتحقق المتمحور حول الإنسان لدعم اتخاذ القرار السريري الشفاف والموثوق.

الملخص

يتعرف بشكل متزايد على الذكاء الاصطناعي القابل للتفسير (XAI) كأداة لا غنى عنها لبناء أنظمة ذكاء اصطناعي موثوقة في الرعاية الصحية، حيث تعد الشفافية والقدرة على شرح القرارات من المكونات الأساسية لاتخاذ القرار السريري. يقدم هذا المنشور نهجا تجريبيا قابلا لإعادة الإنتاج لتطوير وتقييم أنظمة الذكاء الاصطناعي القابلة للتفسير لتحليلات الرعاية الصحية. يدمج خط الأنابيب المطور خطوات المعالجة المسبقة للبيانات، والنمذجة التنبؤية، وتوليد التفسير، والتقييم في سير عمل واحد سلس يمكن تطبيقه على كل من البيانات السريرية المنظمة ومجموعات بيانات التصوير الطبي. أظهرت نماذج التعلم الآلي الجماعية أداء تنبؤيا قويا على مجموعات بيانات جدولية منظمة، في حين أن نماذج التعلم العميق فعالة لتعلم الأنماط المعقدة في بيانات التصوير الطبي. تقنيات مثل SHAP وLIME وGrad-CAM هي تفسيرات عالمية ومحلية تسهل تفسير النماذج. مفيد جدا. يشمل التقييم الكمي للإطار العديد من المقاييس المختلفة مثل الدقة، الدقة، الاسترجاع، درجة F1، ROC-AUC، مقاييس التفسير، الدقة، والاستقرار. تشير النتائج إلى أنه عند التحكم في الظروف التجريبية، أظهر الإطار أداء تنبؤيا وجودة تفسير أفضل في الظروف التجريبية المقيمة. كوثيقة موجهة بالبروتوكول، تدعم هذه القطعة من العمل قابلية التكرار والتوسع، والتنفيذ المستمر من قبل كائنات حية أخرى. هذا النموذج الشفاف والمفهوم للذكاء الاصطناعي هو الأساس الذي تكتسب عليه أنظمة اتخاذ القرار السريري وأنظمة تحليلات الرعاية الصحية الثقة والاستخدام على نطاق واسع.

المقدمة

أصبح الذكاء الاصطناعي (AI) مكونا مهما في الرعاية الصحية الحديثة من خلال دعم تشخيص الأمراض، والتوقعات التشخيصية، وتصنيف المخاطر، وتحليل الصور الطبية،واتخاذ القرار السريري. مكنت التطورات في التعلم الآلي والتعلم العميق أنظمة الرعاية الصحية من معالجة كميات كبيرة من البيانات المنظمة وغير المنظمة، وغالبا ما تحقق أداء تنبؤيا يقارن أو يتجاوز الأساليب الإحصائية التقليدية2. على الرغم من هذه التطورات، تعمل العديد من نماذج الذكاء الاصطناعي كأنظمة صندوق أسود معقدة، مما يصعب على الأطباء وأصحاب المصلحة في الرعاية الصحية فهم كيفية توليد التنبؤات3. هذا النقص في الشفافية يمكن أن يحد من الثقة والتبني والمساءلة في بيئات الرعاية الصحية عالية المخاطر 4,5.

برز الذكاء الاصطناعي القابل للتفسير (XAI) كنهج واعد لتحسين شفافية وقابلية تفسير نماذج التعلم الآلي6. توفر تقنيات التفسير المستخدمة على نطاق واسع، بما في ذلك SHAP (تفسيرات شابلي الإضافية)، وLIME (تفسيرات محلية غير معتمدة على النموذج)، ورسم خرائط تفعيل الفئات المرجحة بالتدرج (Grad-CAM)، رؤى حول سلوك النموذج من خلال نسب الميزات وآليات التفسير البصري7،8،9. وقد تم تطبيق هذه الطرق بشكل متزايد في تطبيقات الرعاية الصحية لدعم التفسير السريري، وتدقيق النماذج، ودعم اتخاذ القرار10,11. ومع ذلك، فإن قابلية التفسير وحدها لا تضمن الموثوقية أو التكرار أو الفائدة السريرية. سلطت الدراسات الحديثة الضوء على تحديات تتعلق بعدم استقرار التفسير، والحساسية للاضطرابات، وقلة التحقق من صحة الطبيب، والتناقضات بين مخرجات التفسير والاستدلال النموذجي الحقيقي 12,13,14,15.

بالإضافة إلى تحديات القابلية للتفسير، لا تزال قابلية التكرار مصدر قلق كبير في أبحاث تعلم الآلة في الرعاية الصحية 16,17,18. توفر العديد من الدراسات المنشورة معلومات محدودة حول إجراءات المعالجة المسبقة، وبيئات البرمجيات، وتكوينات المعاملات الفائقة، واستراتيجيات التحقق، وسير عمل التنفيذ، مما يجعل التكرار المستقل صعبا19، 20، 21. علاوة على ذلك، تركز دراسات الذكاء الاصطناعي في الرعاية الصحية غالبا على الأداء التنبؤي مع تقديم إرشادات محدودة بشأن تقييم جودة التفسير، والتقييم المرتكز على الطبيب، والاعتبارات العملية للتنفيذ22. قد تعيق هذه القيود نقل أنظمة الذكاء الاصطناعي القابلة للتفسير من بيئات البحث إلى بيئات الرعاية الصحية الواقعية 23,24,25,26,27.

غالبا ما تقيم سير العمل الحالية في الرعاية الصحية تقنيات التفسير الفردية أو النماذج التنبؤية بشكل منفصل ونادرا ما توفر بروتوكولات موحدة تدمج إعداد البيانات، والنمذجة التنبؤية، وتقييم التفسير، والتقييم المرتكز على الإنسان، وموارد التكرار 28,29,30,31. وبالتالي، قد يواجه الباحثون والممارسون صعوبات عند إعادة إنتاج سير العمل، أو مقارنة طرق التفسير، أو تقييم الفائدة العملية لأنظمة الذكاء الاصطناعي القابلة للشرح عبر مجموعات بيانات الرعاية الصحية ومجالات التطبيقات المختلفة. لذلك هناك حاجة إلى بروتوكول شامل وقابل للتكرار لتسهيل التنفيذ المتسق والتقييم والإبلاغ عن سير عمل الذكاء الاصطناعي القابل للتفسير في الرعاية الصحية32،33،34،35.

هنا، نقدم بروتوكولا قابلا للتكرار لتطوير وتقييم وتفسير أنظمة الذكاء الاصطناعي القابلة للتفسير في تحليلات الرعاية الصحية. يدمج البروتوكول معالجة البيانات المسبقة، والنمذجة التنبؤية، وتقييم قابلية التفسير باستخدام SHAP، LIME، وGrad-CAM، والتقييم المرتكز على الطبيب، وإجراءات التحقق، وموارد القابلية للتكرار ضمن سير عمل موحد. الهدف هو توفير إطار موحد يدعم تطوير النماذج الشفافة، وتقييم جودة الشرح، والتنفيذ القابل لإعادة الإنتاج عبر مجموعات بيانات صحية متنوعة 36,37,38,39. تكمن المساهمة المنهجية لهذا العمل في دمج التحليلات التنبؤية، وتقييم قابلية التفسير، والتحقق من صحة الطبيب، وممارسات القابلية للتكرار في بروتوكول واحد مناسب لأبحاث الذكاء الاصطناعي في الرعاية الصحية، والتعليم، والدراسات الموجهة للنشر 40,41,42,43.

المساهمة الأساسية لهذا العمل ليست تطوير خوارزمية جديدة لقابلية التفسير.

بل يوفر بروتوكولا موحدا وقابلا للإعادة إنتاجه ومثبتا تجريبيا يدمج النمذجة التنبؤية، وتقييم التفسير، والتصور، والتقييم، والتفسير المتمحور حول الإنسان في سير عمل موحد مناسب لتحليلات الرعاية الصحية ونشر البروتوكولات المعتمدة على JoVE. الهدف الأساسي من هذا العمل ليس تقديم خوارزمية تنبؤية جديدة، بل توفير بروتوكول موحد، قابل للتكرار، والتحقق تجريبيا لتنفيذ سير عمل الذكاء الاصطناعي القابل للتفسير في تحليلات الرعاية الصحية. يدمج البروتوكول معالجة البيانات المسبقة، والنمذجة التنبؤية، وتقييم قابلية التفسير، والتقييم المرتكز على الطبيب، وموارد القابلية للتكرار في إطار موحد مناسب للتبني والتكرار والنشر التعليمي.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

تم الحصول على جميع مجموعات البيانات المستخدمة في هذه الدراسة من مستودعات متاحة للجمهور ومجهولة الهوية بالكامل، بما في ذلك مستودع تعلم الآلة في UCI، وقاعدة بيانات PhysioNet MIMIC-III، ومجموعات بيانات أشعة الصدر التابعة للمعاهد الوطنية للصحة. لم يتم الوصول إلى أي معلومات مرضى معروفة. امتثلت الدراسة إلى إرشادات أخلاقيات البحث المؤسسي للتحليل الثانوي للبيانات غير المحددة المتاحة للجمهور. لم تكن هناك حاجة لموافقة مجلس مراجعة المؤسسات الرسمية لأن المشاركين البشريين لم يتم تجنيدهم مباشرة ولم يتم استخدام أي معلومات صحية محمية.

1. نظرة عامة على الأطر التجريبية

  1. تطوير خط أنابيب ذكاء اصطناعي (XAI) قابل للتكرار وقابل للتفسير لتحليلات الرعاية الصحية الشفافة. نظم سير العمل في طبقة البيانات، طبقة المعالجة المسبقة، طبقة النمذجة، طبقة التفسير، طبقة التقييم، وطبقة التصور.
  2. دمج هذه الوحدات في سير عمل موحد قادر على معالجة البيانات السريرية المنظمة، والسجلات الصحية الإلكترونية، ومجموعات بيانات التصوير الطبي.
  3. تأكد من أن كل وحدة تساهم في قابلية التكرار، وقابلية التفسير، وقابلية التوسع، والتنفيذ التجريبي الموحد.
  4. صمم البنية المعيارية لدعم تدفق البيانات المستمر وضمان أن تساهم كل مرحلة من مراحل خط الأنابيب في قابلية التكرار والتفسير والتوسع طوال سير العمل التجريبي.

2. البيئة الحاسوبية وتكوين النظام

  1. تثبيت التبعيات البرمجية المطلوبة قبل تنفيذ سير العمل عن طريق فتح طرفية سطر الأوامر وتشغيل الأمر التالي:
    PIP install numpy pandas scikit-Learn tensorflow Shap Lime OpenCV-Python Matplotlib Seaborn
  2. تحقق من نجاح تثبيت جميع حزم البرمجيات وتأكد من التوافق مع إصدارات البرمجيات المدرجة في جدول المواد قبل المضي قدما في معالجة البيانات وتطوير النماذج.
  3. استخدم بايثون 3.11 كبيئة برمجة أساسية. قم بتثبيت وتكوين NumPy 1.26 وPandas 2.1 لمعالجة البيانات ومهام هندسة الميزات. قم بتثبيت Scikit-Learn 1.5 لتطوير وتقييم نماذج التعلم الآلي.
  4. تثبيت TensorFlow 2.15 لتدريب نماذج التعلم العميق والاستنتاج. قم بتثبيت SHAP 0.46 و LIME 0.2.0 لتحليل القابلية للتفسير. قم بتثبيت OpenCV 4.10 لمهام معالجة الصور. قم بتثبيت Matplotlib 3.9 و Seaborn 0.13 لعرض البيانات وتقارير النتائج. يرجى الرجوع إلى جدول المواد للحصول على المواصفات الكاملة للبرمجيات وتفاصيل التنفيذ المطلوبة لإعادة الإنتاج.
  5. قم بتكوين بيئة الحوسبة باستخدام محطة عمل مزودة بمعالج متعدد الأنوية، وتسريع وحدة معالجة الرسوميات (GPU)، وموارد ذاكرة كافية لاستيعاب مجموعات بيانات الرعاية الصحية الكبيرة وأحمال التعلم العميق.
  6. قم بتعيين بذور عشوائية ثابتة لتقسيم البيانات، وتهيئة النموذج، وإجراءات التدريب لضمان قابلية التكرار عبر عمليات التجربة. تمكين آليات التسجيل لتسجيل عمليات المعالجة المسبقة للبيانات، وتكوينات النماذج، وإعدادات المعلمات الفائقة، وإجراءات التدريب، ونتائج التقييم طوال سير العمل.
  7. قم بتكوين هياكل النموذج، ومعلمات التحسين، ومعدلات التعلم، وأحجام الدفعات، وإعدادات التدريب، وقيم المعاملات الفائقة وفقا للمواصفات الملخصة في الجدول 1. الالتزام بهذه الإعدادات أثناء تجارب التكرار لضمان الاتساق مع النتائج المبلغ عنها.
  8. الناتج المتوقع - بيئة حسابية مكتملة التكوين وقابلة للتكرار تحتوي على جميع حزم البرمجيات المطلوبة، وموارد العتاد، وآليات التسجيل، وإعدادات تكوين النموذج المتاحة لمعالجة البيانات المسبقة اللاحقة، وتطوير النماذج، وتحليل قابلية التفسير، وإجراءات التقييم.
المكونالمعلمةالقيمةالوصف
الغابة العشوائيةn_estimators100عدد الأشجار
الغابة العشوائيةmax_depthلا شيءعمق الشجرة
XGBoostlearning_rate0.01معدل التعلم
XGBoostn_estimators100الطلقات المعززة
سي إن إنالعصور25فترات التدريب
سي إن إنbatch_size32حجم الدفعة
سي إن إنالمحسنآدمخوارزمية التحسين
MLPhidden_layers2عدد الطبقات المخفية
MLPالتفعيلReLUدالة التفعيل
عامtrain_split70%نسبة بيانات التدريب
عامvalidation_split15%نسبة التحقق
عامtest_split15%نسبة الاختبار

الجدول 1: تفاصيل التنفيذ وتكوين المعاملات الفائقة.

يلخص هذا الجدول البيئة الحاسوبية، ومكتبات البرمجيات، وتكوينات نماذج التعلم الآلي والتعلم العميق، وإعدادات التحسين، ومعدلات التعلم، وأحجام الدفعات، ومعلمات التدريب، وقيم المعلمات الفائقة المستخدمة طوال التقييم التجريبي لإطار الذكاء الاصطناعي المقترح القابل للتفسير.

3. إعداد مجموعات البيانات ومعالجتها المسبقة

  1. اختر مجموعات بيانات الرعاية الصحية المتاحة للجمهور لضمان الشفافية وقابلية تكرار سير العمل التجريبي.
  2. استخدم أربعة سيناريوهات صحية ممثلة للتحقق من صحة الإطار المقترح: (1) تشخيص سرطان الثدي باستخدام مجموعة بيانات سرطان الثدي في ويسكونسن، (2) التنبؤ بمخاطر السكري باستخدام مجموعة بيانات مرض السكري من Pima Indians، (3) التنبؤ بالنتائج السريرية باستخدام سجلات الصحة الإلكترونية MIMIC-III، و(4) تصنيف أمراض الصدر باستخدام مجموعة بيانات الأشعة السينية للصدر التابعة للمعاهد الوطنية للصحة. اختر هذه المجموعات لتقييم الإطار عبر السجلات السريرية المنظمة، والسجلات الصحية الإلكترونية الطولية، ووسائل التصوير الطبي الشائعة في أنظمة دعم اتخاذ القرار في الرعاية الصحية.
  3. استيراد كل مجموعة بيانات إلى بيئة بايثون وفصل السجلات إلى ميزات الإدخال والمتغيرات المستهدفة. تنظيم البيانات السريرية المنظمة لمهام التنبؤ بالأمراض، والسجلات الصحية الإلكترونية لتحليل النتائج الطولية، ومجموعات بيانات التصوير الطبي لمهام التصنيف التشخيصي. تحقق من سلامة كل مجموعة بيانات قبل المضي قدما في عمليات المعالجة المسبقة.
  4. تحديد ومعالجة القيم المفقودة باستخدام تقنيات الحساب المناسبة. توحيد الميزات العددية من خلال إجراءات تكبير الميزات وتطبيره لضمان قابلية المقارنة عبر المتغيرات.
  5. ترميز المتغيرات التصنيفية باستخدام طرق ترميز مناسبة بناء على خصائص مجموعة البيانات. قم باختيار الميزات باستخدام تحليل الارتباط ومقاييس أهمية الميزات القائمة على النموذج لتحديد المتغيرات الأكثر صلة وتقليل أبعاد البيانات.
  6. قم بتغيير حجم جميع الصور الطبية إلى 224 أو 224 بكسل قبل تدريب النماذج. تطبيع قيم شدة البكسلات وفقا لمتطلبات بنية التعلم العميق المختارة. تطبيق تقنيات تعزيز البيانات، بما في ذلك تدوير الصورة والعكس الأفقي، لتحسين تعميم النموذج وتقليل الإفراط في التركيب. تحقق من جودة الصورة وتأكد من اتساق أبعاد الصورة في جميع أنحاء مجموعة البيانات.
  7. قيم سلامة البيانات من خلال تقييم اكتمال مجموعة البيانات، والاتساق، وتوافق الميزات. تحقق من أن جميع السجلات تم تعيينها بشكل صحيح للفئات المستهدفة المقابلة. راجع خصائص مجموعة البيانات، بما في ذلك حجم العينة، وعدد الميزات، وطريقة البيانات، كما هو موضح في الجدول 2.
  8. تنفيذ إجراءات التحقق الخاصة بمجموعة البيانات لضمان الدقة المنهجية وقابلية التكرار. سجل حجم العينة، توزيع الفئات، استراتيجية تقسيم التحقق من القطار والاختبار، تدابير منع التسرب، إجراءات تحسين المعلمات الفائقة، تصميم التحقق المتبادل، وبروتوكول الاختبار الخارجي لكل مجموعة بيانات. لخص إجراءات التحقق هذه في الجدول 3.
  9. إجراء فحوصات مراقبة الجودة للمعالجة المسبقة من خلال تقييم التعامل مع القيم المفقودة، إزالة القيم الشاذة، تحجيم الميزات، الترميز التصنيفي، حفظ توزيع الفئات، وتقسيم مجموعات البيانات. تحقق من تطبيق عمليات المعالجة المسبقة بشكل متسق عبر جميع مجموعات البيانات.
  10. تأكد من عدم وجود تسرب كبير للبيانات أثناء تقسيم مجموعات البيانات. راجع نتائج التحقق من صحة المعالجة المبدئية المعروضة في الشكل 1 للتأكد من أن مجموعات البيانات الموحدة قد تم توليدها لتحليلات التعلم الآلي وقابلية التفسير لاحقا.
  11. المخرج المتوقع - توليد مجموعات بيانات نظيفة وموحدة مع قيم مفقودة معنونة بشكل مناسب، مميزات تصنيفية مشفرة، ميزات رقمية مطبعة، وسجلات مقسمة إلى مجموعات تدريب، والتحقق من الصحة، والاختبار. تأكد من أن خصائص مجموعات البيانات، وتوزيعات الفئات، وإجراءات التحقق تتوافق مع تلك المبلغ عنها في الجدول 2 والجدول 3، وتأكيد نجاح التحقق من صحة المعالجة المبدئية كما هو موضح في الشكل 1.
مجموعة البياناتالنوععيناتالميزاتالهدف
سرطان الثديالجدول56930حميدة/خبيثة
السكريالجدول7688نتيجة مرض السكري
MIMIC-IIIالسجلات الصحية الإلكترونية~60,000المتغيرات السريريةالموت
أشعة الصدرالتصوير~112,000الصورملصقات الأمراض

الجدول 2: خصائص مجموعة البيانات وحالات استخدام الرعاية الصحية.

يوفر هذا الجدول ملخصا لمجموعات بيانات الرعاية الصحية المستخدمة في الدراسة، بما في ذلك نوع مجموعة البيانات، وعدد العينات، وعدد الميزات، والمتغيرات المستهدفة، ومجال تطبيق الرعاية الصحية، وحالات الاستخدام السريري المرتبطة. تشمل مجموعات البيانات السجلات السريرية المنظمة، والسجلات الصحية الإلكترونية، وبيانات التصوير الطبي لإثبات تطبيق الإطار عبر سيناريوهات تحليلات الرعاية الصحية المتنوعة.

مجموعة البياناتحجم العينةتوزيع الفئةاستراتيجية الانقساممنع التسربالبحث عن المعاملات الفائقةالتحقق المتقاطعاختبار خارجي
سرطان الثدي (جامعة كاليفورنيا في كاليفورنيا، ويسكونسن)569357 بينيجن / 212 خبيث70/15/15المعالجة المسبقة للقطار فقطالبحث الشبكيCV طبقي 5-طيمجموعة الاستقلاليات المستقلة
مرض السكري لدى هنود بيما768500 غير مصاب بالسكري / 268 مريض سكري70/15/15المعالجة المسبقة للقطار فقطالبحث الشبكيCV طبقي 5-طيمجموعة الاستقلاليات المستقلة
التمثيل الهرفي القابل للطيران الثلاثي5274مجموعات النتائج الطبقية70/15/15 على مستوى المريضالانفصال على مستوى المريضالبحث العشوائيسيرة ذاتية على مستوى المريض بخمسة طياتمجموعة الاستقلاليات المستقلة
أشعة الصدر في المعاهد الوطنية للصحة112120الالتهاب الرئوي/الطبقات الطبيعية70/15/15فصل على مستوى الصورةالبحث العشوائيCV طبقي 5-طيمجموعة الاستقلاليات المستقلة

الجدول 3: التحقق على مستوى مجموعة البيانات وتصميم التجارب.

يلخص هذا الجدول منهجية التحقق المستخدمة لكل مجموعة بيانات، بما في ذلك حجم العينة، توزيع الفئات، استراتيجية تقسيم التحقق من القطار والاختبار، إجراءات منع التسرب، طرق تحسين المعاملات الفائقة، تصميم التحقق المتبادل، وبروتوكولات الاختبار الخارجية. تم تنفيذ هذه التدابير لضمان الصرامة المنهجية، وقابلية التكرار، والتقييم غير المتحيز للنموذج.

figure-protocol-1
الشكل 1: التحقق من خط أنابيب معالجة البيانات المسبقة.
نتائج التحقق من صحة العمليات الرئيسية للمعالجة المسبقة التي أجريت قبل تطوير النموذج. (أ) تحليل القيمة المفقودة عبر ميزات الرعاية الصحية الممثلة. (ب) توزيع متغير عددي قبل وبعد التعامل مع القيم الشاذة. (ج) التحقق من صحة التوسع باستخدام التوحيد القياسي. (د) التحقق من صحة الترميز التصنيفي. (ه) توزيع الفئة بعد المعالجة المسبقة. (و) التحقق من تقسيم بيانات التحقق من القطار والاختبار. تؤكد هذه النتائج نجاح المعالجة المبدئية وتحضير مجموعات البيانات للنمذجة التنبؤية وتحليل القابلية للتفسير. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

4. بنية النظام لإطار العمل القابل للتفسير للذكاء الاصطناعي

  1. تنظيم الإطار باستخدام بنية متعددة الطبقات لتسهيل المعالجة المعيارية، وتحسين شفافية سير العمل، ودعم التنفيذ القابل لإعادة الإنتاج. قم بتكوين طبقة البيانات لاستقبال وإدارة مجموعات بيانات الرعاية الصحية الخام. توجيه جميع مجموعات البيانات الواردة عبر طبقة البيانات قبل بدء عمليات المعالجة المسبقة.
  2. تنفيذ إجراءات تنظيف البيانات، والتحويل، والتطبيع، وهندسة الميزات، والترميز داخل طبقة المعالجة المسبقة. تأكد من اكتمال جميع عمليات المعالجة المسبقة قبل تطوير النموذج.
  3. تطوير نماذج تنبؤية داخل طبقة النمذجة باستخدام خوارزميات التعلم الآلي والتعلم العميق. استخدام نماذج تعزيز تدرج القطار، الغابة العشوائية، البيرسيبترون متعدد الطبقات (MLP)، ونماذج الشبكة العصبية الالفافية (CNN) باستخدام مجموعات البيانات المعالجة مسبقا وتكوينات المعاملات الفائقة المحسنة.
  4. تطبيق تقنيات التفسير داخل طبقة التفسير لتفسير توقعات النموذج. توليد تفسيرات نسبية للميزات باستخدام SHAP وLIME لمجموعات البيانات المنظمة. إنشاء خرائط حرارة Grad-CAM للنماذج القائمة على الصور لرؤية المناطق التي تساهم في توقعات النموذج.
  5. تقييم الأداء التنبؤي وقابلية التفسير ضمن طبقة التقييم. احسب الدقة، الدقة، الاستدعاء، درجة F1، ROC-AUC، الدقة، الاستقرار، ومقاييس التقييم التي تركز على الطبيب. سجل جميع مخرجات التقييم للتحليل والتقارير اللاحقة.
  6. توليد مخرجات بصرية قابلة للتفسير سريريا ضمن طبقة التصور. أنشئ مخططات مقارنة الأداء، وتصورات أهمية الميزات، ومخططات ملخصة ل SHAP، وتفسيرات LIME، وخرائط حرارة Grad-CAM، ولوحات تقارير موجهة للطباء. تخزين جميع المخرجات البصرية لإدراجها في التقرير التجريبي النهائي.
  7. راجع بنية الإطار الكاملة الموضحة في الشكل 2 قبل المضي قدما في تنفيذ سير العمل.
  8. الإنتاج المتوقع - توليد نماذج تعلم آلي وتعلم عميق مدربة بالكامل، بما في ذلك تعزيز التدرج، وRandom Forest، وCNN، ومعماريات MLP. تخزين تكوينات النماذج، والمعلمات الفائقة المحسنة، وسجلات التدريب، وملفات نقاط التحقق، ومخرجات القابلية للتفسير، وتشكيلات التصور لتقييم لاحق وتحليل قابلية التفسير.

figure-protocol-2
الشكل 2: بنية النظام لإطار العمل القابل للتفسير للذكاء الاصطناعي لتحليلات الرعاية الصحية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

5. تنفيذ سير العمل

  1. الحصول على مجموعات بيانات الرعاية الصحية من المستودعات المتاحة للجمهور وتخزين مجموعات البيانات بصيغ منظمة مناسبة لتحليل التعلم الآلي والتعلم العميق. راجع سير العمل الكامل الموضح في الشكل 3 قبل بدء الإجراء التجريبي.
  2. قم بتنظيف البيانات ومعالجتها المبدئية وفقا للإجراءات الموضحة في القسم 3. تطبيع المتغيرات العددية باستخدام طرق القياس المناسبة. ترميز المتغيرات التصنيفية باستخدام تقنيات الترميز المناسبة. تحديد وحساب القيم المفقودة باستخدام استراتيجيات الحساب الخاصة بمجموعة البيانات. تحقق من جودة البيانات، وتوافق الميزات مع العلامات، واكتمال مجموعة البيانات قبل المضي قدما في تطوير النموذج.
  3. قسم كل مجموعة بيانات إلى مجموعات تدريب، وتحقق من الصحة، واختبارات لدعم تقييم النماذج غير المتحيز. الحفاظ على توزيعات الفئات أثناء تقسيم مجموعات البيانات وتنفيذ تدابير منع التسرب حيثما كان ذلك ينطبق. احتفظ بمجموعة الاختبار حصريا للتقييم النهائي للنموذج.
  4. تدريب نماذج التعلم الآلي على مجموعات بيانات منظمة باستخدام خوارزميات قائمة على المجموعات، بما في ذلك تعزيز التدرج والغابة العشوائية. تدريب نماذج التعلم العميق على مجموعات بيانات التصوير باستخدام هياكل الشبكة العصبية الالتفاوية (CNN) القادرة على تعلم ميزات الصور المكانية. قم بتحديث معلمات النموذج بشكل تكراري أثناء التدريب وراقب أداء التحقق بعد كل فترة تدريب. تطبيق الإيقاف المبكر عندما يتدهور أداء التحقق أو يفشل في التحسن وفقا لمعايير التوقف المحددة مسبقا.
  5. تحسين المعلمات الفائقة للنموذج باستخدام استراتيجيات البحث المنهجية، بما في ذلك البحث الشبكي والبحث العشوائي. ضبط معدل التعلم، وعدد المقدرات، وعمق الشجرة، وحجم الدفعة، وعدد الفترات الزمنية (epoch)، وغيرها من المعلمات الخاصة بالنموذج حسب أداء التحقق. اختر النموذج النهائي بناء على الأداء التنبؤي وقدرة التعميم عبر مجموعات بيانات التحقق.
  6. تطبيق طرق التفسير بعد إكمال تدريب النماذج. توليد تفسيرات عامة باستخدام تقنيات نسبة الميزات لتحديد المتغيرات التي تساهم بشكل أكبر في توقعات النموذج. توليد تفسيرات محلية لتحليل حالات التنبؤ الفردية وتقييم سلوك النموذج على مستوى العينة. إنشاء خرائط حرارة Grad-CAM لنماذج تصنيف الصور لتسليط الضوء على المناطق من الصورة التي تساهم في النتيجة المتوقعة. احتفظ بجميع مخرجات الشرح للتحليل والتقارير لاحقا.
  7. تقييم الأداء التنبؤي باستخدام الدقة، والدقة، والاستدعاء، ودرجة F1، ومساحة خصائص تشغيل المستقبل تحت المنحنى (ROC-AUC). تقييم جودة الشرح باستخدام مقاييس الدقة والثبات لتقييم موثوقية الشرح واتساقها. قارن أداء النموذج عبر مجموعات البيانات وطرق التفسير لتقييم متانة الإطار وقابلية التعميم.
  8. توليد مخرجات التصور والتقارير التحليلية لنقل النتائج بطريقة قابلة للتفسير سريريا. أنشئ جداول مقارنة الأداء، ومخططات أهمية الميزات، وتصورات ملخصات SHAP، ومخرجات تفسير LIME، وخرائط الحرارة التكميلية التجريدية، وغيرها من التصورات ذات الصلة السريرية. راجع جميع المخرجات البصرية لضمان الوضوح والاتساق قبل التقرير.
  9. توثيق جميع عمليات المعالجة المسبقة، وتكوينات النماذج، وإعدادات المعاملات الفائقة، وإجراءات الشرح، واستراتيجيات التحقق، ونتائج التقييم. حافظ على سجلات تجريبية مفصلة لتسهيل قابلية التكرار والتكرار المستقل لسير العمل. تحقق من اتساق النتائج عبر عمليات التجارب المتكررة وأرشفت جميع تشوهات سير العمل للرجوع إليها مستقبلا.
  10. الناتج المتوقع - أنشئ نموذج تنبؤي مدرب بالكامل مع معلمات فائقة محسنة، وأوزان النماذج المحفوظة، وسجلات التدريب، ومقاييس الأداء، ومخرجات قابلية الشرح، بما في ذلك تفسيرات SHAP، وتفسيرات LIME، وخرائط الحرارة Grad-CAM. تخزين جميع النماذج الأثرية، وتقارير التقييم، ومخرجات التصور لإجراء التحليل اللاحق وتقييم قابلية التكرار.

figure-protocol-3
الشكل 3: سير العمل من البداية إلى النهاية لخط أنابيب الذكاء الاصطناعي القابل للشرح. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

6. تقييم النماذج وتقييم قابلية التفسير

  1. تقييم أداء النموذج التنبؤي باستخدام مقاييس التصنيف القياسية، بما في ذلك الدقة، الدقة، الاستدعاء، درجة F1، ومساحة خصائص تشغيل المستقبل تحت المنحنى (ROC-AUC). احسب الدقة لقياس صحة التصنيف بشكل عام.
  2. احسب الدقة لتقييم نسبة التنبؤات الإيجابية التي تم تحديدها بشكل صحيح. احسب الاستدعاء لتقييم قدرة النموذج على تحديد الحالات الإيجابية. احسب درجة F1 لتحقيق توازن بين الدقة والاسترجاع. احسب ROC-AUC لتقييم الأداء التمييزي عبر عتبات التصنيف المختلفة.
  3. تطبيق هذه المقاييس التقييمية بشكل متسق عبر جميع مجموعات البيانات وبنى النماذج لتسهيل مقارنة الأداء الموضوعي. سجل جميع القيم القياسية وحفظ نتائج التقييم للتحليل والإحصاء اللاحق والتقارير.
  4. تقييم أداء قابلية التفسير باستخدام مقاييس الدقة والاستقرار. حساب الدقة لتحديد مدى دقة انعكاس التفسيرات المولدة لتوقعات النماذج وسلوك اتخاذ القرار.
  5. احسب الاستقرار من خلال مقارنة التفسيرات المولدة من عينات إدخال مماثلة وقياس اتساق مخرجات الشرح. تحقق من أن قيم الدقة والاستقرار تفي بمعايير الجودة المحددة مسبقا قبل تفسير تفسيرات النماذج.
  6. قارن أداء التفسير عبر مخرجات SHAP وLIME وGrad-CAM.
  7. الناتج المتوقع - توليد نتائج تقييم كمية، بما في ذلك الدقة، والدقة، والاسترجاع، ودرجة F1، وROC-AUC، والدقة، ومقاييس الاستقرار. إنتاج مخرجات وتصورات للتفسير مناسبة للتقارير العلمية، وتقييم قابلية التكرار، والتفسير السريري.

7. التقييم المرتكز على الإنسان

  1. استقطبوا 12 متخصصا في الرعاية الصحية يتكونون 6 أطباء، 3 أطباء أشعة، و3 محللي بيانات سريرية. اختر المشاركين الذين لديهم خبرة سابقة في اتخاذ القرار السريري، أو تفسير الصور الطبية، أو تحليلات الرعاية الصحية، أو مراجعة السجلات الصحية الإلكترونية. احصل على موافقة مستنيرة من جميع المشاركين قبل بدء إجراء التقييم.
  2. اختر عشوائيا 100 حالة من مجموعات بيانات الاختبار بعد الانتهاء من تدريب النماذج وتحليل قابلية التفسير. تولد شرطين للتقييم لكل حالة:
    1. مخرجات التنبؤ فقط و
    2. التنبؤ مصحوبا بمعلومات القابلية للتفسير. عشوائي ترتيب عرض الحالات وظروف التقييم لتقليل تحيز العرض وتأثيرات التعلم.
  3. أعد نماذج تقييم موحدة تحتوي على نتائج التنبؤ، ومخرجات الشرح، واستبيانات التقييم. عرض الحالات بشكل فردي على المشاركين باستخدام واجهة تقييم معتمدة على الحاسوب.
  4. وجه المشاركين لمراجعة كل حالة بشكل مستقل دون مناقشة الردود مع مقيمين آخرين. السماح للمشاركين بإكمال جميع التقييمات تحت ظروف تجريبية متطابقة.
  5. إدارة استبيان مكون من خمس نقاط على مقياس ليكرت مقتبس من دراسات مراجعة منشورة لتقييم الذكاء الاصطناعي. وجه المشاركين لتقييم الثقة، وقابلية التفسير، وسهولة الاستخدام لكل حالة تمت مراجعتها. سجل إجابات الاستبيان إلكترونيا وتحقق من إكمال جميع عناصر الاستبيان قبل الانتقال إلى التحليل الإحصائي.
  6. قياس المؤشرات الموضوعية للفائدة السريرية أثناء عملية التقييم. سجل اتفاق القرار من خلال مقارنة قرارات المشاركين مع تسميات المراجع المقابلة أو نتائج الحقيقة الواقعية. احسب اتفاق القرار كنسبة من قرارات المشاركين التي تطابق النتيجة المرجعية.
  7. سجل وقت المراجعة لكل حالة بقياس الفاصل بين عرض القضية وتقديم الرد النهائي. احسب متوسط وقت المراجعة بشكل منفصل لشروط التنبؤ فقط والتنبؤ مع التفسير.
  8. احسب متوسط درجات الثقة، وقابلية التفسير، وسهولة الاستخدام عبر جميع المشاركين وحالات التقييم. قارن الدرجات التي تم الحصول عليها تحت شروط التنبؤ فقط والتنبؤ مع التفسير.
  9. إجراء اختبارات t مزدوجة بعد الانتهاء من جميع تقييمات المشاركين لتحديد ما إذا كانت الفروق في الثقة، وقابلية التفسير، وسهولة الاستخدام، واتفاق القرار، ووقت المراجعة ذات دلالة إحصائية. استخدم عتبة دلالة p 0.05 لجميع المقارنات الإحصائية.
  10. احسب فلايس كابا بعد جمع ردود جميع المشاركين لتقييم توافق المقيمين. استخدم تقييمات المشاركين المجمعة لتحديد اتساق التقييمات بين المراجعين. تفسير قيم فلايس كابا وفقا لإرشادات الاتفاقية المعتمدة وتسجيل إحصائيات الاتفاقية الناتجة.
  11. تلخيص التركيبة السكانية للمشاركين، منهجية التقييم، تصميم الاستبيانات، إجراءات التحليل الإحصائي، مقاييس الأداء الموضوعية، ونتائج الاتفاق بين المقيمين في الجدول 4.
  12. راجع مخرجات النماذج تحت كل من شروط التقييم وقارن ردود المشاركين عبر الظروف. تحقق من أن التفسيرات تحسن الثقة وقابلية التفسير وسهولة الاستخدام دون التأثير سلبا على جودة القرار.
  13. تأكيد اتساق تقييمات المشاركين باستخدام إحصائية فلايس كابا المحسوبة. تسجيل جميع نتائج التقييم لإجراء التقارير اللاحقة وتقييم قابلية التكرار.
  14. النتائج المتوقعة - توليد درجات ثقة الطبيب، وتقييمات قابلية التفسير، وتقييمات قابلية الاستخدام، ومقاييس اتفاق القرار، وإحصائيات وقت المراجعة، ونتائج اختبار t الزوجية، وإحصائيات الاتفاق بين المقيمين. أنتج أدلة كمية تصف الفائدة السريرية، وقابلية التفسير، وموثوقية إطار الذكاء الاصطناعي القابل للتفسير.
المعلمةالقيمة
الخبراء12
الأطباء6
أطباء الأشعة3
محللو البيانات السريرية3
القضايا التي تمت مراجعتها100
تصميم التقييمعشوائي (التنبؤ فقط مقابل التنبؤ + الشرح)
أداة المسحمقياس ليكيرت ذو الخمس نقاط
تقييم الثقةقابلية التفسير، الثقة، سهولة الاستخدام
اختبار إحصائياختبار t المزدوج (p 0.05)
موثوقية بين المقيمينفلايس كابا
المقاييس الموضوعيةاتفاقية القرار، وقت المراجعة

الجدول 4: بروتوكول التقييم المتمحور حول الإنسان وتصميم تقييم الطبيب.

يقدم هذا الجدول إطار تقييم الأطباء المستخدم لتقييم قابلية التفسير والموثوقية وقابلية استخدام نظام الذكاء الاصطناعي القابل للتفسير. يتم تلخيص المعلومات المتعلقة بتركيبة المشاركين السكانية، ومنهجية مراجعة الحالة، وتصميم الاستبيانات، وإجراءات التحليل الإحصائي، وتقييم موثوقية المقيمين بين المقيمين، ومقاييس التقييم الموضوعي.

8. تقييم التحقق والتكرار

  1. إجراء دراسات التحقق والاستئصال لتقييم متانة وموثوقية الإطار المقترح. حدد الميزات ذات الدرجات العالية الأهمية باستخدام طرق التفسير المختارة. إزالة الميزات المهمة تدريجيا وإعادة تدريب النماذج التنبؤية بعد كل خطوة إزالة ميزة.
  2. قيم أداء النموذج بعد كل تجربة استئصال باستخدام الدقة والدقة والاسترجاع ودرجة F1 ومقاييس ROC-AUC. مقارنة قيم الأداء الناتجة مع أداء النموذج الأساسي لتحديد مساهمة الميزات الفردية في النتائج التنبؤية.
  3. تقييم استقرار التفسير من خلال توليد تفسيرات لعينات إدخال مماثلة باستخدام SHAP وLIME وGrad-CAM. قارن مخرجات التفسير عبر التقييمات المتكررة وقياس الاتساق باستخدام مقاييس الاستقرار المحددة مسبقا. تحقق من أن التفسيرات تبقى مستقرة تحت تغيرات مدخلات طفيفة وتكرار عمليات التجريب.
  4. سجل جميع الإجراءات التجريبية طوال سير العمل. توثيق عمليات المعالجة المسبقة للبيانات، إجراءات تقسيم مجموعات البيانات، هياكل النماذج، إعدادات المعلمات الفائقة، تكوينات التدريب، طرق التفسير، استراتيجيات التحقق، ومقاييس التقييم. تخزين جميع معلمات التكوين والمخرجات التجريبية في صيغة منظمة لتسهيل قابلية التكرار والتحقق المستقل.
  5. راجع جميع السجلات التجريبية لضمان الاكتمال والاتساق. تحقق من إمكانية تكرار سير العمل باستخدام الإجراءات الموثقة، وملفات التكوين، ومواصفات البرمجيات. الحفاظ على هيكل سير عمل معياري لتسهيل تكييف البروتوكول للدراسات المستقبلية ودعم التحويل إلى بروتوكول تجريبي قائم على الفيديو يتوافق مع متطلبات منهجية JoVE.

9. موارد قابلية التكرار

  1. نفذ جميع التجارب باستخدام بذور عشوائية ثابتة لضمان نتائج قابلة للتكرار عبر التكرار. الحفاظ على شيفرة المصدر، وسكريبتات المعالجة المسبقة، وملفات التكوين، ومواصفات البيئة، ومعلمات النموذج، وسكريبتات التصور داخل مستودع متاح للجمهور.
  2. توفير تعليمات مفصلة لجمع مجموعات البيانات، والمعالجة المسبقة، وتنفيذ التجارب، وتدريب النماذج، وتوليد قابلية التفسير، وإجراءات التحقق، وإعادة توليد جميع الجداول والأرقام المبلغ عنها. أرشفة جميع مكونات سير العمل المطلوبة للتكرار المستقل، بما في ذلك مواصفات البرمجيات، وسير عمل المعالجة المسبقة، وملفات التكوين، وتعليمات الوصول إلى مجموعات البيانات، ونقاط التحقق من النماذج، وأصول التصور.
  3. لخص موارد البرمجيات، وسير العمل المسبق، وملفات التكوين، وتعليمات الوصول إلى مجموعات البيانات، وأصول التكرار المستخدمة في جميع أنحاء الإطار في الجدول 5.
  4. الناتج المتوقع - أنشئ حزمة تجريبية كاملة قابلة لإعادة الإنتاج تحتوي على سكريبتات المعالجة المسبقة، ملفات التكوين، نماذج مدربة، نقاط تفتيش النماذج، مخرجات القابلية للتفسير، تقارير التحقق، تشويهات التصور، مواصفات البرمجيات، والوثائق اللازمة للتكرار المستقل والتحقق من الإطار المقترح.
المصدرالوصف
الشيفرة المصدريةسكريبتات تنفيذ بايثون لمعالجة البيانات مسبقا، تدريب النماذج، قابلية الشرح، والتقييم
ملف البيئةrequirements.txt تحتوي على تبعيات الحزم وإصداراتها
ملفات التكوينإعدادات بنية النماذج، المعاملات الفائقة، وتكوينات التجارب
بذور عشوائية ثابتةالبذور = 42 المستخدمة في التجارب القابلة للتكرار
تعليمات الوصول إلى مجموعة البياناتروابط وإجراءات للحصول على مجموعات بيانات الرعاية الصحية العامة
سكريبتات المعالجة المسبقةسكريبتات لتنظيف البيانات، والتطبيع، والترميز، واختيار الميزات
سكريبتات توليد الأشكالنصوص لإعادة توليد جميع أشكال المخطوطات
سكريبتات توليد الجداولسكريبتات لإعادة إنتاج الجداول والمقاييس المبلغ عنها
أمثلة على المدخلاتمجموعات بيانات نموذجية وملفات الإدخال
أمثلة على المخرجاتنتائج التنبؤ، والتفسيرات، وتقارير التقييم

الجدول 5: موارد قابلية التكرار والأصول التجريبية.

يلخص هذا الجدول الموارد المقدمة لدعم قابلية إعادة الإنتاج التجريبية، بما في ذلك الشيفرة المصدرية، وسكريبتات المعالجة المسبقة، وملفات التكوين، ومواصفات البيئة، وتعليمات الوصول إلى مجموعات البيانات، وإعدادات البذرة العشوائية الثابتة، وسكريبتات توليد الأشكال، وملفات الإدخال/الإخراج النموذجية المطلوبة لإعادة إنتاج النتائج المبلغ عنها.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

قمنا بتقييم دقيق لمكون الذكاء الاصطناعي التفسيري في خط الإنتاج بأكمله، وقمنا بتقييم مدى تنقله عبر أنواع مختلفة من بيانات الرعاية الصحية، بما في ذلك البيانات السريرية المنظمة والصور الطبية. أشارت النتائج إلى أداء تنبؤي متسق عبر مجموعات البيانات المقيمة. من بين النماذج التي تم اختبارها، حقق نموذج تعزيز التدرج أعلى دقة بنسبة 97.4٪، تلاها نموذج الغابة العشوائية بنسبة 94.2٪. حققت طرق التعلم العميق المطبقة على مجموعات الصور دقة 91.3٪، بينما حققت نماذج بيرسيبترون متعددة الطبقات نتائج أقل قليلا،...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

طورت هذه الدراسة وقيمت سير عمل ذكاء اصطناعي قابل للتفسير (XAI) قابل لإعادة إنتاج لتحليلات الرعاية الصحية، يدمج النمذجة التنبؤية، وتقييم التفسير، والتقييم المرتكز على الطبيب، وموارد القابلية للتكرار ضمن بروتوكول واحد. أظهرت النتائج أن نماذج التعلم الآلي المعتمدة على المجموعات، وخاصة تعزيز التدرج والغابة العشوائية، حققت أعلى أداء تنبؤي على مجموعات بيانات الرعاية الصحية المنظمة المقيمة، في حين كانت نماذج التعلم العميق أكثر ملاءمة للتحليلات القائمة على الصور. تسلط هذه النتائج الضوء على أهمية...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

يعلن المؤلفون أنه لا توجد لديهم مصالح مالية متنافسة أو تضارب مصالح مرتبط بهذا العمل. أجريت الأبحاث بشكل مستقل دون أي علاقات تجارية أو مالية يمكن اعتبارها تضارب محتمل في المصالح.

إفصاح عن استخدام الذكاء الاصطناعي

تم استخدام أدوات الذكاء الاصطناعي لتحسين اللغة، والتحقق من النحو، والمساعدة التحريرية أثناء إعداد المخطوطات. تم إجراء جميع المحتوى العلمي، وتصميم التجارب، وتحليل البيانات، والتفسير، والتحقق النهائي من المخطوطة بواسطة المؤلفين. قام المؤلفون بمراجعة والتحقق من جميع المخرجات المدعومة بالذكاء الاصطناعي لضمان الدقة والنزاهة والامتثال لإرشادات المجلة.

شكر وتقدير

يرغب المؤلفون في شكر مؤسساتهم على توفير البنية التحتية والدعم البحثي اللازم لإجراء هذه الدراسة. كما يقر المؤلفون باستخدام مجموعات البيانات المتاحة للجمهور والأدوات مفتوحة المصدر التي سهلت تطوير وتقييم إطار الذكاء الاصطناعي المقترح القابل للتفسير. نشكر بشكل خاص لخبراء المجال الذين قدموا رؤى قيمة خلال مرحلة التقييم المرتكز على الإنسان.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
محطة عمل GPUحسب الشركة المصنعةNAتدريب نماذج التعلم العميق
مفكرة Jupyterمشروع Jupyterأحدث إصدار مستقرتنفيذ التجارب التفاعلي
LIMELIMEالإصدار 0.2.0تفسيرات محلية
Matplotlibمشروع Matplotlibالإصدار 3.9تصور البيانات
قاعدة بيانات MIMIC-IIIPhysioNetالإصدار 1.4تحليل السجلات الصحية الإلكترونية
مجموعة بيانات NIH Chest X-rayالمركز السريري NIHمجموعة بيانات عامةتصنيف الأمراض الصدرية
NumPyمطورو NumPyالإصدار 1.26الحساب العددي وعمليات المصفوفات
OpenCVمؤسسة OpenCVالإصدار 4.10معالجة الصور المسبقة
Pandasفريق تطوير Pandasالإصدار 2.1معالجة البيانات وتجهيزها
مجموعة بيانات Pima Indians Diabetesمستودع UCI للتعلم الآليمجموعة بيانات عامةتوقع مخاطر مرض السكري
Python 3.11مؤسسة Python للبرمجياتالإصدار 3.11بيئة البرمجة الأساسية
Scikit-learnscikit-learnالإصدار 1.5خوارزميات التعلم الآلي والتقييم
SeabornSeabornالإصدار 0.13التصور الإحصائي
SHAPSHAPالإصدار 0.46نسبة الميزات وإمكانية التفسير
TensorFlowTensorFlowالإصدار 2.15تطوير نماذج التعلم العميق
Windows / Ubuntu LinuxMicrosoft / CanonicalNAنظام التشغيل
مجموعة بيانات سرطان الثدي في ويسكونسنمستودع UCI للتعلم الآليمجموعة بيانات عامةتشخيص سرطان الثدي

المراجع

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

الوسوم

233 233 XAI