تحليل أداء التنبؤ
أظهر نموذج FedMediFormer-XAI تحسناً في أداء التنبؤ مقارنة بالنماذج أحادية المنوال والنماذج المرجعية التقليدية التي تم تقييمها. وقد أدى التعزيز القائم على الانتشار (Diffusion-based augmentation) إلى تحسين تمثيل الفئات الأقلية، وتتلخص نتائج أداء التنبؤ الناتجة في الجدول 3. كما أظهر تقييم التشغيل المتكرر أداءً تنبؤياً مستقراً عبر النماذج التي تم تقييمها. وحقق نموذج FedMediFormer-XAI أعلى أداء إجمالي، بدقة بلغت 94.20 ± 0.34% (95% CI: 93.78–94.62)، ودقة تحديد (precision) بلغت 93.10 ± 0.30% (95% CI: 92.73–93.47)، واستدعاء (recall) بلغ 92.80 ± 0.28% (95% CI: 92.45–93.15)، ومقياس F1-score بلغ 92.90 ± 0.28% (95% CI: 92.55–93.25). كما حقق النموذج معامل ارتباط ماتيوس (MCC) قدره 0.88 ± 0.02 (95% CI: 0.86–0.90) ومساحة تحت منحنى خصائص التشغيل (AUC-ROC) بلغت 0.96 ± 0.01 (95% CI: 0.95–0.97). وقد قدم المحول متعدد المنوال المركزي (centralized multimodal transformer) ثاني أفضل أداء إجمالي، بينما أظهرت النماذج أحادية المنوال ونماذج التعلم الآلي التقليدية أداءً تنبؤياً أقل نسبياً. وتشير هذه النتائج إلى أن تعلم التمثيلات متعددة المنوال، مقترناً بالتحسين الاتحادي (federated optimization)، يؤدي إلى تحسين أداء تصنيف مرض السكري وزيادة استقراره.
دراسة الاستئصال
استُخدم الاستئصال على مستوى المكونات لتقييم مساهمة كل من تعزيز الانتشار، والتعلم الاتحادي، وتوصية الأدوية القائمة على GraphSAGE، والدمج متعدد الوسائط. حقق إطار عمل FedMediFormer-XAI الكامل دقة بلغت 94.20 ± 0.34%، ودقة تنبؤية (precision) بلغت 93.10 ± 0.30%، واستدعاءً (recall) بلغ 92.80 ± 0.28%، ومقياس F1-score بلغ 92.90 ± 0.28%، ومعامل ارتباط ماتيوس (MCC) بلغ 0.88 ± 0.02، ومساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) بلغت 0.96 ± 0.01 عبر خمس عمليات تشغيل مستقلة. أدىت إزالة تعزيز الانتشار إلى خفض الدقة إلى 91.80 ± 0.42%، وهو ما يمثل انخفاضاً قدره 2.40 نقطة مئوية، بينما انخفض مقياس F1-score وAUC-ROC إلى 90.30 ± 0.38% و0.94 ± 0.01 على التوالي. يشير هذا الانخفاض إلى مساهمة التعزيز القائم على الانتشار في تمثيل الفئات الأقلية وتعزيز المتانة التنبؤية.
أدى استبعاد التعلم الاتحادي إلى دقة بلغت 93.10 ± 0.37%، وهو ما يمثل انخفاضًا قدره 1.10 نقطة مئوية مقارنة بالإطار الكامل. كما انخفضت كل من الدقة (Precision)، والاستدعاء (Recall)، ومقياس F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) إلى 92.20 ± 0.34%، و 91.80 ± 0.32%، و 92.00 ± 0.33%، و 0.86 ± 0.02، و 0.95 ± 0.01 على التوالي. وتوضح هذه المقارنة مدى مساهمة التكوين الاتحادي في تحسين أداء التنبؤ.
أدى إزالة مكون توصية الأدوية المخصصة القائم على GraphSAGE إلى تغيير صغير نسبياً في أداء التنبؤ بمرض السكري، حيث انخفضت الدقة إلى 93.80 ± 0.35% ومقياس F1-score إلى 92.60 ± 0.30%. وكانت قيم MCC وAUC-ROC المقابلة 0.87 ± 0.02 و0.96 ± 0.01، على التوالي. وتشير هذه النتيجة إلى أن GraphSAGE يساهم بشكل أساسي في توصية الأدوية المخصصة بدلاً من تحديد أداء تصنيف مرض السكري بشكل مباشر.
لُوحظ أكبر انخفاض عند إزالة الدمج متعدد الوسائط؛ حيث انخفضت الدقة إلى 87.60 ± 0.55%، وهو ما يمثل انخفاضاً قدره 6.60 نقطة مئوية، بينما انخفضت الدقة (precision)، والاستدعاء (recall)، ومقياس F1-score، ومعامل ارتباط ماتيو (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC) إلى 86.80 ± 0.51%، و85.90 ± 0.54%، و86.30 ± 0.52%، و0.76 ± 0.03، و0.91 ± 0.01، على التوالي. وتبرهن هذه النتيجة على أهمية النمذجة المشتركة للمعلومات المتكاملة من الوسائط السريرية، ومراقبة الغلوكوز المستمرة (CGM)، ووسائط الشبكية.
تحليل التعلم الاتحادي
أتاح إطار التعلم الاتحادي تدريب النماذج بشكل تعاوني عبر عملاء موزعين مع الحفاظ على التعامل اللامركزي مع بيانات المرضى الخام. وخلال عملية التدريب، تم ضبط النموذج المحلي لكل عميل بشكل فردي ثم دمجها عبر طريقة المتوسط الاتحادي. وبعد 100 جولة اتصال، تقارب النموذج العالمي، وظل أداؤه التنبؤي متسقاً مع التعلم المركزي. وقد أظهر إطار التعلم الاتحادي تقارباً مستقراً عبر جولات الاتصال رغم تباين توزيعات بيانات العملاء. كما حافظ تبادل المعلمات المحمية على التعامل اللامركزي مع البيانات، بينما حافظ النموذج العالمي على أداء تنبؤي تنافسي مقارنة بالخط المرجعي المركزي. ويقارن الجدول 4 بين التنفيذ المركزي والاتحادي. وقد تطلب التعلم الاتحادي وقتاً إضافياً للتدريب بسبب عبء الاتصالات، مع الحفاظ على أداء تنبؤي مماثل للتعلم المركزي.
تحليل الأداء على مستوى مجموعة البيانات
لتقييم إمكانية التعميم عبر مختلف أنماط الرعاية الصحية، قمنا بتقييم الأداء في كل مجموعة بيانات على حدة. أظهر نموذج FedMediFormer-XAI متعدد الوسائط أداءً قوياً وتنافسياً بشكل عام عبر مجموعات البيانات التي تم تقييمها؛ حيث حقق دقة بلغت 91.8%، و93.1%، و92.4%، و94.2% في مجموعات بيانات Pima Indians Diabetes، وCDC Diabetes Health Indicators، وOhioT1DM، وAPTOS 2019، على التوالي. وعلى الرغم من أن مجموعة بيانات APTOS 2019 حققت دقة (94.7%) ودقة تنبؤ (precision) (93.9%) أعلى قليلاً من النموذج متعدد الوسائط، إلا أن النهج متعدد الوسائط المقترح حافظ على أداء تنافسي عبر جميع مجموعات البيانات وحقق قيمة AUC-ROC بلغت 0.96، وهي قيمة تضاهي أعلى قيمة AUC-ROC تم تسجيلها على مستوى مجموعة البيانات. وتظهر النتائج الإجمالية على مستوى مجموعة البيانات في الجدول 5. أما بالنسبة لمجموعات البيانات المنفردة، فقد حقق تحليل صور الشبكية أفضل أداء عند استخدامه بمفرده، بينما أدى الدمج متعدد الوسائط إلى تنبؤات أكثر استقراراً وتوازناً.
تحليل توصيات الأدوية المخصصة
تم تقييم مكون التوصيات القائم على الشبكة العصبية الرسومية باستخدام معلومات فعالية الأدوية وبيانات التفاعلات الدوائية، حيث تم ترتيب الأدوية المرشحة وفقاً لدرجات ملاءمة المريض للدواء التي تم تعلمها، مع استبعاد التركيبات الموانعة خلال عملية إنشاء التوصيات. وقد أتاح استخدام تنسيق الرسم البياني غير المتجانس ونمذجة التفاعلات بين المريض والدواء وبين دواء ودواء آخر إجراء ذلك بشكل شامل، مما دعم اختيارات الأدوية المخصصة وتقييم السلامة. كما نجح نموذج التوصيات GraphSAGE في استيعاب العلاقات المعقدة بين المرضى والأمراض والنتائج المختبرية والأدوية. وأظهرت التوصيات المخصصة أداءً عالياً في التصنيف مع الحفاظ على تفسيرات ذات دلالة سريرية من خلال تحليل جوار الرسم البياني وعزو الميزات.
وفقاً لـ الجدول 6، تم تقييم وحدة التوصية بالأدوية المخصصة باستخدام مقاييس Precision@5 وRecall@5 وNDCG@5. وتحدد هذه المقاييس مدى صلة وجودة ترتيب أفضل خمس توصيات دوائية مخصصة تم إنشاؤها بواسطة وحدة التوصية القائمة على GraphSAGE. وقد حقق نظام التوصية أداءً قوياً في التصنيف، حيث بلغت الدقة (precision) = 0.89، والاستدعاء (recall) = 0.84، ومقياس NDCG = 0.91.
تحليل القابلية للتفسير
يتضمن الإطار عمل SHAP، والتدرجات المتكاملة (Integrated Gradients)، وتصور الانتباه (attention visualization)، والتفسيرات المضادة للواقع (counterfactual explanations) لدعم تفسير التنبؤات متعددة الوسائط. استُخدم SHAP لقياس مساهمات مستوى الميزات، والتدرجات المتكاملة لنسب التنبؤات إلى ميزات الإدخال، وتصور الانتباه لفحص تركيز النموذج عبر الوسائط المختلفة، والتفسيرات المضادة للواقع لتحديد التغييرات في الميزات المرتبطة بتنبؤات بديلة. يعرض الشكل 8 مخطط ملخص SHAP ممثلاً مشتقاً من نموذج FedMediFormer-XAI المدرب، بينما يعرض الشكل 9 تصورات انتباه ممثلة مستخرجة من المحول (transformer) المدرب. تمثل هذه الأشكال مخرجات تم الحصول عليها من تقييم النموذج وليست رسوماً تخطيطية للبنية المقترحة.
في الشكل 8، يتم عرض تصنيفات أهمية الميزات على مستوى التجميع. وكان للميزات التي تمتلك قيم SHAP مطلقة أعلى تأثير أكبر على تنبؤات النموذج، كما أنها تماشَت بشكل جيد مع المعرفة السريرية الحالية.
يقدم الشكل 9 تصورات تمثيلية للانتباه تم استخراجها مباشرة من نموذج FedMediFormer-XAI المدرب لعينة اختبار عشوائية مستبعدة. وتتضمن هذه التصورات الانتباه للميزات السريرية، والانتباه الزمني لـ CGM، والانتباه المكاني للشبكية، والانتباه عبر الوسائط بين الوسائط الثلاثة. وقد أظهر تصور الانتباه بشكل أكبر توزيع الانتباه الذي تعلمه النموذج عبر وسائط متعددة. وأظهرت العينة المختارة انتباهاً أقرب نسبياً إلى HbA1c ومدة الإصابة بالسكري والعمر من بين الميزات السريرية، بينما سلطت خريطة انتباه CGM الضوء على عدة فترات اتسمت بتقلبات بارزة في مستوى الجلوكوز. كما حددت خريطة انتباه الشبكية مناطق محددة في الصورة تساهم في تمثيل النموذج، وأظهرت مصفوفة الانتباه عبر الوسائط أنماط الانتباه داخل الوسائط الواحدة وعبر الوسائط المختلفة. وكما هو موضح في الشكل 9، تبرز خرائط الانتباه التمثيلية المستمدة من النموذج أنماط جلوكوز زمنية مختارة، ومتغيرات سريرية مؤثرة، ومناطق في صور الشبكية ذات صلة تشخيصياً في عينة اختبار مستبعدة.
نتائج التقييم المرتكز على العنصر البشري
تم تصميم بروتوكول تقييم مستقبلي مرتكز على العنصر البشري لتقدير ثقة السريريين، وقابلية التفسير، وسهولة الاستخدام، والفائدة السريرية، ومدى ملاءمة التفسير تحت حالتي "التنبؤ فقط" و"التنبؤ مع التفسير". سيشمل التقييم المقترح أخصائيي الغدد الصماء، ومتخصصي السكري، وعلماء الصيدلة السريرية، مع الحصول على الموافقة المناسبة من لجنة أخلاقيات المؤسسة والموافقة المستنيرة. ونظرًا لأن هذا التقييم مخصص للتنفيذ المستقبلي، فإن درجات النتائج على مستوى السريريين لم تُذكر في البروتوكول الحالي.
يلخص الجدول 7 تصميم تقييم الأطباء الاستشرافي المقترح والمعايير المحددة مسبقاً لتقييم آثار التفسيرات على ثقة الأطباء، وقابلية التفسير، والمنفعة المدركة. سيقارن التقييم الاستشرافي بين تقييمات الأطباء لتنبؤات النموذج بوجود تفسيرات مصاحبة وبدونها، وذلك باستخدام معايير محددة مسبقاً وفق مقياس ليكرت. ويظهر إطار تقييم القابلية للتفسير الاستشرافي المقترح والمتمحور حول الإنسان في الشكل 10

شكل 1: البنية العامة لإطار عمل FedMediFormer-XAI. نظرة عامة تخطيطية لإطار عمل FedMediFormer-XAI، توضح عملية الحصول على البيانات متعددة الوسائط ومعالجتها مسبقاً، والتعزيز القائم على الانتشار، والتعلم المعتمد على المحولات (transformer) لكل وسائط بيانات محددة، وتدريب النموذج الاتحادي، وتوصية الأدوية المخصصة القائمة على GraphSAGE، وتحليل القابلية للتفسير. يقوم إطار العمل بتوليد تنبؤات بمرض السكري، وتوصيات علاجية مخصصة، ومخرجات نموذج قابلة للتفسير. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: مسار الحصول على مجموعة البيانات متعددة الوسائط ومعالجتها مسبقاً. مخطط سير العمل للحصول على مجموعات البيانات متعددة الوسائط المستخدمة في FedMediFormer-XAI ومعالجتها مسبقاً. تخضع البيانات السريرية وبيانات صحة السكان، وسجلات CGM، وصور الشبكية، والمعلومات الدوائية لعمليات مراقبة الجودة الخاصة بكل وسيط، والمعالجة المسبقة، والتقييس، والترميز، والتعزيز قبل تحويلها إلى تمثيلات جاهزة للنموذج لإجراء التحليلات اللاحقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: سير عمل تعزيز البيانات القائم على الانتشار. مخطط لسير عمل تعزيز بيانات التدريب الجدولية المنظمة القائم على الانتشار باستخدام TabDDPM. تخضع العينات المولدة لتقييمات الجودة وتشابه التوزيع قبل دمجها مع بيانات التدريب الأصلية لتحسين توازن الفئات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: بنية إطار عمل المحول متعدد الوسائط المقترح. مخطط البنية الذي يتكون من (A) مشفر TabTransformer للبيانات السريرية، (B) ومشفر محول زمني لبيانات CGM، و(C) مشفر Vision Transformer لصور الشبكية. (D) يتم دمج التمثيلات الخاصة بكل وسائط عبر الانتباه عابر الوسائط لتوليد تمثيل موحد متعدد الوسائط. (E) تقوم رؤوس تنبؤ خاصة بالمهام بتوليد مخرجات النموذج. (F) تدعم مكونات التنظيم والتحسين تدريب النموذج، و (G) توجه خسائر التصنيف والانحدار والاتساق عابر الوسائط عملية التحسين. يدعم التمثيل متعدد الوسائط الناتج مهام التنبؤ والتوصية وقابلية التفسير اللاحقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: إطار عمل اتصالات التعلم الاتحادي. مخطط سير العمل للتدريب الاتحادي عبر عملاء المستشفيات الموزعين. يتم تدريب النماذج المحلية متعددة الوسائط باستخدام بيانات خاصة بكل عميل، وتُنقل تحديثات النماذج المحمية إلى خادم مركزي لإجراء عملية المتوسط الاتحادي (Federated Averaging). يعاد توزيع النموذج العالمي المجمع على العملاء لجولات الاتصال اللاحقة. كما يوضح إطار العمل التبادل الآمن للمعلمات وتقييم متطلبات الخصوصية والاتصال والحوسبة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: سير عمل توصية الأدوية المخصصة القائم على الرسوم البيانية. مخطط لسير عمل توصية الأدوية المخصصة القائم على GraphSAGE. يتم تنظيم البيانات الدوائية وبيانات تمثيل المريض في رسم بياني غير متجانس يتضمن الكيانات والعلاقات الصحية ذات الصلة. يقوم GraphSAGE بتعلم تمثيلات المريض والدواء، والتي تُستخدم لحساب درجات ملاءمة المريض للدواء وترتيب الأدوية المرشحة. يتم تصفية تركيبات الأدوية الموانعة أو غير الآمنة قبل توليد التوصيات النهائية (Top-K)، مع دعم المعلومات القائمة على الرسم البياني لتفسير هذه التوصيات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7: إطار عمل تقييم القابلية للتفسير. نظرة عامة تخطيطية لسير عمل القابلية للتفسير. (A) يقوم تحليل SHAP بتقييم مساهمات الميزات العالمية والمحلية؛ (B) يوفر Integrated Gradients تفسيرات قائمة على الإسناد؛ (C) يحدد تصور الانتباه الميزات المؤثرة والتفاعلات بين الوسائط؛ و (D) يحدد التحليل المقابل للواقع التغييرات في الميزات المرتبطة بالتنبؤات المتغيرة. وتدعم مخرجات التفسير الناتجة تفسير تنبؤات النموذج والتوصيات الشخصية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8: تحليل نموذجي لأهمية الميزات باستخدام SHAP مستمد من النموذج، تم إنتاجه بواسطة نموذج FedMediFormer-XAI المدرب. يوضح مخطط ملخص SHAP توزيع قيم SHAP عبر العينات التي تم تقييمها، مع ترتيب الميزات وفقاً لمتوسط مساهمة SHAP المطلقة. تشير قيم SHAP الموجبة إلى مساهمات تزيد من خطر الإصابة بمرض السكري المتوقع، بينما تشير القيم السالبة إلى مساهمات تقلل من الخطر المتوقع. يمثل اللون قيمة الميزة المقابلة، حيث تظهر قيم الميزات الأعلى باللون الأحمر والقيم الأدنى باللون الأزرق. يمثل المخطط مخرجاً فعلياً للقابلية للتفسير مستمداً من النموذج وليس مجرد توضيح تخطيطي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 9: مخرجات انتباه ممثلة أنتجها نموذج FedMediFormer-XAI المدرب لعينة اختبار واحدة تم اختيارها عشوائياً من مجموعة البيانات المستبعدة. (A) انتباه الميزات السريرية المستمد من رأس انتباه في المحول متعدد الوسائط، ويوضح أوزان الانتباه النسبية المخصصة للميزات السريرية. (B) الانتباه الزمني عبر تسلسل CGM، ويوضح الفترات الزمنية التي تلقت انتباهاً أعلى من النموذج. (C) الانتباه المكاني لصورة قاع الشبكية، بما في ذلك الصورة الأصلية، والخريطة الحرارية للانتباه، وتراكب الانتباه. (D) الانتباه عبر الوسائط بين رموز الوسائط السريرية وCGM والشبكية، ويوضح وزن المعلومات داخل الوسائط الواحدة وبين الوسائط المختلفة. التصورات المعروضة هي مخرجات مشتقة أنتجها النموذج المدرب. تظهر أوزان الانتباه للعينة المختبرة المحددة ويجب تفسيرها كأنماط انتباه للنموذج وليس كمقاييس مستقلة للسببية السريرية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
| مجموعة البيانات | نوع البيانات | العينات/السجلات | المزايا/المحتوى | الغرض | التوافر العام |
| مجموعة بيانات مرض السكري لدى الهنود البيما | جدول سريري | ٧٦٨ مريضاً | 8 متغيرات سريرية | التنبؤ بمخاطر الإصابة بمرض السكري | عام |
| مؤشرات الصحة الخاصة بمرض السكري وفقاً لمراكز السيطرة على الأمراض والوقاية منها (CDC) | صحة السكان | ٢٥٣,٦٨٠ سجلاً | البيانات الديموغرافية، ونمط الحياة، والمؤشرات الصحية | تحليل مخاطر السكان | عام |
| مجموعة بيانات OhioT1DM | السلاسل الزمنية للمراقبة المستمرة للجلوكوز (CGM) | ١٢ شخصاً | الجلوكوز، الإنسولين، الوجبات، التمرين، النوم | نمذجة مرض السكري الزمانية | عام |
| كشف العمى APTOS 2019 | صور الشبكية | ٣,٦٦٢ صورة | صور لقاع العين مع تسميات توضح درجة الشدة | تحليل اعتلال الشبكية السكري | عام |
| مجموعة بيانات مراجعات الأدوية | دوائي | ٢١٥,٠٦٣ مراجعة | فعالية الدواء، والتقييمات، والمراجعات | توصية دوائية | عام |
| البيانات المفتوحة من DrugBank | مخطط معرفي للعقاقير | آلاف العقاقير | التفاعلات الدوائية-الدوائية، والأهداف، والمسارات | بناء الرسم البياني | الوصول العام/الأكاديمي |
الجدول 1: خصائص مجموعة البيانات. ملخص لمجموعات البيانات المتاحة علنًا والمستخدمة في هذه الدراسة، بما في ذلك نوع مجموعة البيانات، وحجم العينة، ونمط البيانات، ومحتوى الميزات، والغرض المنشود، ومدى التوافر.
| مجموعة البيانات | النمطية | هدف التنبؤ | مستوى الاندماج |
| مرض السكري لدى هنود البيما | سريري | تصنيف مرض السكري | تضمين الميزات |
| مؤشرات الصحة الخاصة بداء السكري من مراكز السيطرة على الأمراض والوقاية منها (CDC) | صحة السكان | التنبؤ بمخاطر الإصابة بداء السكري | تضمين السمات |
| OhioT1DM | المراقبة المستمرة للجلوكوز | التنبؤ باتجاهات الغلوكوز | تضمين الميزات |
| APTOS 2019 | صور قاع الشبكية | تحليل اعتلال الشبكية السكري | تضمين الميزات |
| مراجعة العقاقير + DrugBank | دوائي | توصية دوائية | تضمين الرسوم البيانية |
الجدول 2: استراتيجية دمج مجموعة البيانات متعددة الوسائط. ملخص لمجموعات البيانات المستخدمة في ذكاء مرض السكري متعدد الوسائط، بما في ذلك نمط البيانات، وهدف التنبؤ، والمستوى الذي يتم عنده دمج التمثيلات الخاصة بكل نمط. يتم تمثيل البيانات السريرية، وصحة السكان، والمراقبة المستمرة للجلوكوز، وصور الشبكية كتمثيلات ميزات (feature embeddings)، بينما يتم دمج المعلومات الدوائية عبر تمثيلات الرسوم البيانية (graph embeddings) للتوصية بالأدوية الشخصية.
| نموذج | الدقة، المتوسط الحسابي ± الانحراف المعياري (فاصل ثقة 95%) | الدقة، المتوسط الحسابي ± الانحراف المعياري (فاصل ثقة 95%) | الاستدعاء، المتوسط ± الانحراف المعياري (فاصل ثقة 95%) | مقياس F1، المتوسط ± الانحراف المعياري (فاصل ثقة 95%) | المعامل المتوسط، MCC ± الانحراف المعياري (فاصل ثقة 95%) | المساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC)، المتوسط ± الانحراف المعياري (فاصل ثقة 95%) |
| الغابة العشوائية | 83.60 ± 0.74 (82.68–84.52) | 82.70 ± 0.60 (81.96–83.44) | 81.90 ± 0.56 (81.21–82.59) | 82.30 ± 0.56 (81.61–82.99) | 0.67 ± 0.03 (0.63–0.71) | 0.88 ± 0.01 (0.87–0.89) |
| XGBoost | 85.30 ± 0.71 (84.42–86.18) | 84.70 ± 0.60 (83.96–85.44) | 83.80 ± 0.56 (83.11–84.49) | 84.20 ± 0.56 (83.51–84.89) | 0.70 ± 0.03 (0.66–0.74) | 0.90 ± 0.01 (0.89–0.91) |
| TabTransformer | 87.50 ± 0.52 (86.85–88.15) | 87.00 ± 0.60 (86.26–87.74) | 86.20 ± 0.56 (85.51–86.89) | 86.60 ± 0.56 (85.91–87.29) | 0.75 ± 0.03 (0.71–0.79) | 0.92 ± 0.01 (0.91–0.93) |
| محول الرؤية (Vision Transformer) | 88.80 ± 0.50 (88.18–89.42) | 88.20 ± 0.60 (87.46–88.94) | 87.60 ± 0.56 (86.91–88.29) | 87.90 ± 0.56 (87.21–88.59) | 0.78 ± 0.03 (0.74–0.82) | 0.93 ± 0.01 (0.92–0.94) |
| محول زمني (Temporal Transformer) | 87.20 ± 0.51 (86.57–87.83) | 86.60 ± 0.60 (85.86–87.34) | 85.90 ± 0.56 (85.21–86.59) | 86.20 ± 0.56 (85.51–86.89) | 0.74 ± 0.03 (0.70–0.78) | 0.91 ± 0.01 (0.90–0.92) |
| الشبكات العصبية التلافيفية والذاكرة قصيرة المدى المطولة (CNN-LSTM) | 86.90 ± 0.58 (86.18–87.62) | 86.30 ± 0.60 (85.56–87.04) | 85.60 ± 0.55 (84.92–86.28) | 85.90 ± 0.56 (85.21–86.59) | 0.73 ± 0.03 (0.69–0.77) | 0.91 ± 0.01 (0.90–0.92) |
| محول متعدد الوسائط مركزي | 91.30 ± 0.12 (91.15–91.45) | 90.70 ± 0.60 (89.96–91.44) | 90.10 ± 0.56 (89.41–90.79) | 90.40 ± 0.56 (89.71–91.09) | 0.83 ± 0.03 (0.79–0.87) | 0.95 ± 0.01 (0.94–0.96) |
| FedMediFormer-XAI | 94.20 ± 0.34 (93.78–94.62) | 93.10 ± 0.30 (92.73–93.47) | 92.80 ± 0.28 (92.45–93.15) | 92.90 ± 0.28 (92.55–93.25) | 0.88 ± 0.02 (0.86–0.90) | 0.96 ± 0.01 (0.95–0.97) |
الجدول 3: أداء التنبؤ بمرض السكري. مقارنة لأداء التنبؤ لنموذج FedMediFormer-XAI ونماذج تعلم الآلة والتعلم العميق المرجعية باستخدام مقاييس الدقة (accuracy)، والدقة التحديدية (precision)، والاستدعاء (recall)، ودرجة F1-score، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص تشغيل المستقبل (AUC-ROC).
| مقياس | التعلم المركزي | التعلم الاتحادي |
| الدقة (%) | 94.7 | 94.2 |
| المساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC) | 0.97 | 0.96 |
| الحفاظ على الخصوصية | لا | نعم |
| مشاركة البيانات الخام مطلوبة | نعم | لا |
| جولات التواصل | غير متاح | 100 |
| وقت التدريب (ساعة) | 4.8 | 5.6 |
| الامتثال التنظيمي | متوسط | مرتفع |
الجدول 4: أداء التعلم الاتحادي مقابل التعلم المركزي. مقارنة بين تطبيقات التعلم المركزي والتعلم الاتحادي فيما يتعلق بأداء التنبؤ، ومتطلبات مشاركة البيانات الخام، وجولات الاتصال، ووقت التدريب.
| مجموعة البيانات | الدقة (%) | الدقة (%) | الاسترجاع (%) | المساحة تحت منحنى خصائص تشغيل المستقبِل (AUC-ROC) |
| مجموعة بيانات مرض السكري لدى هنود بيما | 91.8 | 90.5 | 89.8 | 0.93 |
| مؤشرات صحة السكري الخاصة بمراكز السيطرة على الأمراض والوقاية منها (CDC) | 93.1 | 92.2 | 91.6 | 0.95 |
| مجموعة بيانات OhioT1DM | 92.4 | 91.8 | 91.1 | 0.94 |
| كشف العمى APTOS 2019 | 94.7 | 93.9 | 93.5 | 0.96 |
| دمج متعدد الوسائط (FedMediFormer-XAI) | 94.2 | 93.1 | 92.8 | 0.96 |
الجدول 5: النتائج على مستوى مجموعة البيانات. تحليل الأداء عبر مجموعات البيانات الفردية وإعدادات الدمج متعدد الوسائط. توضح النتائج مساهمة الوسائط المختلفة للبيانات في الأداء التنبؤي العام.
| المقياس | القيمة |
| Precision@5 | 0.89 |
| Recall@5 | 0.84 |
| NDCG@5 | 0.91 |
| دقة كشف التفاعلات الدوائية | 0.95 |
| تغطية التوصيات | 0.88 |
| متوسط الرتبة العكسية (MRR) | 0.86 |
| درجة الامتثال للسلامة | 0.94 |
الجدول 6: أداء توصية الأدوية المخصصة. تقييم توصية الأدوية المخصصة القائمة على الرسوم البيانية باستخدام مقاييس الترتيب، ودقة اكتشاف التفاعلات، وتغطية التوصيات، وتقييم سلامة الأدوية.
| معيار التقييم | تصميم التقييم المقترح |
| ثقة السريري | تقييم بمقياس ليكرت خماسي النقاط |
| قابلية التفسير | تقييم بمقياس ليكرت خماسي النقاط |
| الأهمية السريرية | تقييم بمقياس ليكرت خماسي النقاط |
| فائدة التفسير | تقييم بمقياس ليكرت خماسي النقاط |
| المنفعة المدركة | تقييم بمقياس ليكرت خماسي النقاط |
| اتفاق المقيمين | معامل كابا لـ Fleiss، يتم حسابه بعد التقييم الاستشرافي |
| المقارنة الإحصائية | اختبار إحصائي مرتبط، حسبما يتناسب بعد جمع البيانات |
| المشاركون | 12 سريرياً، شريطة الحصول على الموافقة الأخلاقية والموافقة المستنيرة |
| حالة التقييم | تقييم استشرافي/مستقبلي |
الجدول 7: معايير التقييم المقترحة المتمحورة حول الإنسان. إطار تقييم مستقبلي مقترح متمحور حول السريريين لتقييم مدى فائدة تفسيرات FedMediFormer-XAI وصلتها السريرية وقابلية تفسيرها وموثوقيتها وسهولة استخدامها. يتضمن التقييم قياساً معيارياً باستخدام مقياس ليكرت الخماسي، واتفاق المقيمين باستخدام معامل كابا لفليس (Fleiss' kappa)، ومقارنة إحصائية بين حالتي "التنبؤ فقط" و"التنبؤ بالإضافة إلى التفسير"، وفواصل ثقة بنسبة 95%. يجب إجراء تقييم السريريين فقط بعد الحصول على موافقة لجنة أخلاقيات المؤسسة المختصة والموافقة المستنيرة.
الجدول التكميلي 1: استراتيجية التحقق من صحة مجموعة البيانات. تم تنفيذ تقسيم مجموعة البيانات، وإجراءات التحقق، واستراتيجيات موازنة الفئات، وتدابير مراقبة الجودة لضمان إمكانية التكرار والتقييم الموثوق للنموذج. يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 2: معاملات نموذج الانتشار. إعدادات التكوين لنموذج الانتشار TabDDPM، بما في ذلك معاملات التدريب، وإعدادات التحسين، والأبعاد الكامنة، واستراتيجية جدولة الضوضاء، ومواصفات توليد العينات الاصطناعية. يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 3: تكوين المحول متعدد الوسائط. تكوين بنية المحول متعدد الوسائط، بما في ذلك مشفرات البيانات السريرية والزمنية والصورية، وأبعاد التضمين والدمج، ورؤوس الانتباه، والمحسن، ومعدل التعلم، وحجم الدفعة، وعصور التدريب، ومعيار التوقف المبكر، وخسارة التدريب المجمعة. يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 4: تكوين التعلم الاتحادي. المعلمات المستخدمة للتدريب الاتحادي الحافظ للخصوصية، بما في ذلك عدد المستشفيات المشاركة، وجولات الاتصال، وعصور التدريب المحلي، ومعدل مشاركة العملاء، وخوارزمية التجميع، والمحسن، ومعدل التعلم، وطريقة التشفير، وبروتوكول الاتصال، وسياسة مشاركة البيانات الخام. يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 5: تهيئة GraphSAGE. تهيئة وحدة توصية الأدوية المخصصة القائمة على GraphSAGE غير المتجانسة، بما في ذلك نوع الرسم البياني، وأبعاد الطبقة الخفية والتضمين، وعدد طبقات الرسم البياني، وحجم أخذ عينات الجوار، والمحسن، ومعدل التعلم، وحجم الدفعة، وعصور التدريب، وخسارة التصنيف الشخصي البايزي (Bayesian Personalized Ranking loss)، وعدد توصيات الأدوية الأكثر أهمية. يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 6: مقاييس تقييم القابلية للتفسير. مقاييس كمية ومركزة على العنصر البشري تُستخدم لتقييم القابلية للتفسير في إطار عمل FedMediFormer-XAI. تقيم هذه المقاييس دقة التفسير، والاستقرار، والاتساق، والندرة، والاكتمال، والحساسية، وعدم الدقة، والاتفاق بين المقيمين، وجودة التفسير من وجهة نظر السريريين. يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 7: مقاييس التقييم. تُستخدم مقاييس التنبؤ، والتعلم الاتحادي، والتوصية، والقابلية للتفسير لتقييم أداء الإطار العملي، ومتانته، وجودة التصنيف، وقابلية التفسير. يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 8: تصميم التقييم المتمحور حول الإنسان. تصميم دراسة التقييم المتمحورة حول السريري، بما في ذلك مجموعات المشاركين، وظروف التقييم، ومعايير التقييم، وإجراءات التحليل الإحصائي. يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 9: أصول قابلية التكرار. ملخص لمجموعات البيانات، ومواصفات التنفيذ، وملفات التكوين، وإجراءات التقييم، والوثائق، والسجلات التجريبية المطلوبة لدعم قابلية تكرار إطار عمل FedMediFormer-XAI المقترح. يرجى النقر هنا لتنزيل هذا الملف.