$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تمت الموافقة على هذه الدراسة من قبل مجلس المراجعة المؤسسية لمستشفى جامعة شنزن العام (رقم موافقة مجلس المراجعة المؤسسية. KYLL-2026-077-1). تم التنازل عن شرط الموافقة الكتابية المستنيرة بسبب تصميم الدراسة الاستعادي.
1. دفعة الدراسة
تم تحديد المرضى المصابين بالسكتة الدماغية الإقفاري الحادة (AIS) الذين خضعوا لأشعة الرنين المغناطيسي متعددة المعايير بأثر رجعي من قاعدة البيانات السريرية المؤسسية. يتم توضيح سير العمل العام للدراسة، بما في ذلك تقسيم مجموعات البيانات، وتطوير نماذج التصوير، وبناء النماذج السريرية، والاندماج متعدد الوسائط، في الشكل 1.

الشكل 1: سير عمل إطار التنبؤ بالنتائج متعددة الوسائط. (أ) جمع البيانات. تم تحديد المرضى المصابين بالسكتة الدماغية الإقفارية الحادة (AIS) الذين يستوفون معايير الإدراج المحددة مسبقا بأثر رجعي. تم تقسيم مجموعة البيانات إلى مجموعة تدريب-التحقق (n = 250)، ومجموعة اختبار داخلية مستقلة (n = 50)، ومجموعة اختبار خارجية (n = 37). تم إجراء التحقق المتقاطع الطبقي الخمسة ضمن مجموعة التدريب والتحقق. (ب) تطوير نموذج التصوير. تمت معالجة تسلسلات الرنين المغناطيسي متعددة المعايير، بما في ذلك التصوير المرجح بالانتشار (DWI)، ومعامل الانتشار الظاهر (ADC)، واستعادة الانعكاس المخفف بسائل T2 (T2-FLAIR)، باستخدام بنية هجينة ثلاثية الأبعاد لشبكة عصبية ملتفاية-محول رؤية (CNN-ViT) للتنبؤ بالنتائج. (ج) تطوير النموذج السريري. تم استخدام المتغيرات السريرية المنظمة لتدريب نماذج التعلم الآلي على التنبؤ بنتائج وظيفية خلال 90 يوما. (د) استراتيجية الاندماج متعدد الوسائط. تم دمج التنبؤات التي تولدها النماذج التصويرية والسريرية باستخدام متعلم ميتا للانحدار اللوجستي المكدس لإنتاج توقعات النتائج النهائية. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
تم إجراء فحوصات الرنين المغناطيسي باستخدام أنظمة الرنين المغناطيسي السريري. تم استخدام ملف رأس مخصص بمصفوفة طور لالتقاط الصور. تم الحصول على جميع التسلسلات في المستوى المحوري باستخدام تموضع الشرائح المتسق عبر الأنماط المختلفة. تم الحصول على التصوير المرجح بالانتشار (DWI) باستخدام تسلسل تصوير دوران صدى واحد مع زمن تكرار (TR) بين 3000–5000 مللي ثانية وزمن صدى (TE) بين 80–90 مللي ثانية. تم تطبيق تحسس الانتشار باستخدام قيم b 0 و800–1000 ثانية/مم2 في ثلاثة اتجاهات متعامدة على الأقل. تراوح مجال الرؤية بين 220–240 مم مع حجم مصفوفة 128 × 128. كان سمك الشريحة 5–6 مم مع فجوة بين الشرائح بين 1–1.5 مم. تم الحصول على متوسط إشارة من اثنين إلى أربع أشخاص.
تم توليد خرائط معامل الانتشار الظاهري (ADC) تلقائيا من بيانات DWI على محطة عمل الماسح باستخدام ملاءمة أحادية الأسية بناء على قيم b المكتسبة. تم حساب قيم ADC على مستوى الفوكسل وتصديرها للتحليل الكمي. تم التقاط صور استرداد العكس المخفف بسائل T2 (T2-FLAIR) باستخدام تسلسل استرداد انعكاس بمعدل TR من 8,000–10,000 مللي ثانية، وTE بين 80–140 مللي ثانية، وزمن انعكاس بين 2,200–2,600 مللي ثانية. تراوح مجال الرؤية بين 220–240 مم مع حجم مصفوفة 192 × 192 إلى 256 × 256. كان سمك الشريحة 4–5 مم مع فجوة بين الشرائح 1–1.5 مم.
2. معالجة البيانات المسبقة
تم استيراد البيانات السريرية من جداول بيانات منظمة تحتوي على معرفات حالة، ودرجات نتائج mRS، وتسميات تقسيم مجموعات البيانات، والمتغيرات الديموغرافية والسريرية. تم توحيد معرفات الحالات لضمان الاتساق مع أسماء ملفات التصوير. شملت المتغيرات السريرية الخصائص الديموغرافية، وشدة السكتة الدماغية المقاسة باستخدام مقياس السكتة الدماغية التابع للمعاهد الوطنية للصحة (NIHSS)، وعوامل الخطر الوعائية، والحالات المصاحبة المسجلة عند الدخول.
كانت النتيجة الأساسية الحالة الوظيفية بعد 90 يوما من بداية السكتة الدماغية التي تم قياسها باستخدام مقياس رانكين المعدل (mRS). تم تعريف النتيجة المواتية بأنها mRS ≤ 2 والنتيجة السلبية بأنها mRS > 2. تم تقسيم مجموعة البيانات عشوائيا إلى مجموعات اختبار تدريبية وتحقق داخلية ومستقلة باستخدام أخذ عينات طبقية بناء على توزيع mRS للحفاظ على توازن النتائج. تمت معالجة مجموعة اختبار خارجية بشكل منفصل ولم تستخدم أثناء تطوير النموذج. داخل مجموعة التدريب والتحقق من الصحة، تم تطبيق التحقق المتقاطع الطبقي على k-fold للحفاظ على توزيعات النتائج المتسقة عبر الطيات.
تم معالجة جميع أحجام DWI وADC وT2-FLAIR مسبقا قبل تدريب النماذج لضمان الاتساق المكاني والعددي عبر الوسائط. تم تطبيق نفس خط معالجة ما قبل المعالجة على مجموعات التدريب-التحقق والاختبار الداخلي والاختبار الخارجي دون تعديل. تم إعادة توجيه الصور إلى اتجاه RAS القياسي وتحويلها إلى مصفوفات النقطة العائمة. تم إعادة أخذ الدقة المكانية داخل المستوى إلى 256 × 256 باستخدام الاستيفاء الخطي. تم توحيد بعد المستوى العرضي إلى 20 شريحة باستخدام استراتيجية مركزية: حيث تم قص الأحجام التي تحتوي على أكثر من 20 شريحة في المنتصف، بينما كانت الأحجام التي تحتوي على أقل من 20 شريحة مبطنة بشكل متماثل. كان حجم المجلد النهائي 256 × 256 × 20.
تم إجراء تطبيع الشدة بشكل مستقل لكل حجم باستخدام تطبيع درجة z:

حيث يدل x على شدة الفوكسل، μ هو متوسط شدة الحجم، و σ هو الانحراف المعياري. إذا كان σ = 0، لم يتم تطبيق التطبيع لمنع عدم الاستقرار العددي. تم حفظ الأحجام المعالجة بصيغة NIfTI مع مصفوفة أفينية موحدة لتحليل التعلم العميق في مرحلة التبيين.
3. تطوير النموذج السريري
تم استخدام المتغيرات السريرية المنظمة لتطوير نماذج تعلم آلي للتنبؤ بالنتائج. شملت المؤشرات المرشحة الخصائص الديموغرافية، وعوامل الخطر الوعائية، وأسباب السكتة الدماغية، ومقاييس الشدة السريرية الأساسية. تم احتساب المتغيرات المستمرة باستخدام القيم الوسيطة وتوحيد المتغيرات المستمرة. تم احتساب المتغيرات الفئوية باستخدام الفئة الأكثر شيوعا وترميزها باستخدام ترميز أحادي الساخن.
تم تقييم عدة خوارزميات تعلم آلة، بما في ذلك الانحدار اللوجستي، الغابة العشوائية، تعزيز التدرج، آلة الدعم المتجه (SVM)، تعزيز التدرج الشديد، ونماذج آلات تعزيز تدرج الضوء. اتبع تطوير النموذج إطار عمل تحقق متقاطع طبقي من خمسة أضعاف ضمن مجموعة التدريب والتحقق لتقدير أداء التعميم. تم توليد التنبؤات النهائية لمجموعات الاختبار الداخلية والخارجية من خلال متوسط توقعات نماذج مدربة على كل طية تحقق متقاطع. لم تستخدم أي عينات اختبار خارجية أثناء التحقق المتقاطع أو اختيار النماذج.
4. بنية نموذج التعلم العميق
تم تنفيذ بنية هجينة ثلاثية الأبعاد من CNN-ViT لتوقع النتائج من أحجام تصوير بالرنين المغناطيسي متعددة الوسائط. تم تصميم الشبكة لدمج استخراج الميزات المكانية المحلية مع النمذجة السياقية العالمية ضمن إطار موحد. تكونت أحجام الإدخال من صور ثلاثية الأبعاد متعددة القنوات تتم معالجتها من طرف إلى طرف.
تم استخراج الميزات في البداية باستخدام عمود فقري التفافي ثلاثي الأبعاد هرمي مكون من 4 مراحل. تضمنت كل مرحلة طبقتين التفافيتين بحجم نواة 3 × 3 × 3 وحشوة بفوكسل واحد، تليها تطبيع دفعي وتنشيط الوحدة الخطية المصححة. تم تقليل الدقة المكانية تدريجيا باستخدام طبقات تجميع أقصى ثلاثية الأبعاد تم تطبيقها بعد المراحل الثلاث الأولى، بينما زاد عمق قناة الميزات في كل مستوى لالتقاط تمثيلات دلالية على مستوى أعلى. تم تطبيق تنظيم الانسحاب (معدل الانقطاع = 0.1) بعد المرحلة التفافية النهائية لتقليل الإفراط في التركيب. حول العمود الفقري الالتفافي حجم الإدخال بحجم C × D × H × W إلى تمثيل ميزات مدمجة عالية المستوى مع أبعاد مكانية أقل.
تم إعادة تشكيل خريطة الميزات الناتجة إلى تسلسل من الرموز عن طريق تسطيح الأبعاد المكانية بحيث يتوافق عدد الرموز مع:
N = D' x H' x W'
تم نمذجة العلاقات السياقية العالمية بين الرموز باستخدام طبقات ترميز المحول المكونة من شبكات تركيز ذاتي متعددة الرؤوس وشبكات تغذية مستقبلية. تم حساب الاهتمام الذاتي كما يلي:

حيث تشير Q وK وV إلى مصفوفات الاستعلام، المفتاح، والقيم على التوالي، وd يمثل بعد التضمين. تم تطبيق تطبيع الطبقة وفقدان النقاط داخل كل طبقة مشفر لتحسين استقرار التدريب. تكونت وحدة المحول من 3 طبقات مشفر مع 8 رؤوس انتباه وبعد تضمين 256.
بعد ترميز المحول (Transformers)، تم استخراج التمثيل المقابل لرمز التصنيف وتطبيعه. تنتج طبقة خطية متصلة بالكامل مخرجا لوجيتا واحدا لتصنيف الثنائي.
تم تصميم الهيكلية الهجينة المقترحة من CNN-ViT عمدا كنموذج خفيف الوزن وفعال من حيث المعلمات لموازنة القدرة التمثيلية ومخاطر التركيب الزائد. تألف النموذج من 3.79 مليون معلم قابل للتدريب (حوالي 14.4 ميجابايت بدقة fp32)، بما في ذلك 1.38 مليون في العمود الفقري الالتفافي و2.37 مليون في مشفر المحول (Transformer).
5. تدريب نماذج التصوير
تم تدريب نموذج التصوير باستخدام إطار تحقق متقاطع من خمسة طبقات للحفاظ على توزيع النتائج عبر الطيات مع تحسين متانة تقدير الأداء. تم تقسيم مجموعة البيانات إلى مجموعة تدريب-التحقق ومجموعة اختبار داخلية مستقلة باستخدام أخذ عينات طبقية بناء على توزيع النتائج. ضمن مجموعة التدريب والتحقق من الصحة، تم تطبيق التحقق المتقاطع الطبقي الخماسي الطبقي. لكل طي، تم تدريب نموذج التصوير باستخدام مجموعة التدريب وتقييمه باستخدام مجموعة التحقق المقابلة، بينما تم تخصيص مجموعة الاختبار التي تم الاحتفاظ بها حصريا للتقييم النهائي للأداء.
تم تنفيذ تحسين النموذج باستخدام إطار عمل للتعلم العميق على محطة عمل مزودة بمعالج رسومات مع محسن AdamW، ومعدل تعلم 3 × 10⁻5، وانخفاض الوزن 3 × 10⁻4. تم إجراء التدريب باستخدام دفعة مكونة من 8 وحدات لما يصل إلى 200 فترة من الدور. تم استخدام الإنتروبيا المتبادلة الثنائية مع لوجيتس كدالة خسارة.
لمعالجة عدم توازن الفئة، تم حساب عامل وزن الفئة الموجب لكل طية بناء على نسبة العينات السالبة إلى الموجبة ودمجها في دالة الخسارة. تم تطبيق قص المعيار التدرج بمعيار أقصى 0.5 لتحسين الاستقرار العددي أثناء التحسين. تم تمكين التدريب التلقائي المختلط الدقيق لتحسين الكفاءة الحاسوبية.
تم تنفيذ التوقف المبكر عندما فشل أداء التحقق من التحسن بمقدار لا يقل عن 1 × 10⁻4 خلال 30 حقبة متتالية. تم الاحتفاظ بأفضل نقطة تفتيش نموذجية من كل طي. بعد الانتهاء من جميع الطيات، تم توليد توقعات لمجموعات الاختبار الداخلية والخارجية باستخدام كل نموذج خاص بالطيات، وتم الحصول على الاحتمالات النهائية من خلال متوسط التنبؤات عبر النماذج الخمسة لتوليد مخرجات المجموعة.
6. نموذج الاندماج متعدد الوسائط
تم تنفيذ استراتيجية دمج مكدس لدمج التنبؤات المشتقة من التصوير مع المعلومات السريرية المنظمة. كان نموذج التصوير العميق للتعلم العميق ونموذج التنبؤ السريري بدور المتعلمين الأساسيين، واستخدمت احتمالاتهم المتوقعة كميزات إدخال لمتعلم ميتا الانحدار اللوجستي. تم دمج ميزات تفاعل إضافية، بما في ذلك حاصل الضرب والفرق المطلق بين الاحتمالات المتوقعة، لالتقاط المعلومات التكميلية بين التصوير والتنبؤات السريرية.
لمنع تسرب المعلومات، تم تدريب المتعلم الفوقي باستخدام احتمالات متوقعة خارج نطاق التكوين من مجموعة التدريب والتحقق. تم دمج الاحتمالات المتبادلة من النماذج التصويرية والسريرية المصادقة عليها بواسطة معرف المريض لبناء مجموعة بيانات تدريب المتعلمين الفوقيين. بالنسبة لمجموعات الاختبار الداخلية والخارجية، تم استخدام احتمالات مجموعة الاختبار المقابلة من النماذج التصويرية والسريرية كمدخلات للمتعلم المتعلم المدرب لتوليد احتمالات مدمجة. تم تطبيق المتعلم المدرب على كلا مجموعتي الاختبار دون إعادة تجهيز.
7. دراسة الاستئصال
أجريت تجارب الاستئصال لتقييم مساهمات تسلسلات الرنين المغناطيسي الفردية ومكون محول الرؤية باستخدام نفس إعدادات التدريب والتقييم التي كانت النموذج الأساسي. شملت عمليات الاستئصال التسلسلي نماذج التسلسل الواحد، ونماذج ترك تسلسل واحد خارج، والنموذج متعدد المعلمات الكامل. لتقييم مساهمة وحدة محول الرؤية، تم مقارنة البنية الهجينة المقترحة أيضا مع خط أساس CNN فقط، حيث تمت إزالة مشفر المحول مع الحفاظ على نفس العمود الفقري الالتفافي.
8. التحليل الإحصائي
تم تقييم أداء النموذج بشكل منفصل في مجموعة الاختبار الداخلية المستقلة ومجموعة الاختبار الخارجية باستخدام المساحة تحت منحنى خاصية تشغيل المستقبل (AUC) كمقياس تمييز أساسي. تم بناء منحنيات خصائص تشغيل المستقبل (ROC) باستخدام احتمالات متوقعة تولدها كل نموذج. تم أيضا حساب الحساسية والنوعية والدقة العامة لتوصيف أداء التصنيف.
تم توليد النتائج الثنائية باستخدام عتبات محددة وفقا لمؤشر يودن. تم حساب الحساسية والنوعية والدقة لاحقا عند الحد الأمثل. تم تنفيذ جميع التحليلات الإحصائية، وتطوير نماذج التعلم الآلي، وتدريب نماذج التعلم العميق باستخدام حزم برامج الحوسبة العلمية وتعلم الآلة القياسية.